Вашият AI - върху хардуер, който можете да посочите.
Нашата локална GPU инфраструктура в София работи със стека от отворени тегла - Qwen, Gemma, Llama, GLM, Kimi, Nemotron, DeepSeek, Mistral, както и вашите собствени fine-tune модели - който обслужва вашето натоварване. Вашите данни не напускат ЕС. Вашите промптове не обучават следващия модел на някой друг. Месечната ви сметка е число, а не изненада на база токени.
Последно обновено:
Когато API моделът е грешният отговор.
Повечето AI агенции ви продават обвивка около чуждо API. Това е добре за прототипиране. По-малко добре е, когато данните ви са регулирани (финанси, здравеопазване, право, сектори, свързани с отбраната), когато сте обвързани със задължения за резидентност на данните в ЕС (NIS2, GDPR, секторни правила), когато сметката ви на база токени е непредвидима при мащаб и предпочитате да плащате фиксирано число, или когато искате защитим отговор на въпроса, който всеки одитор рано или късно задава: къде отиват нашите данни?
За тези случаи хостваме върху хардуер, който притежаваме, в град в ЕС, в мрежа, която контролираме. Същите агенти, същите резултати - различни компромиси на ниво инфраструктура.
Пет неща във всеки договор за локален LLM.
Хардуер
Резервиран капацитет в нашата локална GPU инфраструктура в София. Инференцията работи върху хардуер, който притежаваме и управляваме; без съжители от страна на инференцията.
Модели
Стек от отворени тегла - Qwen, Gemma, Llama, GLM, Kimi, Nemotron, DeepSeek, Mistral - плюс вашият собствен fine-tune върху който и да е от тях. Няколко модела могат да работят паралелно за маршрутизиране.
Слой за инференция
vLLM с нашето подсилване, мониторинг и ограничаване на заявките за всеки наемател. Същата повърхност като хостван API, различна основа отдолу.
Мрежова свързаност
Тунел през Tailscale или WireGuard между вашата среда и нашата инфраструктура. Без публичен достъп до крайната точка за инференция.
Пакет за съответствие
DPA · SCCs · диаграма на потока от данни · политика за съхранение · месечен преглед на сигурността. Подписан преди да потекат каквито и да е данни.
API под точката на пресичане. Локално над нея.
Точката на пресичане е приблизително 8-12 милиона токена месечно, в зависимост от модела. Под нея печели ценообразуването през API. Над нея печели фиксираната месечна такса - обикновено със значителна разлика. Моделираме и двата варианта с вашите реални прогнози за потребление по време на Discovery; отговорът е математически, а не въпрос на мнение.
- По-евтино при малък обем - под ~8M токена месечно
- Без първоначален ангажимент; включвате и изключвате свободно
- Сметката расте с потреблението - предвидима, докато не престане да бъде
- Данните напускат вашата юрисдикция; условията на доставчика определят съхранението
- Доставчикът решава пътя за надграждане на модела
- По-евтино при голям обем - над ~8M токена месечно, често с голяма разлика
- Фиксирана месечна такса - финансовият екип може да я моделира
- Данните остават в ЕС, върху хардуер, който можете да посетите
- Без изтичане на данни за обучение; вашите промптове не се съхраняват след договорения период
- Ротацията на модели е включена; движите се, когато светът на отворените тегла се движи
Три добавки, които клиентите избират допълнително.
Fine-tuning върху вашите данни
Собствен fine-tune върху базовия модел. Еднократна инженерна работа плюс месечна надбавка за хостинг. Често срещан модел: специфична за областта терминология, вътрешен тон, структурирани изходни данни, които базовият модел не произвежда надеждно.
Ротация на модели
Започвате с един модел, преминавате към друг или пускате няколко паралелно за маршрутизиране - без предоговаряне на договора. Когато стекът от отворени тегла се развива, вие се движите с него.
Среда за A/B тестване
Пускате реалното си натоварване паралелно срещу еквивалента през API за няколко седмици. Измервате действителната разлика върху вашите данни, а не върху бенчмарк.
GDPR · готовност за NIS2 · резидентност в ЕС · без обучение върху вашите данни.
Данните остават в ЕС. Ние сме обработващ в ЕС; вие сте администраторът. Цялата инференция се извършва в София. Цялото съхранение - логове, история на промптовете в рамките на договорения период на съхранение - е върху инфраструктура в ЕС, която управляваме. Одитните логове, контролът на достъпа и реакцията при инциденти са документирани за NIS2. Не обучаваме върху вашите данни. Не ги продаваме. Вашите промптове и отговори не се съхраняват след договорения период на съхранение. Подписваме DPA, преди да потекат каквито и да е данни; стандартният покрива повечето случаи, а вашия редактираме, когато имате специфични изисквания.
Пет неща, които хората питат.
Какво става, ако хардуерът ви откаже?
Можем ли да посетим хардуера?
Можете ли вместо това да пуснете модела в нашия офис?
Какво се случва, когато излязат по-добри модели с отворени тегла?
Може ли локалният LLM да извиква същите инструменти, които използват API агентите?
Кажете ни какви са данните и обемът ви.
Моделираме API срещу локално за вашите реални числа и изпращаме писмено сравнение. Безплатно.