Локален LLM, хостван

Вашият AI - върху хардуер, който можете да посочите.

Нашата локална GPU инфраструктура в София работи със стека от отворени тегла - Qwen, Gemma, Llama, GLM, Kimi, Nemotron, DeepSeek, Mistral, както и вашите собствени fine-tune модели - който обслужва вашето натоварване. Вашите данни не напускат ЕС. Вашите промптове не обучават следващия модел на някой друг. Месечната ви сметка е число, а не изненада на база токени.

Последно обновено:

Защо съществува това

Когато API моделът е грешният отговор.

Повечето AI агенции ви продават обвивка около чуждо API. Това е добре за прототипиране. По-малко добре е, когато данните ви са регулирани (финанси, здравеопазване, право, сектори, свързани с отбраната), когато сте обвързани със задължения за резидентност на данните в ЕС (NIS2, GDPR, секторни правила), когато сметката ви на база токени е непредвидима при мащаб и предпочитате да плащате фиксирано число, или когато искате защитим отговор на въпроса, който всеки одитор рано или късно задава: къде отиват нашите данни?

За тези случаи хостваме върху хардуер, който притежаваме, в град в ЕС, в мрежа, която контролираме. Същите агенти, същите резултати - различни компромиси на ниво инфраструктура.

Какво е включено

Пет неща във всеки договор за локален LLM.

  • Хардуер

    Резервиран капацитет в нашата локална GPU инфраструктура в София. Инференцията работи върху хардуер, който притежаваме и управляваме; без съжители от страна на инференцията.

  • Модели

    Стек от отворени тегла - Qwen, Gemma, Llama, GLM, Kimi, Nemotron, DeepSeek, Mistral - плюс вашият собствен fine-tune върху който и да е от тях. Няколко модела могат да работят паралелно за маршрутизиране.

  • Слой за инференция

    vLLM с нашето подсилване, мониторинг и ограничаване на заявките за всеки наемател. Същата повърхност като хостван API, различна основа отдолу.

  • Мрежова свързаност

    Тунел през Tailscale или WireGuard между вашата среда и нашата инфраструктура. Без публичен достъп до крайната точка за инференция.

  • Пакет за съответствие

    DPA · SCCs · диаграма на потока от данни · политика за съхранение · месечен преглед на сигурността. Подписан преди да потекат каквито и да е данни.

Кога локалното печели по цена

API под точката на пресичане. Локално над нея.

Точката на пресичане е приблизително 8-12 милиона токена месечно, в зависимост от модела. Под нея печели ценообразуването през API. Над нея печели фиксираната месечна такса - обикновено със значителна разлика. Моделираме и двата варианта с вашите реални прогнози за потребление по време на Discovery; отговорът е математически, а не въпрос на мнение.

Хостван API
плащане на токен · мащабира се с потреблението
  • По-евтино при малък обем - под ~8M токена месечно
  • Без първоначален ангажимент; включвате и изключвате свободно
  • Сметката расте с потреблението - предвидима, докато не престане да бъде
  • Данните напускат вашата юрисдикция; условията на доставчика определят съхранението
  • Доставчикът решава пътя за надграждане на модела
Локален LLM на нашия DGX
фиксирана месечна такса · резидентен в ЕС · независим от модела
  • По-евтино при голям обем - над ~8M токена месечно, често с голяма разлика
  • Фиксирана месечна такса - финансовият екип може да я моделира
  • Данните остават в ЕС, върху хардуер, който можете да посетите
  • Без изтичане на данни за обучение; вашите промптове не се съхраняват след договорения период
  • Ротацията на модели е включена; движите се, когато светът на отворените тегла се движи
Опционални добавки

Три добавки, които клиентите избират допълнително.

  • Fine-tuning върху вашите данни

    Собствен fine-tune върху базовия модел. Еднократна инженерна работа плюс месечна надбавка за хостинг. Често срещан модел: специфична за областта терминология, вътрешен тон, структурирани изходни данни, които базовият модел не произвежда надеждно.

  • Ротация на модели

    Започвате с един модел, преминавате към друг или пускате няколко паралелно за маршрутизиране - без предоговаряне на договора. Когато стекът от отворени тегла се развива, вие се движите с него.

  • Среда за A/B тестване

    Пускате реалното си натоварване паралелно срещу еквивалента през API за няколко седмици. Измервате действителната разлика върху вашите данни, а не върху бенчмарк.

Съответствие и поток от данни

GDPR · готовност за NIS2 · резидентност в ЕС · без обучение върху вашите данни.

Данните остават в ЕС. Ние сме обработващ в ЕС; вие сте администраторът. Цялата инференция се извършва в София. Цялото съхранение - логове, история на промптовете в рамките на договорения период на съхранение - е върху инфраструктура в ЕС, която управляваме. Одитните логове, контролът на достъпа и реакцията при инциденти са документирани за NIS2. Не обучаваме върху вашите данни. Не ги продаваме. Вашите промптове и отговори не се съхраняват след договорения период на съхранение. Подписваме DPA, преди да потекат каквито и да е данни; стандартният покрива повечето случаи, а вашия редактираме, когато имате специфични изисквания.

ЕС
Инференцията и съхранението остават в региона
Нула
Обучение върху вашите промптове или отговори
DPA
Подписан преди да потекат каквито и да е данни
NIS2
Одитен лог, контрол на достъпа и реакция при инциденти - документирани
Често задавани въпроси

Пет неща, които хората питат.

Какво става, ако хардуерът ви откаже?
Два сценария, покрити в runbook-а: мек отказ се пренасочва към горещ резерв в същия офис; тежък отказ преминава към API за времето на инцидента. Непрекъснатостта е част от договора.
Можем ли да посетим хардуера?
Да. София е гостоприемна.
Можете ли вместо това да пуснете модела в нашия офис?
Да - ние специфицираме хардуера, инсталираме го и го управляваме отдалечено. По-висок първоначален разход; по-нисък текущ.
Какво се случва, когато излязат по-добри модели с отворени тегла?
Ротираме. Договорът покрива надгражданията на модели; не плащате допълнително, за да преминете от Gemma 4 към това, което излезе следващата година.
Може ли локалният LLM да извиква същите инструменти, които използват API агентите?
Да. Слоят с инструменти е независим от модела - типизирани обвивки около вашите системи с права на ниво роля, прилагани преди извикването. Моделът зад агента е решение за маршрутизиране, а не пренаписване на архитектурата.
AI, който вече работи

Кажете ни какви са данните и обемът ви.

Моделираме API срещу локално за вашите реални числа и изпращаме писмено сравнение. Безплатно.

На живо · работи на Gemma-4 · хардуер в София