Четирите облачни AI, с които разработваме.
Anthropic Claude. OpenAI GPT. Google Gemini. xAI Grok. Четирима доставчици, четири семейства модели, четири темпа на издаване - всеки силен в различен тип работа. Повечето проекти тръгват с един; някои маршрутизират през няколко. Ето какво разглеждаме, какво всеки доставчик обикновено прави добре и кога нашето предложение за локален LLM е по-добрият отговор.
Последно обновено:
Изборът на облачен доставчик, преди да познавате натоварването, е избор на сляпо.
Решението обикновено идва рано - при първия разговор, в първия абзац на заданието - и заключва повече, отколкото изглежда. Доставчикът, който изберете, оформя бюджета за латентност, повърхността за извикване на инструменти, потока на данните, ценовата крива при мащаб и цената на миграцията, когато следващият по-добър модел се появи другаде. Нищо от това не се компенсира с „ще сменим по-късно“; смяната по-късно е интеграционен проект, а не превключвател.
Четиримата доставчици, с които разработваме - Anthropic, OpenAI, Google, xAI - са силни в различен тип работа. В повечето ангажименти избираме според задачата и се заключваме към един само когато оперативната простота си заслужава компромиса. Изборът е резултат от Discovery, а не маркетингово решение.
Критериите за избор, които прилагаме във всеки проект.
Ценови модел
На токен, степенувано по способности при всеки доставчик. Имената на нивата се различават - водещ модел за разсъждение, балансиран работен кон, компактен и бърз - и абсолютната стойност за всяко ниво се променя всяко тримесечие. Моделираме прогнозния Ви обем спрямо текущите публикувани цени и реалистичния микс между водещи и рутинни извиквания; разликата в цената между нивата обикновено е 5×-20×, така че маршрутизацията има по-голямо значение от обявената цена.
Профил на латентността
Латентността до първия токен при стрийминг с модели от водещ клас е под секунда при нормално натоварване; извикванията с интензивно разсъждение или разширено мислене отнемат по няколко секунди. Публикуваните от доставчиците бенчмаркове са направени на настроен хардуер и кратки промпти - полезни като таван, а не като прогноза за реалния Ви микс от промпти. Измерваме p50 и p95 върху заснета извадка от Вашите промпти по време на Discovery.
Инструменти и агентни способности
Извикването на функции е базово навсякъде. Паралелното използване на инструменти се поддържа от всеки водещ модел в набора; оперативното качество варира. Computer use, поддръжката на MCP, примитивите за агентни цикли и надеждността на структурирания изход са мястото, където доставчиците се разминават - и където правилният избор зависи от това какво всъщност трябва да прави Вашият агент.
Обработка на данни и DPA
Всеки доставчик публикува Data Processing Addendum. Сигналите, които разглеждаме: настройката по подразбиране за обучение върху входните данни, задържането по подразбиране и възможността за промяната му, разкриването на подизпълнители и опциите за резидентност в ЕС. Нито един от четиримата не се обучава върху входните данни от API по подразбиране през 2026 г. Стойностите по подразбиране за задържане варират; инференция с резидентност в ЕС е достъпна при трима от четирима чрез маршрутизиране през облачна платформа (Vertex AI, Azure, AWS Bedrock). Когато резидентността в ЕС по облачния път не е приемлива, нашето предложение за локален LLM поема ролята.
Набор от модели и темп на издаване
Всеки доставчик предлага компактен набор - водещ модел за разсъждение, балансиран работен кон, компактен и бърз - който се вписва в един и същ модел на маршрутизация. Променливата е темпът на издаване: към момента на писане Anthropic и OpenAI издават по-често от Google или xAI. Правилният избор днес не е непременно правилният избор след две тримесечия; маршрутизиращият слой е това, което прави тази промяна поносима.
Един доставчик или маршрутизиране през няколко.
И двете форми влизат в продукция всеки ден. Изборът следва микса от натоварвания, оперативната повърхност, която искате да поддържате, и толерантността Ви към проблема със следващия модел, появил се другаде. Внедряваме и в двете форми; ето как обикновено се разпределя компромисът.
- По-малко координационни разходи - един DPA, една сметка, една верига за дежурства
- По-бърз MVP - избирате един, пускате, итерирате; инструментите се интегрират срещу един SDK
- Концентриран риск - извеждането на модели от употреба, инцидентите с латентност и промените в цените удрят всички потоци наведнъж
- Таванът на способностите се движи с темпа на издаване на избрания доставчик
- Смяната на доставчик по-късно е интеграционен проект, а не превключвател
- Най-подходящият за всяко извикване - разсъждението при един доставчик, структурираният изход при друг, зрението при трети
- Вградено резервиране - когато един доставчик има инцидент, останалите поемат натоварването
- Диверсифицирани разходи - цената на водещия модел се амортизира през по-евтини доставчици за рутинните извиквания
- Способностите остават актуални - нов модел от който и да е доставчик влиза в маршрутизиращия слой с промяна в конфигурацията
- По-голяма интеграционна повърхност - четири DPA, четири сметки, изисква повече оперативна дисциплина
Как маршрутизираме, по доставчик.
Anthropic Claude
По подразбиране за разсъждение с дълъг контекст, внимателна работа с инструменти и агентни цикли, където рискът да излязат извън релси е по-важен от чистата скорост. Нивото Sonnet носи по-голямата част от продукционното натоварване в нашите внедрявания; Opus поема тежките извиквания с разсъждение; Haiku покрива високообемната рутина.
OpenAI GPT
По подразбиране за надеждност на структурирания изход и най-голямата зряла екосистема от инструменти и интеграции. Силен при спазване на JSON схема и при модели на разклонено извикване на функции. Нивата mini и nano поемат рутинните натоварвания на атрактивна цена.
Google Gemini
По подразбиране за мултимодални натоварвания - изображение, аудио и дълги документи като вход - и с най-дългия контекстен прозорец в набора. Силно съответствие, когато инференция с резидентност в ЕС през Vertex AI е твърдо изискване. Нивото Flash е една от най-евтините способни опции във високообемното ниво сред четиримата доставчици.
xAI Grok
По подразбиране за задачи с информация в реално време, където моделът се нуждае от текущото състояние на света. Използва се избирателно, а не като работен кон; съчетава се добре с останалите като резервен вариант за актуални събития в агенти с интензивно проучване.
Какво всъщност предлага всеки доставчик.
Anthropic Claude
Цени - на токен, степенувани в набора Opus / Sonnet / Haiku. Налично е кеширане на промпти за компресиране на натоварвания с повтарящ се префикс. Латентност - стрийминг под секунда при клас Sonnet за кратки промпти; няколко секунди при извиквания с разширено мислене. Инструменти - извикване на функции, паралелно използване на инструменти, computer use и агентна рамка за пакетиране на многостъпкови работни потоци. Обработка на данни - подписан DPA с разкриване на подизпълнители; без обучение върху входните данни от API по подразбиране. Инференция с резидентност в ЕС е достъпна през AWS Bedrock и Google Cloud Vertex AI.
OpenAI GPT
Цени - на токен в семейството GPT-5 с варианти full / mini / nano; моделите за разсъждение са с отделна ценова стълбица. Латентност - под секунда при по-малките варианти; няколко секунди при моделите за разсъждение. Инструменти - извикване на функции, паралелно използване на инструменти, структурирани изходи със строг режим на схема и рамка Agents. Обработка на данни - наличен е стандартен DPA; отказът от обучение върху входните данни от API е по подразбиране за платените API нива. Инференция с резидентност в ЕС е достъпна през Azure OpenAI Service.
Google Gemini
Цени - на токен в семейството Gemini 2.5 с нива Pro / Flash / Flash-Lite. Латентност - под секунда при ниво Flash; по-дълга при Pro за извиквания с разсъждение. Инструменти - извикване на функции, паралелно използване на инструменти, native мултимодалност (изображение, аудио, видео, PDF) и най-дългият публикуван контекстен прозорец в набора. Обработка на данни - DPA през условията на Google Cloud; без обучение върху входните данни от API в платения път през Vertex AI. Инференция с резидентност в ЕС е достъпна чрез избор на регион във Vertex AI.
xAI Grok
Цени - на токен в семейството Grok-4 с варианти full / mini / fast. Латентност - под секунда при нивата mini и fast. Инструменти - извикване на функции, структурирани изходи и режим за информация в реално време, който извлича текущото състояние на света от инфраструктурата на xAI. Обработка на данни - DPA е наличен на enterprise нивото; стойностите по подразбиране за обучение върху входните данни варират според нивото и трябва да се проверяват за всеки проект. Позицията по резидентност в ЕС е по-малко зряла, отколкото при другите трима доставчици.
Пет неща, които хората питат.
Как решавате кой доставчик да използвате за дадена задача?
Какво става, ако доставчикът, който изберем, изведе от употреба модел, от който зависим?
Как подхождате към резидентността на данните при регулирани натоварвания?
Можем ли да сменим доставчика, след като проектът влезе в продукция?
Какъв е Вашият подход към маршрутизацията на практика?
Кажете ни Вашия микс от натоварвания.
Моделираме API спрямо Local за Вашите реални числа и изготвяме писмена препоръка за маршрутизация през четиримата доставчици по-горе. Безплатно.