Услуга · Компютърно зрение

Прочетете какво има в изображението, видеото и сканирания PDF.

Vision-language моделите през 2026 г. са достатъчно добри, че „извлечи X от това изображение“ вече не е изследователски проект. Изграждаме продукционни пайплайни за разбиране на документи, продуктови изображения, контрол на качеството в производството и логистика - използвайки VLM, когато са подходящи, класическо компютърно зрение, когато е по-евтино, и двете, когато проблемът го заслужава.

Последно обновено:

Проблемът

Часове на ден за четене на това, което никой няма време да чете.

Значителна част от бизнес операциите се движи от изображения и PDF файлове, които никой няма време да прочете внимателно - фактури, договори, продуктови снимки, товарителници, записи от охранителни камери, качени от клиенти касови бележки. Работата изяжда часове на ден; възлагането ѝ навън добавя забавяне, без да решава разхода в дългосрочен план.

Стандартният OCR улавя лесните случаи. Съвременните VLM улавят останалите, ако изградите пайплайна внимателно - с проверка, обработка на гранични случаи и ясна ескалация, когато моделът не е сигурен.

Какво включва

Шест неща, които получава всеки пайплайн за зрение.

  • Проучване

    Вземаме извадка от вашите реални изображения, документи или видео. Идентифицираме вариациите, които чупят наивните подходи.

  • Проектиране на пайплайна

    Само VLM, класическо компютърно зрение или хибрид - коя комбинация отговаря на вашите цели за разход, латентност и точност.

  • Имплементация

    Типизирана схема за извличане, оценка на увереност, човек в процеса при изходи с ниска увереност.

  • Валидационна рамка

    Златен набор от 50-500 примера; регресионно тестване при всяко обновяване на модела.

  • Продукционно внедряване

    Асинхронна опашка, мониторинг, одитен журнал на всяко решение.

  • Месечен преглед

    Какви гранични случаи минават през системата, къде да се донастрои, кога моделът има нужда от обновяване.

Как работи отвътре

Защо чистият OCR и чистият VLM се провалят - и хибридът, който работи.

И двете крайности имат разпознаваем режим на отказ. Хибридният пайплайн е това, което оцелява в продукция.

Къде засядат пайплайните само с OCR или само с VLM
често срещани модели, които сме наблюдавали отблизо
  • Само OCR - чуплив при вариации в оформлението, отказва при ръкопис, смесени азбуки, сканирания с ниско качество
  • Само OCR - без семантично разбиране, без разсъждение какво означава документът
  • Само VLM - твърде скъп при продукционен обем; разходът на страница не мащабира
  • Само VLM - увереността е скрита вътре в отговора, трудно е да се постави праг върху нея
  • Без одитна следа; невъзможно е да се разследва, когато извличане се обърка месеци по-късно
Как изграждаме хибрида
първо класическо зрение · VLM при граничните случаи · човешки преглед при ниска увереност
  • Класическото компютърно зрение поема високообемните и лесни случаи на ниска цена
  • VLM поема граничните случаи - редки, скъпи, но ограничени по брой
  • Оценка на увереност за всеки изход задава кога влиза човешки преглед
  • Разходът остава ограничен, докато обемът расте
  • Одитен журнал и оценка на увереност за всяко решение - може да се дебъгва месеци по-късно
Приложения, които изграждаме

Реални пайплайни за зрение в продукция.

  • Извличане от фактури и касови бележки

    Редове, суми, ДДС, данни за страните. Съпоставяне с поръчки. Маркиране на аномалии. Счетоводството приключва по-бързо.

  • Интелигентна обработка на договори

    Извличане на дати, страни, задължения и условия за подновяване от PDF файлове с произволно оформление. Ускорява правния преглед 3-5×.

  • Контрол на качеството на продуктовите снимки

    Маркиране на грешно етикетирани SKU, проверка дали снимката съответства на каталожното описание, генериране на alt текст и описания.

  • Контрол на качеството в производството

    Визуално откриване на дефекти по снимки от производствената линия. Често хибриден пайплайн от VLM и класическо зрение.

  • Логистични товарителници

    Четене на транспортни документи, съпоставяне със записите в ERP системата, маркиране на несъответствия преди стоката да напусне склада.

  • Сигурност и наблюдение

    Обобщаване на видео, откриване на събития, генериране на сигнали от наблюдаван поток.

Казус

Всеки кадър от 119 TB видеоматериал, етикетиран - и търсим с подсказка на естествен език.

Глобална компания за събития имаше десетилетие видеоматериал - основни презентации, интервюта, дронови кадри, b-roll - през който никой не можеше да търси. Донастроихме vision-language модел върху повтарящите се лектори, сценични оформления и брандиране на агенцията, така че да разпознава хората и местата, които имат значение. След това обработихме архива от 119 TB при устойчива пропускливост от 8 кадъра в секунда - около 28 дни непрекъсната обработка - и изградихме интерфейс за търсене на естествен език върху метаданните за всеки кадър. Кадрите с публика останаха в строга GDPR граница: самоличност се прикачва към кадър само когато лицето е в регистъра на съгласията; всичко останало е търсимо по облекло, поза, обстановка, текст на екрана и доминираща палитра - никога по лице. Новите качвания минават от подаване до пълно индексиране за под час.

119 TB
Исторически видеоматериал, индексиран кадър по кадър
~28 дни
Непрекъсната обработка на историческия архив
8 fps
Устойчива пропускливост на пайплайна
<1 час
От качване до индексиране за нов видеоматериал от събитие
Често задавани въпроси

Три неща, които хората винаги питат.

Какво става с ръкописния текст?
Съвременните VLM се справят добре с ръкопис на добре представените латински писмености. Кирилицата, гръцката, арабската и други по-слабо представени писмености са по-трудни; тестваме върху извадка от вашите реални документи, преди да поемем ангажимент за целева точност.
Какво става с видео на живо?
Да. Изградили сме няколко пайплайна в реално време (предимно за сигурност и наблюдение). Разходът за секунда видео се натрупва бързо - консервативни сме относно това кога този инструмент е правилният.
Може ли да работи на нашия хардуер?
Да - на DGX Spark или на ваш хардуер. Особено важно, когато изображенията са чувствителни (медицински, охранителни, правни).
AI, който вече работи

Донесете ни документите, които никой няма време да прочете.

30-минутен диагностичен разговор преглежда какво обработвате днес и колко би струвал един хибриден пайплайн. Безплатно; писмено обобщение и в двата случая.

На живо · работи на Gemma-4 · хардуер в София