Case study

AI видео етикетиране - 119 TB видеоматериал, кадър по кадър

Глобална компания за събития разполагаше с десетилетие видеоматериал - камери от главната сцена, интервюта на място, дронови кадри, b-roll - който никой не можеше да претърси. Фино донастроихме vision-language модел на Mac Studio M2 Ultra 512 GB; извършихме историческата обработка на конфигурация с Mac Mini M4 Pro, свързана през 10 GbE със Synology NAS; и поставихме GDPR позицията от правилната страна на границата за кадрите с публика, където огромната част от посетителите никога не са давали изрично съгласие за обработка на лицеви данни. Резултатът: архивът отговаря на заявки като „сцена, в която определен лектор е на сцената и не носи черното си кожено яке“ за секунди.

Обработен исторически видеоматериал

119 TB

кадър по кадър

Пропускливост на пайплайна

8 fps

устойчиво, пикове до 12

Нова сесия → индексирана

<1 час

за типично качване от 50-100 GB

Последно обновено:

01. Проблемът

Десетилетие видеоматериал, практически непретърсваем

Агенцията организира големи индустриални събития по целия свят. За едно десетилетие бяха натрупали кадри от камери на главната сцена (няколко ъгъла, часове на събитие), интервюта на място (десетки лектори на събитие), дронови прелитания, B-roll, паралелни сесии, кадри с публиката и маркетингови монтажи. Около 119 TB видео, стоящо на студено съхранение, практически непретърсваемо. Намирането на конкретен момент („кога еди-кой си каза X за първи път в панела?“) означаваше изследовател да прекара часове в превъртане на времевите линии. Преизползването на кадри за маркетинг означаваше гадаене. Два взаимно усилващи се проблема:

  1. Търсене по съдържание, а не по метаданни. Файловете бяха именувани по събитие и дата; това беше всичко. Заявка като „момент от кийноут, в който Person A е сам на сцената и не носи кожено яке“ изискваше човек да знае кое събитие, кой кийноут, коя камера и приблизително кога.
  2. GDPR при исторически кадри. Огромната част от посетителите в по-старите кадри с публика никога не са давали изрично съгласие за обработка на лицеви данни. Изграждането на етикетиран, претърсваем архив, който включва тези хора, беше правно невъзможно, освен ако пайплайнът внимателно не разделяше границата на съгласието.
02. Стекът, който изградихме

Apple Silicon при 8 fps, кадър по кадър

Хардуер

  • Конфигурация за обучение на фината донастройка

    Mac Studio с M2 Ultra и 512 GB унифицирана памет. Архитектурата с 512 GB унифицирана памет беше правилният избор за обучение на vision-language фина донастройка в този домейн мащаб - целият модел плюс работният набор стоят в паметта, без претоварване от PCIe / изливане на диск.

  • Продукционна конфигурация за обработка - Synology DS2422+ NAS

    AMD Ryzen V1500B (4 ядра @ 2.2 GHz), 12 GB RAM, 10 GbE (Synology E10G18-T1). Роля: съхранение на архива от 119 TB, хостинг на фронтенда и базата данни с метаданните за всеки кадър.

  • Продукционна конфигурация за обработка - Mac Mini M4 Pro (2024)

    12 ядра (8 производителни + 4 енергоефективни), 24 GB RAM, 16-ядрен Neural Engine, 10 GbE. Роля: специализиран енджин за обработка на видео както за историческата обработка, така и за приемането в реално време.

  • Мрежа

    10 Gigabit Ethernet между NAS и Mac Mini. Теоретично 1.25 GB/s; устойчиво ~800-1000 MB/s с наслагването. Мрежата никога не беше тясното място.

Модели

  • Vision-language модел с фина донастройка за домейна

    Обучен върху етикетиран корпус, съставен от водещите събития на агенцията - лектори, разположения на сцената, специфична за събитията иконография, повтарящи се спонсори и зали. Фината донастройка повиши точността на разпознаване на повтарящите се хора и заземяването върху специфичната за агенцията сценография (един и същ конферентен брандинг година след година) далеч над това, което дава генеричен готов VLM.

  • Стек за лицево разпознаване

    Модел за детекция + модел за лицеви ембединги, работещи за всеки кадър срещу регистър от 250 лица на повтарящи се лектори и екип. Детекция при 40-60 fps; генериране на ембединги при 30-40 fps; сравнението срещу регистъра от 250 лица добавя пренебрежимо наслагване.

  • Обща пропускливост на пайплайна

    ~8-12 кадъра в секунда устойчиво, включително записите в базата данни и обработката на грешки. Neural Engine на M4 Pro поема инференса; CPU + 10 GbE поемат I/O.

03. Схема на метаданните за всеки кадър

Всеки кадър при 1 fps се етикетира с

Всеки кадър при честота на семплиране 1 fps се етикетира с:

schema.ts
1Facial traits// анонимизирани по подразбиране; идентичност се прикача само когато има налично съгласие
2Scenery description// тип сцена, зала, осветление, на закрито / на открито
3Activity / event description// какво моделът смята, че се случва
4Dominant colour palette//
5On-screen text// OCR обработка
6Audio-derived speaker turns// когато аудиото е синхронизирано
04. GDPR-безопасен пайплайн

Трудното архитектурно решение

Модел на данни в движение

Юристите на агенцията одобриха модел на данни в движение: пълният анализ на всеки кадър се извършва в паметта; съхраняват се само метаданни, които не идентифицират повторно хора без съгласие.

Граници на търсенето в кадри с публика

Кадрите с публика са претърсваеми по облекло, поза, гъстота, тип сцена - никога по лице - освен ако човекът не е в регистъра за съгласие на агенцията.

Регистърът за съгласие като първокласно хранилище

Регистърът за съгласие е първокласно хранилище на данни, което се чете преди записването на каквито и да е метаданни, съдържащи лични данни.

05. Реализация

Шест седмици обучение на фината донастройка, след това 28 дни историческа обработка

  1. Shipped
    01Седмици 1-6 · Обучение на фината донастройка

    Изградихме етикетирания обучителен корпус (малък асистент за етикетиране предлагаше етикети; човек ги одобряваше). Обучихме vision-language фината донастройка на Mac Studio M2 Ultra. Моделът разпозна повтарящите се лектори на агенцията, типичните им сценични облекла, брандинг таблата на агенцията и малък набор от повтарящи се зали без объркване.

  2. Shipped
    02~4 седмици · Историческа обработка

    С готовата фина донастройка продукционната конфигурация (NAS + Mac Mini M4 Pro) обработи архива от 119 TB кадър по кадър при 1 fps. Връзката 10 GbE държеше I/O на хранилището пред Neural Engine; конфигурацията работи 24/7 през целия период.

  3. Shipped
    03Канал в реално време

    Новите качвания (типична доставка от събитие 50-100 GB на сесия) минават през същия пайплайн автоматично. Мрежовият трансфер при 800-1000 MB/s поставя качване от 100 GB на NAS за под две минути; обработката на всеки кадър при 8 fps прекарва същите 100 GB през инференс за ~30-40 минути. От край до край от качване до индексиране: под час за типична сесия от събитие, единични минути за кратки интервю кътове.

  4. Shipped
    04Интерфейс за търсене

    Поле за заявка на естествен език, зад което стои семантично търсене в метаданните за всеки кадър. Заявката „кадър с дрон над залата при залез на втория ден“ и заявката „Person A говори в панел без обичайното си кожено яке“ работят и двете; втората е тази, която маркетинг екипът използва най-често.

Трудностите, които срещнахме

  • Датасетът за фината донастройка беше внимателната работа. Етикетирането на стотици кадри качествено изисква човек; етикетирането на хиляди изисква система. Моделът с асистент за етикетиране ускори тази работа приблизително 5× и беше нещото с най-голям ефект, което изградихме във Фаза 1.
  • GDPR границата като архитектура, а не като филтър. Третирането на съответствието като „филтрирай изхода“ беше неприемливо за юристите. Третирането му като „разклони пайплайна на границата на съгласието, така че личните данни никога да не напускат паметта, освен ако няма запис за съгласие“ беше архитектурата, която те одобриха.
  • RAM паметта на NAS беше ограничението, а не изчислителната мощ. DS2422+ има 12 GB RAM; работният набор на базата данни беше настроен да се побере. Стратегията за кеширане, планирането на заявките и шардирането на индекса по събитие имаха по-голямо значение, отколкото биха имали на по-мощен сървър.
06. Числата

Сметката зад 119 TB за 28 дни

1 TB 4K видео при типични битрейтове
~30 часа видеоматериал
Кадри при 1 fps на TB
~108,000
Пропускливост на пайплайна (устойчиво състояние)
8 fps
Чисто изчислително време на TB
3.75 часа
С 50% наслагване (записи в базата данни, обработка на грешки, предварително зареждане)
5.6 часа на TB
Общо за 119 TB
666 часа ≈ 28 дни непрекъснато
AI, който вече работи

Медиен архив, който не можете да търсите?

Моделът на vision-language пайплайна - модел с фина донастройка за домейна, GDPR-безопасен поток на данните, обработка в реално време и на исторически материал върху стандартен хардуер с Apple Silicon - работи за всяка голяма медийна библиотека. 30-минутна диагностика минава през формата на вашия архив, вашата позиция по съответствие и колко би струвал един хибриден пайплайн.

На живо · работи на Gemma-4 · хардуер в София