119 TB
кадър по кадър
8 fps
устойчиво, пикове до 12
<1 час
за типично качване от 50-100 GB
AI видео етикетиране - 119 TB видеоматериал, кадър по кадър
Глобална компания за събития разполагаше с десетилетие видеоматериал - камери от главната сцена, интервюта на място, дронови кадри, b-roll - който никой не можеше да претърси. Фино донастроихме vision-language модел на Mac Studio M2 Ultra 512 GB; извършихме историческата обработка на конфигурация с Mac Mini M4 Pro, свързана през 10 GbE със Synology NAS; и поставихме GDPR позицията от правилната страна на границата за кадрите с публика, където огромната част от посетителите никога не са давали изрично съгласие за обработка на лицеви данни. Резултатът: архивът отговаря на заявки като „сцена, в която определен лектор е на сцената и не носи черното си кожено яке“ за секунди.
119 TB
кадър по кадър
8 fps
устойчиво, пикове до 12
<1 час
за типично качване от 50-100 GB
Последно обновено:
Десетилетие видеоматериал, практически непретърсваем
Агенцията организира големи индустриални събития по целия свят. За едно десетилетие бяха натрупали кадри от камери на главната сцена (няколко ъгъла, часове на събитие), интервюта на място (десетки лектори на събитие), дронови прелитания, B-roll, паралелни сесии, кадри с публиката и маркетингови монтажи. Около 119 TB видео, стоящо на студено съхранение, практически непретърсваемо. Намирането на конкретен момент („кога еди-кой си каза X за първи път в панела?“) означаваше изследовател да прекара часове в превъртане на времевите линии. Преизползването на кадри за маркетинг означаваше гадаене. Два взаимно усилващи се проблема:
- Търсене по съдържание, а не по метаданни. Файловете бяха именувани по събитие и дата; това беше всичко. Заявка като „момент от кийноут, в който Person A е сам на сцената и не носи кожено яке“ изискваше човек да знае кое събитие, кой кийноут, коя камера и приблизително кога.
- GDPR при исторически кадри. Огромната част от посетителите в по-старите кадри с публика никога не са давали изрично съгласие за обработка на лицеви данни. Изграждането на етикетиран, претърсваем архив, който включва тези хора, беше правно невъзможно, освен ако пайплайнът внимателно не разделяше границата на съгласието.
Apple Silicon при 8 fps, кадър по кадър
Хардуер
Конфигурация за обучение на фината донастройка
Mac Studio с M2 Ultra и 512 GB унифицирана памет. Архитектурата с 512 GB унифицирана памет беше правилният избор за обучение на vision-language фина донастройка в този домейн мащаб - целият модел плюс работният набор стоят в паметта, без претоварване от PCIe / изливане на диск.
Продукционна конфигурация за обработка - Synology DS2422+ NAS
AMD Ryzen V1500B (4 ядра @ 2.2 GHz), 12 GB RAM, 10 GbE (Synology E10G18-T1). Роля: съхранение на архива от 119 TB, хостинг на фронтенда и базата данни с метаданните за всеки кадър.
Продукционна конфигурация за обработка - Mac Mini M4 Pro (2024)
12 ядра (8 производителни + 4 енергоефективни), 24 GB RAM, 16-ядрен Neural Engine, 10 GbE. Роля: специализиран енджин за обработка на видео както за историческата обработка, така и за приемането в реално време.
Мрежа
10 Gigabit Ethernet между NAS и Mac Mini. Теоретично 1.25 GB/s; устойчиво ~800-1000 MB/s с наслагването. Мрежата никога не беше тясното място.
Модели
Vision-language модел с фина донастройка за домейна
Обучен върху етикетиран корпус, съставен от водещите събития на агенцията - лектори, разположения на сцената, специфична за събитията иконография, повтарящи се спонсори и зали. Фината донастройка повиши точността на разпознаване на повтарящите се хора и заземяването върху специфичната за агенцията сценография (един и същ конферентен брандинг година след година) далеч над това, което дава генеричен готов VLM.
Стек за лицево разпознаване
Модел за детекция + модел за лицеви ембединги, работещи за всеки кадър срещу регистър от 250 лица на повтарящи се лектори и екип. Детекция при 40-60 fps; генериране на ембединги при 30-40 fps; сравнението срещу регистъра от 250 лица добавя пренебрежимо наслагване.
Обща пропускливост на пайплайна
~8-12 кадъра в секунда устойчиво, включително записите в базата данни и обработката на грешки. Neural Engine на M4 Pro поема инференса; CPU + 10 GbE поемат I/O.
Всеки кадър при 1 fps се етикетира с
Всеки кадър при честота на семплиране 1 fps се етикетира с:
Трудното архитектурно решение
Модел на данни в движение
Юристите на агенцията одобриха модел на данни в движение: пълният анализ на всеки кадър се извършва в паметта; съхраняват се само метаданни, които не идентифицират повторно хора без съгласие.
Граници на търсенето в кадри с публика
Кадрите с публика са претърсваеми по облекло, поза, гъстота, тип сцена - никога по лице - освен ако човекът не е в регистъра за съгласие на агенцията.
Регистърът за съгласие като първокласно хранилище
Регистърът за съгласие е първокласно хранилище на данни, което се чете преди записването на каквито и да е метаданни, съдържащи лични данни.
Шест седмици обучение на фината донастройка, след това 28 дни историческа обработка
- Shipped01Седмици 1-6 · Обучение на фината донастройка
Изградихме етикетирания обучителен корпус (малък асистент за етикетиране предлагаше етикети; човек ги одобряваше). Обучихме vision-language фината донастройка на Mac Studio M2 Ultra. Моделът разпозна повтарящите се лектори на агенцията, типичните им сценични облекла, брандинг таблата на агенцията и малък набор от повтарящи се зали без объркване.
- Shipped02~4 седмици · Историческа обработка
С готовата фина донастройка продукционната конфигурация (NAS + Mac Mini M4 Pro) обработи архива от 119 TB кадър по кадър при 1 fps. Връзката 10 GbE държеше I/O на хранилището пред Neural Engine; конфигурацията работи 24/7 през целия период.
- Shipped03Канал в реално време
Новите качвания (типична доставка от събитие 50-100 GB на сесия) минават през същия пайплайн автоматично. Мрежовият трансфер при 800-1000 MB/s поставя качване от 100 GB на NAS за под две минути; обработката на всеки кадър при 8 fps прекарва същите 100 GB през инференс за ~30-40 минути. От край до край от качване до индексиране: под час за типична сесия от събитие, единични минути за кратки интервю кътове.
- Shipped04Интерфейс за търсене
Поле за заявка на естествен език, зад което стои семантично търсене в метаданните за всеки кадър. Заявката „кадър с дрон над залата при залез на втория ден“ и заявката „Person A говори в панел без обичайното си кожено яке“ работят и двете; втората е тази, която маркетинг екипът използва най-често.
Трудностите, които срещнахме
- Датасетът за фината донастройка беше внимателната работа. Етикетирането на стотици кадри качествено изисква човек; етикетирането на хиляди изисква система. Моделът с асистент за етикетиране ускори тази работа приблизително 5× и беше нещото с най-голям ефект, което изградихме във Фаза 1.
- GDPR границата като архитектура, а не като филтър. Третирането на съответствието като „филтрирай изхода“ беше неприемливо за юристите. Третирането му като „разклони пайплайна на границата на съгласието, така че личните данни никога да не напускат паметта, освен ако няма запис за съгласие“ беше архитектурата, която те одобриха.
- RAM паметта на NAS беше ограничението, а не изчислителната мощ. DS2422+ има 12 GB RAM; работният набор на базата данни беше настроен да се побере. Стратегията за кеширане, планирането на заявките и шардирането на индекса по събитие имаха по-голямо значение, отколкото биха имали на по-мощен сървър.
Сметката зад 119 TB за 28 дни
Медиен архив, който не можете да търсите?
Моделът на vision-language пайплайна - модел с фина донастройка за домейна, GDPR-безопасен поток на данните, обработка в реално време и на исторически материал върху стандартен хардуер с Apple Silicon - работи за всяка голяма медийна библиотека. 30-минутна диагностика минава през формата на вашия архив, вашата позиция по съответствие и колко би струвал един хибриден пайплайн.