Case study

Пазарна интелигентност за криптовалути - 270+ емисии, един персонализиран брифинг

Крипто пазарът генерира повече сигнал за час, отколкото сериозен читател може да обработи за седмица. Изградихме конвейер с непрекъснато постъпване на данни, който черпи от 150+ новинарски сайта, 50+ YouTube канала, 20+ подкаст емисии и стотици групи в социални мрежи и инфлуенсър профили; нормализира всичко в един етикетиран поток без дубликати и със строг формат; и произвежда персонализирани брифинги, push известия, седмични бюлетини, ежедневни епизоди на подкаст, генерирани с AI, и чатбот, който вече познава контекста на портфейла на читателя.

Обработени източници

270+

новини · YouTube · подкасти · социални мрежи

Нормализирани елементи / ден

1 000-2 000

един поток със строг формат

Активни читатели с персонализация

~10 000

седмичен бюлетин за всеки

Последно обновено:

01. Проблемът

Информационен потоп без редакционен филтър

Крипто пазарът е специален случай на информационен потоп. Работи 24/7 в десетки юрисдикции, на десетки платформи, без редакционен филтър. Всяка минута произвежда:

  1. Новини - публикувани в стотици сайтове с различно качество, често дублирани в рамките на минути и често преразказващи се взаимно.
  2. Дълго аудио и видео - няколко водещи YouTube канала и подкасти публикуват ежедневно; значимо движение, което влияе на търговията, обикновено се появява там, преди да стигне до заглавие.
  3. Сигнал от социалните мрежи - Telegram групи за конкретни токени, Discord сървъри, инфлуенсър нишки в X (Twitter), Reddit подфоруми. Често точно там новината избухва първо.

Сериозният читател в областта на криптовалутите прекарва часове на ден в преглеждане на източници, за да извлече малкото движения, които наистина влияят на портфейла му. Проблемът е информационното претоварване; бюлетините с "топ 10 за деня", при които се губи информация, са частичен отговор; персонализиран, многоформатен конвейер е по-добрият.

Заданието

Изградете го.

02. Стекът, който изградихме

270+ емисии на входа, един поток със строг формат на изхода

Слой за постъпване на данни (непрекъснат, 24/7)

  • 150+ новинарски сайта

    RSS там, където е наличен, скрейпинг с headless браузър там, където не е. Адаптери за всеки сайт обработват логиката на платените стени, засичането на ботове и ограниченията на заявките.

  • 50+ YouTube канала

    Автоматизирано извличане на транскрипти; засичане на езика на аудиото, така че каналите на други езици да минават през превод надолу по веригата; преминава към ASR върху суровото аудио, когато няма публикуван транскрипт.

  • 20+ подкаст емисии

    RSS за емисията, изтегляне на аудио, автоматично преобразуване на говор в текст върху аудиото.

  • Стотици групи в социални мрежи + инфлуенсър профили

    Telegram канали, Discord сървъри, X таймлайни, Reddit подфоруми. Постъпване само за четене; не се изпраща обратно сигнал за ангажираност.

Конвейер за нормализация

Щом дадено съдържание постъпи, то минава през строг конвейер:

  1. Засичане на език + превод

    Всичко завършва на английски в слоя за съхранение; оригиналният текст на източника се запазва наред с него.

  2. Тагване на теми + обекти

    Извлича споменатите токени, борси, регулатори, проекти и хора. Класифицира типа на събитието - движение на цената, регулаторна новина, листване на борса, инцидент със сигурността, обявяване на партньорство, актуализация на техническата пътна карта и така нататък.

  3. Премахване на дубликати

    Семантична близост в рамките на входа за деня. Една и съща история, преразказана в дванадесет сайта, се свива до един каноничен елемент с дванадесет указателя към източници.

  4. Компресия до стандартен формат

    Всеки оцелял елемент се пренаписва в строга форма: едноредово заглавие, резюме от три изречения и малък набор от булети в стандартизиран ред - какво се случи · защо е важно · кого засяга · какво да следим след това. Една и съща форма при новини, социални мрежи, видео и подкасти.

  5. Оценяване на увереност и тежест

    Всеки елемент получава оценка за увереност (колко независими източника, колко са реномирани) и оценка за пазарна тежест (колко голямо е подразбиращото се движение). Слоят за персонализация чете и двете.

Повърхности към потребителя

  • Приложението за агрегация

    Читателят избира токените, темите и типовете събития, които го интересуват. Потокът показва само елементите, които минават през неговия филтър, подредени по тежест.

  • Push известия

    Когато елемент с висока тежест попадне във филтъра на читателя, той получава push известие. Прагът за всеки потребител се настройва от системата според това какво читателят реално отваря и какво отхвърля.

  • Персонална повърхност на приложението за всеки читател

    Началният екран се преорганизира около портфейла на читателя - държани токени, наблюдавани токени, типове събития, които го интересуват. Един и същ бекенд, много различни начални екрани.

  • Персонализиран седмичен бюлетин

    Всяка неделя системата произвежда бюлетин за съответния читател - обзор на движенията през седмицата, които са имали значение за него, написан в стандартизирания компресиран формат, плюс редакционно въведение, отразяващо профила на интересите на този читател.

  • Чатбот с контекст за портфейла

    Разговорен интерфейс, който знае какво притежава читателят, какво е кликал и какво е публикувано през тази седмица. Предсказуемо, най-често задаваният въпрос е "Защо X падна толкова много днес?" - и ботът отговаря от реалния нормализиран поток плюс указателите към източниците. Цитирането не е по избор.

03. Реализация

Пет фази - инфраструктура, нормализация, персонализация, чат, подкаст

  1. Shipped
    01Фаза 1 · Инфраструктура за постъпване на данни

    Изградихме адаптерите за всеки източник. Най-трудни бяха YouTube каналите без публикуван транскрипт (изтегляне на аудио + резервен вариант с ASR) и Telegram каналите само с покана. Адаптерите са версионирани за всеки източник - когато сайт промени оформлението си, се чупи само неговият адаптер; останалата част от конвейера продължава да работи.

  2. Shipped
    02Фаза 2 · Конвейер за нормализация

    "Тагване на теми, извличане на обекти, семантично премахване на дубликати, компресията до строг формат. Стъпката с компресията изиска най-много итерации; "заглавие + три изречения + стандартизирани булети" се задава лесно и изненадващо трудно се постига последователно през различните източници при производствен обем. Изходът вече минава през валидатор на схема, преди да достигне до хранилището."

  3. Shipped
    03Фаза 3 · Слой за персонализация

    Език на филтъра, прагове за push известия за всеки потребител, оформление на началния екран за всеки читател, генериране на седмичен бюлетин. Персонализацията чете от същия етикетиран поток, от който четат и публичните повърхности; разликата е единствено в това кои елементи вижда всеки читател и как са подредени.

  4. Shipped
    04Фаза 4 · Чатботът с контекст за портфейла

    Активите на читателя, следените токени, историята на кликванията и нормализираните елементи от последните две седмици влизат в контекста на разговора. Чатботът не генерира пазарни мнения от нищото; той черпи от потока и цитира елементите източници.

  5. Shipped
    05Фаза 5 · Ежедневният подкаст с NotebookLM

    Сглобяване на изходния материал, генериране чрез NotebookLM, автоматизирано публикуване в подкаст емисията. Работният процес в края на деня се изпълнява по едно и също време всеки борсов ден; слушателят получава постоянен слот.

Трудностите, които срещнахме

  • Чупене на адаптерите в мащаб. При 150+ адаптера за скрейпинг почти всяка седмица нещо е счупено. Изградихме самовъзстановяващ се слой, който засича спад в очаквания обем постъпващи данни за даден източник и насочва адаптера към изчаквателна опашка, докато човек го поправи; останалата част от конвейера продължава да работи.
  • Цена на превода в дългата опашка. Малък брой източници с висока стойност на сигнала публикуват на езици, при които цената на превода расте по-бързо от останалите. Сега конвейерът извежда напред източниците на английски и превежда дългата опашка само когато дадена тема премине праг на релевантност.
  • Отговорът на въпроса "защо падна X" се нуждаеше от цитирани източници, за да е надежден. Ранните отговори на чатбота звучаха правдоподобно, но не можеха да бъдат проверени. Настоящият бот винаги цитира каноничния нормализиран елемент плюс източниците, които допринасят за него; отговори от типа "вярвай ми" не са допустими.
  • Аудиото, генерирано чрез NotebookLM, се нуждаеше от редакционна рамка на гласа. Генерирането по подразбиране се отклонява по тон от ден на ден. Изградихме дневна промпт рамка, която фиксира гласа и темпото.
04. Числата

270+ източника на входа, ~10 000 читатели с персонализация на изхода

Новинарски сайтове с непрекъснат скрейпинг
150+
YouTube канали с постъпване на транскрипти на живо
50+
Подкаст емисии с ежедневно постъпване на транскрипти
20+
Групи в социални мрежи + наблюдавани инфлуенсър профили
стотици
Нормализирани елементи на ден
1 000-2 000
Активни читатели с персонализация
~10 000
Push известия, доставени седмично
20 000-30 000
Отговорени въпроси към чатбота на ден
~500
Произведени седмични бюлетини
по един за всеки активен читател
Епизоди на подкаста / месец
~22 (по един за всеки борсов ден)
AI, който вече работи

Конвейер за интелигентност от много източници за Вашата област?

Моделът - много шумни емисии на входа, един нормализиран поток със строг формат на изхода, персонализирани повърхности за читателя отгоре - работи във всеки пазар с информационно претоварване. Финанси, проследяване на регулации, вериги на доставки, OSINT, научна литература, вътрешно знание в компанията. 30-минутна диагностика преминава през Вашите източници, Вашите читатели и това колко би струвал един персонализиран конвейер.

На живо · работи на Gemma-4 · хардуер в София