Как я собрал автоматический ИИ-конвейер для новостей о криптовалютах и ИИ
Полтора месяца назад я запустил spvrwa ru, издание о нейросетях и криптовалютах. С самого начала было понятно, что вручную отслеживать инфоповоды по обеим темам и писать по ним статьи в одиночку нереально: рынок ИИ и крипторынок генерируют десятки событий в день, а конкурировать за внимание читателя с крупными СМИ можно только скоростью и регулярностью. Поэтому вместо редакции из нескольких человек я построил конвейер, который сам находит инфоповоды, решает, о чем стоит писать, и готовит статью с картинкой. Расскажу, из чего он состоит и на каких граблях я уже успел прокатиться.
Откуда берутся инфоповоды
Источников два: RSS-ленты профильных изданий по ИИ и криптовалютах и отдельный модуль мониторинга трендов, который раз в 1-3 дня прогоняет несколько соцсетей и Telegram-каналы и вытаскивает сигналы с аномальным ростом упоминаний. Второй источник интереснее первого: он ловит темы на подъеме, когда о них еще не написали крупные издания, а не пересказывает уже остывшую новость.
Если тема продолжает расти несколько циклов подряд, конвейер не публикует одну статью и забывает про нее, а пишет продолжение под новым углом, пока интерес держится. Для этого каждый источник в базе помечается счетчиком: сколько раз тема уже освещалась и под каким углом, чтобы вторая статья не дублировала первую, а раскрывала тему с другой стороны.
Кто решает, что достойно статьи
Не любой сигнал, прошедший по метрикам, действительно новость. Часть отфильтровывается вручную еще на уровне промпта: рекламные посты, личные просьбы, мемы без повода. Дал модели право явно отвечать «это не новость» вместо того, чтобы натягивать текст на слабый инфоповод. И в первый же день поймал интересный побочный эффект: модель один раз перепутала лаконичность источника (короткий пост без деталей) с отсутствием инфоповода и чуть не пропустила настоящий релиз. Пришлось явно прописать в промпте разницу между «нет новости» и «мало деталей о новости», на словах граница кажется очевидной, а для модели без явного правила это не так.
Заголовки не по вкусу, а по спросу
Для заголовков вместо интуиции использую Яндекс.Wordstat. Перед тем как зафиксировать формулировку, проверяю, как ее реально ищут. Разница иногда доходит до порядка: привычная редакторская версия заголовка может собирать в десятки раз меньше показов, чем формулировка, которую реально вбивают в поиск. Для криптотематики это особенно заметно на терминологии: одни и те же события в новостях и в реальных поисковых запросах называют по-разному.
Картинки тоже не ручная работа
Для каждой статьи конвейер ищет подходящее стоковое фото по теме, а не ставит одну и ту же заглушку. Источников два: если по узкому запросу (конкретная модель, конкретный протокол) не находится фото в одном банке изображений, автоматически пробует второй и, только если оба пустые, ставит брендированную заглушку. На практике два источника вместо одного ощутимо снизили долю статей без реальной фотографии.
Что дальше
Конвейер уже работает не только на входящих новостях, но и подключен к отдельному Планировщику задач, который каждые несколько часов проверяет, вышел ли новый цикл трендов. Он запускает публикацию сам, без моего участия, с честной оговоркой, что для этого ноутбук должен быть включен и я должен быть залогинен, полной автономности пока нет. Если интересно посмотреть на результат, сайт spvrwa ru, новости об ИИ и криптовалютах выходят там ежедневно.