Интересный MVP
Теперь про основную работу, про Cleverbots! Давайте расскажу любопытную историю с продолжением.
Начнём с того, что я тут помогаю организовать фестиваль науки "Science Party". И тему в этом году мы выбрали "ИИ захватил мир".
В процессе подготовки мы, естественно, стали разбирать как же работают LLM (большие языковые модели)? С этой темы плавненько переехали в рассказы о том, что такое RAG (Retrieval-Augmented Generation).
Для тех, кто вдруг ещё не знает, что это такое. Это когда LLM отвечает на вопросы на основании нашей "закрытой" базы знаний, которую в процессе обучения не видела. Например, консультирует вас по вашему расчетному листу за последний месяц. Его-то она точно не видела :)
Не буду долго объяснять, загляните сюда, когда дочитаете - https://ru.wikipedia.org/wiki/%D0%93%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F,%D0%B4%D0%BE%D0%BF%D0%BE%D0%BB%D0%BD%D0%B5%D0%BD%D0%BD%D0%B0%D1%8F%D0%BF%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%BC
От RAG мы дошли до сервиса NotebookLM от Google. Чем он нам так приглянулся? Можно в него закинуть тексты, аудио, видео (та самая "база знаний") специфичных для вашей области. Например, вы специалист по выращиванию апельсинов в условиях вечной мерзлоты. Или марсианский микробиолог. Уникальный специалист, короче. И умный алгоритм NotebookLM сделает вам подкаст на основе ваших документов. Идеально, для изучения чего-то нового! И очень популярный формат! Поверьте мне, я проверил на своем семнадцатилетнем сыне :)
Но, для пользователей из Российской Федерации сервис закрыт!
И тут мы решили попробовать сделать аналогичный MVP. :) Понеслось, так сказать...
Что потребовалось в "минимальной комплектации"?
1. Локальная большая языковая модель. Выбор пал на Qwen3 на 8 миллиардов параметов. Достаточно "умная" и ещё не слишком огромная для локальных экспериментов. 2. Хитрый алгоритм, который генерирует личности участников подкаста, генерирует список вопросов и делает так, что при формировании каждого следующего вопроса учитывается контекст (всё, что уже обсудили) предыдущего разговора. 3. Система для перевода текста в голос. Тоже на основе LLM, кстати. Тут тоже не без хитростей, которые не буду раскрывать. 4. Ещё одна LLM для генерации музыкальных фразментов: интро, аутро и музыкальные "перебивки" между вопросами. Здесь просто взяли готовый пакет audiocraft для Python.
Что уже получилось? 1. В подкасте всегда 3 участника: ведущий, гость и эксперт. Гостя можно описать, персонажи "ведущий" и "эксперт" генерируются автоматически. 2. Эксперту можно выбрать специализацию. Специализаций предлагается насколько на основе заданной темы подкаста. 3. Успешно генерируется текстовый вариант подкаста: все представляются, обсуждают заранее сгенерированные вопросы. Я конечно, иногда вижу, что текст через LLM сгенерирован, но в целом качество как минимум "хорошее" и лучше. 4. Относительно успешно генерируются голоса. В смысле, что весь текст произносится, интонируется, но сейчас мне очень не нравиться качество, будем его улучшать. 5. Успешно генерируются и "вклеиваются" музыкальные фрагменты. 6. Можно скачать в виде mp3-файла готовый результат.
Сегодня принесу вам очень сильно промежуточный и не последний вариант генерации подкаста. Буду нагнетать интригу. :) Текущие варианты генерации значительно лучше, но их пока не покажу. Через недельку-другую всё будет. :)
· 06.10.2025
Чем дальше в ИИ, тем меньше занятий для людей.... Увы. А я начав читать этот пост думал Вам будет интересно создание человеческой научной энциклопедии.... Ошибся!
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён