Куда мы пропали ?!
и почему первый пост в новом году появился аж через полтора месяца?
Спойлер: нет, мы не ушли в запой до февраля и не улетели «перезагружаться» на Бали. Всё прозаичнее и интереснее одновременно — мы строили будущее компании. Но обо всём по порядку.
Год назад мы запустили Aiesa.ru с одной целью — залезть в новую революционную нишу — искусственный интеллект и разобраться, как он реально может решать задачи бизнеса и как на этом заработать.
Мы взяли понятную нам бизнес-модель — сервисную разработку. Это когда клиенты приходят со своими задачами, а мы придумываем, что бы им такого напрограммировать. Классика ИТ-рынка.
За год напряжённой работы мы сделали десятки решений как для клиентов, так и для себя: от ИИ-менеджера в чате поддержки до аналитики хоккейных матчей. Но цель проекта Aiesa.ru была всё же в другом — достаточно глубоко изучить рынок, чтобы запустить на нём свой продукт.
Задача звучала просто, но была дьявольски сложной: Как на динамично развивающемся рынке, где каждый месяц всё меняется, создать продукт, который будет актуален не полгода, а ближайшие десять лет?
И ответ, как это часто бывает, пришёл оттуда, откуда не ждали…
Параллельно с клиентскими проектами наша команда создавала небольшие продукты для внутренних потребностей. Мы сделали генератор коммерческих предложений, случайно собрали аналог NotebookLM от Google и ещё кучу инструментов, которыми пользовались сами.
Но один из них абсолютно неожиданно для нас — выстрелил.
Телеграм-бот для расшифровки речи.
Мы делали его для себя, чтобы расшифровывать записи встреч с клиентами. Выложили в открытый доступ, думали, попользуются пару десятков наших друзей и знакомых. А сейчас в нём больше 3 000 пользователей, которые сделали уже 15 000 транскрибаций. Это полтора года общего хронометража аудио и видео, которые наш бот превратил в текст. Полтора. Года. Непрерывного. Звука. 🤯 И именно этот проект обратил наше внимание на огромную нишу — обработка речи.
Немного закулисья для тех, кому интересно, как это устроено.
Для расшифровки речи используются специализированные ИИ-модели. Они тяжёлые и прожорливые — требуют серьёзных вычислительных мощностей. Когда мы запускали бота, перед нами стоял выбор:
Путь А: пойти к условному Яндексу и покупать у них минуты расшифровки. Просто, быстро, но дорого — ты платишь за каждую секунду обработки и полностью зависишь от чужого сервиса.
Путь Б: развернуть свои собственные модели на своих серверах. Сложнее, больнее, но ты платишь фиксированную стоимость за железо и не зависишь ни от кого.
Мы, конечно, выбрали путь Б. Потому что мы в Aiesa.ru лёгких путей не ищем.
Мы взяли Open-Source модели — это модели, которые другие компании обучили и выложили в открытый доступ. Их можно бесплатно скачать и запустить на своём сервере. Звучит как сказка, но есть нюанс: для их работы обычно нужны сервера с мощными видеокартами, которые стоят как подержанный автомобиль. В месяц.
А наш сервер для таких задач не очень-то был предназначен. Для нас это был испытательный полигон, а не рабочая лошадка, поэтому задачи обработки тяжёлых моделей он тянул с натяжкой.
И тут мы начали изобретать..
Мы написали собственный оркестратор — систему, которая разрезает большие задачи на маленькие куски и поочерёдно загружает их в память сервера. Представьте, что вам нужно перевезти шкаф, а у вас только легковушка. Большинство скажет: «Нужен грузовик». А мы сказали: «А если шкаф разобрать?»
Если серьёзно — оркестратор умно распределяет нагрузку: пока одна часть модели удаляет тишину, другая расшифровывает аудио в текст. Это позволило нам добиться качества на уровне дорогих облачных решений при кратно меньших затратах на инфраструктуру. Именно поэтому наш бот распознаёт речь на высоком уровне, стоит дешево и работает быстро — мы не экономили на качестве модели, мы научились эффективно с ней работать.