ИИ-ассистент врёт не потому, что глупый. Просто база плохая

Почти всегда, когда ассистент отвечает мимо, дело не в модели. Дело в том, чем его накормили.

За последний год я собрал несколько ИИ-ассистентов, которые отвечают по базам знаний — от журнала на шестьдесят тысяч статей до курсов и товарных каталогов. И заметил, что предсказать качество ответов можно ещё до начала работы, просто посмотрев на материалы.

Вот на что я смотрю.

Одно и то же в трёх редакциях Самая частая беда. В базе лежит статья двадцать третьего года, её обновлённая версия двадцать пятого и черновик где-то между. Все три написаны похожими словами.

Ассистент находит все три и отвечает по той, которая случайно оказалась ближе по формулировкам. Внешне ответ выглядит нормально. Просто он устарел на два года.

Лечится либо чисткой, либо датами: у каждого куска должна быть привязка ко времени, чтобы можно было отсечь старьё. Но чистка почти всегда дешевле. Сокращения, которые знают только внутри

Люди в переписке пишут коротко. В документах то же самое расшифровано полностью. Для поиска это два разных текста, он их не свяжет.

Поэтому я всегда прошу список сокращений, жаргона и внутренних названий. Даже кривой, на коленке. Он потом экономит недели догадок.

Расшифровки видео — худший материал из возможных

Скажу неприятное тем, у кого весь контент в записях эфиров. Расшифровка устной речи — самое сложное, с чем приходится работать. Там нет структуры, нет заголовков, мысль возвращается по три раза, половина смысла в интонации и в том, что человек показывал на экране. Плюс имена и термины распознаются как попало.

Работать с этим можно, но честно: это отдельный этап, а не «у нас всё готово, вот файлы». Обычно приходится сначала превращать поток речи в нормальный структурированный текст.

Картинки и таблицы, в которых вся суть Открываю документ — там табличка со сравнением тарифов, и весь смысл страницы в ней. А в текст она попадает как каша из цифр без заголовков столбцов.

То же самое со схемами, скриншотами интерфейса, фотографиями товара. Ассистент их просто не видит.

Если ключевая информация живёт в таблицах, это надо проговаривать заранее: их придётся разбирать отдельно.

Отсканированные документы Иногда присылают файлы, где текста как такового нет — это фотографии страниц. Выглядит как обычный документ, а внутри картинка. Проверяется за секунду: попробуйте выделить кусок текста мышкой. Не выделяется — значит, впереди распознавание, и это плюс к срокам.

Один документ — про всё сразу Бывает файл на сорок страниц, где вперемешку условия доставки, описание товаров, юридические тонкости и история компании. Такой материал режется на куски плохо: в один кусок попадает конец одной темы и начало другой, и ассистент отвечает смесью. Чем понятнее разбит материал по темам, тем точнее ответы.

Что помогает сильнее всего

Не документы. Реальные вопросы, которые задают живые люди, и правильные ответы на них.

Даже полсотни таких пар меняют качество радикально. Потому что человек спрашивает не теми словами, которыми написана инструкция, и вот этот зазор между тем, как написано, и тем, как спрашивают, никакая база документов не закроет.

Если у вас есть переписка поддержки за пару месяцев — это ценнее любого регламента.

И последнее, не про базу, а про настройку. Ассистент обязательно должен уметь сказать «не знаю». Иначе на любой вопрос за пределами базы он придумает вежливый правдоподобный ответ, и вы об этом узнаете от клиента. Если у вас есть база и вы прикидываете, что с ней делать, — напишите в комментариях, что за материалы. Скажу, где будут сложности.