🧾****Ответ в одну строку, счет на восемь тысяч токенов Агент сходил в интернет, забрал три страницы и выдал ответ в одну строчку. Текст одной страницы – около 2500 токенов, и это уже после чистки от меню и футеров. Итого вы заплатили за 8 тысяч токенов там, где по делу было сто

Обойти это своими силами тяжело, и упирается все раньше, чем кажется: нужен программный доступ к поисковой выдаче, а его обычно просто нет – не то что к релевантным фрагментам, даже к полным страницам. А когда доступ появляется, начинается своя работа: скачать страницы, почистить HTML, нарезать, отранжировать и выбрать то, что реально отвечает на вопрос

Yandex Cloud закрыл это одним вызовом: в Search API появились Smart Snippets. На входе запрос, на выходе по каждой найденной странице отобранные под этот запрос фрагменты с цитатами и ссылкой на источник. Их сразу можно отдавать в LLM

Что меняется:

• До 3 раз меньше токенов на веб-контексте при том же качестве ответа • Поиск и подготовка контекста – один вызов API • Поиск кастомизируется как обычный Search API: регион, свежесть, ограничение по сайтам

Не путайте с генеративным ответом. Smart Snippets ничего не сочиняют – отдают дословные фрагменты страниц, а итоговый ответ собирает ваша модель. Внутри при этом те же поисковые технологии, что готовят контекст для генеративного ответа в Поиске Яндекса

Кому ощутимее всего – тем, кто платит за инференс на объеме: корпоративные ассистенты, research-инструменты, внутренние AI-платформы. Веб-контекст там обычно самая тяжелая часть промпта

🔗 Протестировать на своих запросах можно по этой ссылке – оставляете заявку, эксперт Yandex Cloud связывается и показывает, как это работает

🧾Ответ в одну строку, счет на восемь тысяч токенов
Агент сходил в интернет, забрал три страницы и выдал ответ в одну строчку | Сетка — социальная сеть от hh.ru 🧾Ответ в одну строку, счет на восемь тысяч токенов
Агент сходил в интернет, забрал три страницы и выдал ответ в одну строчку | Сетка — социальная сеть от hh.ru