Новости к 14:00
✦ Ну наконец-то. ChatGPT Health теперь открыт всем пользователям в США — и это уже не игрушка для тестов. Можно подключить Apple Health и медзаписи из клиник, чтобы сопоставлять анализы, смотреть динамику активности и готовиться к визиту к врачу. Идея простая: свести в одно место то, что обычно лежит по разным приложениям.
OpenAI отдельно говорит, что медразговоры живут отдельно от обычных чатов и не идут в обучение. И правильно делает: в такой штуке доверие важнее красивого демо.
✦ VK AI Space выкатили многоуровневую память для корпоративных ИИ-агентов. Тут всё приземлённо: сессионная, пользовательская, проектная и память самого агента. Агент не обязан каждый раз начинать с нуля — он тянет контекст из разных слоёв и меньше повторяет одно и то же. VK Tech оценивает экономию повторных задач в 40–50%.
Это как раз тот редкий случай, где память — рабочая штука. Если у вас в компании всё уже разложено по процессам, эффект будет заметный. Если бардак, память просто законсервирует бардак.
✦ LLM-судье верить на слово нельзя. И это важнее, чем очередной красивый бенчмарк. В статье разбирают двухконтурную схему оценки, где классическая нормализация может сказать судье «нет», плюс показывают CI-инварианты и враждебные фикстуры, чтобы ловить галлюцинации ещё до релиза. Отдельно разбирают 3 бага проектирования, которые легко тащат ложноположительные результаты.
✦ Метод синтетического датасета помог улучшить перевод смешанных русско-казахских текстов. Проблема понятная: в живой речи языки мешают постоянно, а размеченных данных мало. Коллеги из MWS AI и университетов собрали синтетику на базе параллельных корпусов, и модель на этих данных обошла коммерческие системы в реальном сценарии. В узких задачах это работает лучше, чем ждать идеальный датасет.
✦ RedNote сообщила, что её dots-note-3.0 первой взяла 42/42 на IMO. Тут интересен не сам счёт, а способ: модель генерировала, проверяла, резала и уточняла доказательства через агентный цикл с Python. Для задач с полным письменным решением это уже совсем другой режим работы, не просто ответ из модели.
✦ «Яндекс» сделал ИИ-агента для звонков и бронирований. Он работает на Alice AI LLM, умеет держать естественный диалог, уточнять детали, проверять время и подтверждать бронь. Если вариантов нет — предлагает другие или переводит на человека. Сейчас это тестируют рестораны, а дальше, похоже, пойдут салоны, клиники и весь записной зоопарк. Короче, голосовой фронт уже начинают отжимать у людей.
Источники: GPT/ChatGPT/AI Central Александра Горного, ICT.Moscow AI, Habr AI, Habr AI, AI Post, ICT.Moscow AI
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки