Новости за последний час
OpenAI выкатили GeneBench-Pro — бенчмарк для проверки, умеет ли ИИ не просто считать по шаблону, а принимать исследовательские решения на биоданных. В тестах дают сырые, неструктурированные данные и задачу без инструкции «как считать», так что модели приходится самой чистить данные, искать артефакты и выбирать метод.
Результаты пока довольно приземляющие: GPT-5.6 Sol взяла 31,5% в режиме Pro, Claude Opus 4.8 — 16,0%. Для такого сложного теста это уже неплохо, но до уровня, где можно без оглядки доверять биологические выводы, ещё далеко. Хотя сам формат бенчмарка полезный: он проверяет не красивый ответ, а ход решения.
Параллельно AIRI показал GENATATOR — систему для аннотации генов в ДНК. Она работает поэтапно: находит границы гена, проверяет участок, классифицирует тип и уточняет внутреннюю структуру. Для геномов без хорошей ручной разметки это как раз тот случай, где автоматизация выглядит не рекламой, а экономией очень большого числа часов. Модель уже лежит на Hugging Face.
Источники: Machinelearning, AI Updates Digest, ICT.Moscow AI, GPT/ChatGPT/AI Central Александра Горного
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки