Новости за последний час

OpenAI выкатили GeneBench-Pro — бенчмарк для проверки, умеет ли ИИ не просто считать по шаблону, а принимать исследовательские решения на биоданных. В тестах дают сырые, неструктурированные данные и задачу без инструкции «как считать», так что модели приходится самой чистить данные, искать артефакты и выбирать метод.

Результаты пока довольно приземляющие: GPT-5.6 Sol взяла 31,5% в режиме Pro, Claude Opus 4.8 — 16,0%. Для такого сложного теста это уже неплохо, но до уровня, где можно без оглядки доверять биологические выводы, ещё далеко. Хотя сам формат бенчмарка полезный: он проверяет не красивый ответ, а ход решения.

Параллельно AIRI показал GENATATOR — систему для аннотации генов в ДНК. Она работает поэтапно: находит границы гена, проверяет участок, классифицирует тип и уточняет внутреннюю структуру. Для геномов без хорошей ручной разметки это как раз тот случай, где автоматизация выглядит не рекламой, а экономией очень большого числа часов. Модель уже лежит на Hugging Face.

Источники: Machinelearning, AI Updates Digest, ICT.Moscow AI, GPT/ChatGPT/AI Central Александра Горного

Все новости: ai.popovs.tech

#OpenAI #ChatGPT #Claude


В этом посте были ссылки, но мы их удалили по правилам Сетки