BenchMIRT бьёт по больному. Hugging Face выкатил разбор инструмента, который помогает понять, что именно меряют бенчмарки больших языковых моделей, а не просто смотреть на красивые проценты. Посты:

У Google вышла подборка последних AI-обновлений за август 2026 года, и в тех же материалах отдельно всплыл Oblivion Mind — когнитивно-символьная система с проверяемым знанием, где важен не Посты:

OpenAI показала GPT-6 Astra, и это уже не игрушка для демо. Посты:

Отдельно OpenAI привела цифры по бенчмаркам: 97,6% на FrontierMath Tier 4 v2, 74,1% на DeepSWE v1.1, 95,9% на BenchCAD, 96% на GPQA Diamond, 100% на ExploitBench и 98,6% на ARC-AGI-3. Посты:

Вывод: неделя вышла про одно и то же с разных сторон — как мерить модели честно и что делать, когда модель уже умеет лезть в рабочие инструменты и в кибербезопасность.


В этом посте были ссылки, но мы их удалили по правилам Сетки