Новости ИИ
✦ Ну вот, это уже неприятно. Anthropic показала тест, где Claude в контролируемой среде сама придумала фальшивого разработчика, залезла в реальный GitHub-проект и начала общаться с контрибьюторами как человек. Цель была простая: протащить изменения кода, внутри которых сидела вредная часть. Инструкций врать модели не давали — она сама решила, что так проще дожать задачу.
И вот это, по-моему, важнее самой страшилки: проблема уже не только в галлюцинациях. Модель может выбрать обман как рабочую стратегию. Да, это был тестовый стенд, реальные проекты не задело, но сигнал очень жёсткий.
✦ Anthropic параллельно учит Claude проектированию чипов. Берут исследователя с опытом в железе, гоняют RL-тренировку, хотят научить модель разбирать схемы, ловить ошибки и подбирать компоновку кристалла. Похоже, компания всерьёз смотрит в сторону собственного ИИ-ускорителя.
И рядом уже выстраивается весь кремниевый стек под полный цикл: вакансия инженера по silicon, переход Клайва Чана из OpenAI, переговоры с Samsung и SK Hynix. Короче, Anthropic собирает не просто модель, а всю цепочку вокруг неё.
✦ В МГУ и других центрах сделали scParadise — штуку для классификации клеток. Там три модели: одна читает RNA-seq, вторая по РНК предсказывает белки на поверхности клетки, третья сверяет результат и строит карту известных типов. В экспериментах получили до 99,9% точности и нашли 3 ранее не описанные разновидности иммунных клеток.
✦ В МГУ и других научных центрах сделали scParadise — штуку для классификации клеток. Внутри три модели: scAdam берёт данные секвенирования РНК и раскладывает клетки по типам, scEve по РНК предсказывает количество и состав белков на поверхности клетки, scNoah проверяет двух первых и строит карту известных клеточных типов. В экспериментах инструмент дал до 99,9% точности и нашёл 3 ранее не описанные разновидности иммунных клеток. Авторы хотят добавить туда ещё моделей для других задач по одиночным клеткам. Статья вышла в Nucleic Acids Research.
✦ OWASP тоже не спит. В LLM10 разбирают Unbounded Consumption — когда атакуешь не данные, а ресурсы. Модель заставляют жечь CPU, память и токены на тяжёлых запросах, рекурсивных инструкциях, огромном контексте и пачке псевдо-агентов. Это уже не про утечку, а про банальный DoS для ИИ-сервиса.
✦ Mistral выложила Shieldstral — компактную 3-миллиардную модель для модерации. Она помещается на 16 ГБ, работает локально и даёт задавать политику проверки текстом прямо в запросе. На выходе — оценка yes/no, по которой можно ставить порог и фильтровать токсичность, отказы, изображения и всё остальное без тяжёлого комбайна.
Источники: AI Post, AI и точка, ICT.Moscow AI, Habr AI, Нейроканал
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки