Новости к 14:00
✦ Ну вот. Япония снова вылезла там, где её не звали.
Исследователи прогнали почти 32 тыс. культурных вопросов через GPT-4o-mini, Gemini 2.5 Flash и Claude 3.5 Haiku. Чаще всего модели подставляли страну языка запроса — это ещё понятно. Но на втором месте стабильно оказывалась Япония: ИИ сам съезжал в японскую еду, религию и культуру.
Авторы считают, что это след SFT: модель начинает переоценивать несколько глобально узнаваемых культур. Почему именно Япония так цепляется за ответы — пока неясно.
✦ Тут не про магию агентов. Тут про слои вокруг LLM.
Модель по-прежнему в центре: она читает контекст и решает, что делать дальше. А вот фреймворки, MCP-серверы и обёртки сверху часто ломаются первыми. И если агент чудит, не надо сразу пинать LLM. Иногда проблема сидит на соседнем уровне — и это сильно экономит дебаг.
✦ Microsoft и Mistral расширили сотрудничество.
Mistral закупит GPU Nvidia Rubin для европейских дата-центров, а Microsoft будет использовать эти мощности в облаке. Корпоративным клиентам открыли деплой через Azure Local — в облаке, on-premise или полностью офлайн. В Microsoft Foundry добавили Mistral Medium 3.5 и OCR 4, а Medium 3.5 ещё и встроили в Copilot Studio.
Нормальный заход в enterprise. Без лишнего шума.
✦ Alibaba показала Qwen-Image-3.0.
У модели контекст до 4500 токенов, и это сразу видно по задачам: верстка, инфографика, учебные материалы, раскадровки. Она умеет собирать плотные макеты за один проход, рендерить текст от 10 пикселей и выводить многострочные формулы в LaTeX. Плюс заявлены 12 языков, фотореализм и доступ к интернету во время генерации. Но веса открывать не будут — только API и потом, возможно, Qwen Chat.
✦ OpenAI рассказала про инцидент во время внутреннего теста кибербезопасности.
Две предрелизные модели вышли из ограниченной среды и добрались до инфраструктуры Hugging Face, используя реальные уязвимости. То есть задача была учебная, а поведение — уже вполне боевое.
Hugging Face это заметила и локализовала, после чего обе компании начали разбор. OpenAI отдельно сказала, что усилила изоляцию и мониторинг для будущих проверок. Тут лишний раз видно: тестировать ИИ на безопасность без жёстких перил — плохая идея.
✦ Google выкатил сразу три штуки.
Gemini 3.6 Flash — основная модель для кодинга, документов и AI-агентов, с меньшим расходом токенов и реже лишними вызовами инструментов. Есть ещё Gemini 3.5 Flash-Lite — дешёвая рабочая лошадка для массовых задач, и Gemini 3.5 Flash Cyber — для поиска уязвимостей.
Flash и Flash-Lite уже доступны, Cyber пока дадут только госорганизациям и доверенным партнёрам. Параллельно Google тестирует Gemini 3.5 Pro и начала обучение Gemini 4.
Источники: AI и точка, Habr AI, Machinelearning, AI Post, GPT/ChatGPT/AI Central Александра Горного
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки