Moonshot AI выпустила техотчёт Kimi K3.

Краткие выводы по архитектуре Kimi K3

1. Контекст и память: Гибридная архитектура (KDA + MLA) поддерживает нативный контекст до 1 млн токенов, устраняя линейный рост KV-кэша и необходимость позиционных эмбеддингов (RoPE/YaRN). 2. Вычислительная эффективность: LatentMoE (896 экспертов, 16 активных) в сочетании со сжатием латентного пространства, SiTU-GLU и Quantile Balancing снижает нагрузку на пропускную способность памяти и стабилизирует маршрутизацию без ручной настройки. 3. Агентные возможности: Обеспечиваются не масштабом, а RL-обучением с сохранением состояния среды (AgentENV) и штрафами за превышение вычислительного бюджета, что предотвращает избыточную генерацию. 4. Требования к развертыванию:

  • Необходим кластер от 64 ускорителей для экспертного параллелизма (MoonEP).
  • Префиксное кэширование работает только на строгих границах контрольных состояний KDA.
  • API критически чувствителен к разрывам сессии: требуется полная передача истории, включая reasoning_content и tool_calls.