3 Эры развития ИИ

Недавно, мой друг поделился со мной очень занимательным видением двух значимых фигур в текущей технологической гонке: Дэвида Сильвера - ведущий архитектор AlphaGo, AlphaZero, MuZero в Google DeepMind и Ричарда Саттона - соавтор канонического университетского учебника Reinforcement Learning: An Introduction (Sutton & Barto)

В статье масса интересных тезисов, но я выделил для себя раздел, связанный с изолированностью модели от окружающей среды, который и мешает ей сейчас эволюционировать на следующую ступень развития.

Авторы описали 3 главных эры: I. Эра симуляции: RL осваивал сложные задачи в симуляторах с чётким reward-сигналом: нарды (TD-Gammon), Go, шахматы, покер, Stratego, Atari, StarCraft II, Dota 2, Gran Turismo, кубик Рубика. Однако эти системы не вышли за пределы симуляции. Они слишком узконаправленны. II. Эра человеческих данных: огромные вычислительные мощности, которые смогли обработать гигантский массив человеческих артефактов, дали языковую универсальность и широкие компетенции. RL как метод отошёл на второй план. Пример: текущие LLM обучены на огромном массиве текстов, оставленных людьми в сети, и решают задачи практически любого типа. III. Эра опыта. Агент живёт в непрерывном потоке действий и наблюдений, как человек. Информация переносится через весь поток, поведение адаптируется и самокорректируется. Цели могут лежать далеко в будущем. Пример: научный агент ставит цель, к примеру, синтезировать новый материал. Агент анализирует наблюдения, гоняет симуляции, предлагает реальные эксперименты.

И действительно, взаимодействие с физической реальностью - это следующий логичный шаг для реализации ИИ-потенциала. Меня, конечно, это не перестаёт беспокоить. По моему мнению, человечество ещё не готово к таким серьёзным инновациям. Я искренне убежден, что не существует плохой технологии. Существуют благие или деструктивные мотивы её использовать. А это уже раздел этики, который, как по мне, находится достаточно на низком уровне в 2026 году.

3 Эры развития ИИ | Сетка — социальная сеть от hh.ru