"""

Почему историю искусственного интеллекта читают через вехи?

Историю искусственного интеллекта обычно рассматривают не как результат одного открытия, а как сумму рывков, которые меняли сам подход к работе. Сам термин вошёл в научный обиход после Dartmouth Conference 1956 года, а в последующие годы появились ключевые пороги, определившие пределы обучающихся систем. Эти вехи показывают и то, на каких технических кирпичиках сегодня строятся языковые модели.

Первые поворотные моменты: как складывалась математика обучения?

1) Перцептрон и первая модель искусственных нейронных сетей

Когда Фрэнк Розенблатт представил перцептрон в 1958 году, идея о том, что машина может учиться простым границам принятия решений на примерах, стала реальностью. Эта однослойная модель была далека по возможностям от современных глубоких сетей, однако превратила подход искусственного нейрона в прикладную инженерную задачу.

2) Обратное распространение открыло путь многослойным сетям

В 1986 году работа Дэвида Румельхарта, Джеффри Хинтона и Рональда Уильямса, опубликованная в Nature, сделала алгоритм обратного распространения ошибки массово известным. Суть метода заключалась в том, чтобы распределять ошибку от конца сети к её началу и таким образом обновлять веса; это сделало обучение многослойных сетей практически осуществимым.

3) Deep Blue: демонстрация силы символического ИИ

Шахматный компьютер IBM Deep Blue в 1997 году обыграл чемпиона мира Гарри Каспарова и резко повысил заметность искусственного интеллекта в общественном сознании. Этот успех опирался не на deep learning в современном смысле, а на вычислительную мощность и стратегии поиска; тем не менее он показал, что машины способны доминировать в сложных областях принятия решений.

Какие рывки произошли от глубокого обучения к transformer?

4) AlexNet вывел deep learning в мейнстрим

Успех AlexNet на конкурсе ImageNet 2012 ускорил интерес к deep learning в задачах распознавания изображений. Стало ясно, что многослойные сети в сочетании с большими данными и мощным оборудованием способны давать заметные результаты там, где раньше задача считалась слишком сложной.

5) AlphaGo вынес reinforcement learning на широкую аудиторию

Программа DeepMind AlphaGo в 2016 году обозначила новый рубеж, обыграв чемпиона по игре в го Ли Седоля со счётом 4:1. Этот пример показал, что соединение глубоких нейронных сетей и обучения с подкреплением позволяет создавать системы, которые не просто распознают шаблоны, но и выстраивают стратегию.

6) Архитектура transformer и механизм внимания

Опубликованная в 2017 году статья “Attention Is All You Need” представила архитектуру transformer. Разработанный Ашишем Васвани и командой Google подход вывел на первый план обработку последовательностей через механизм внимания, который позволяет выбирать, какая информация важнее, и позже стал основой для семейств BERT и GPT.

Как из этого наследия выросли сегодняшние языковые модели?

Современные большие языковые модели объединяют под одной крышей идею искусственных нейронных сетей, начатую перцептроном, методы обучения, обеспеченные обратным распространением, масштабируемость deep learning и структуру внимания из transformer. Шахматы и го, в свою очередь, помогли понять, что такие системы не только обрабатывают данные, но и способны выстраивать стратегию внутри самой задачи.

Присуждение Нобелевской премии по физике 2024 года Джону Хопфилду и Джеффри Хинтону также вновь подчеркнуло научную значимость этой исторической линии. Иными словами, сегодняшние генеративные инструменты ИИ не появились внезапно: они выросли из многолетнего накопления в области машинного обучения.

"""