NGI | Влад Корнышев про AI и создание AI-продуктов
@NGI_ru
Почему я не считаю, что LLM - это путь к AGI
В конце вчерашнего поста по итогам презентации OpenAI я написал, что мы почти выжимаем максимум из LLM в их текущем виде. Эта мысль регулярно всплывает в разговорах с коллегами из индустрии - и сегодня хочу чуть подробнее расписать, почему я всё сильнее убеждаюсь, что LLM - это не прямой путь к AGI, а скорее один из важнейших, но не единственный, шаг к нему.
Фундаментально всё упирается в архитектуру. LLM - это гениальный автокомплит. Вся их магия - это невероятно сложная и отточенная на триллионах слов способность предсказывать следующее наиболее вероятное слово. И из этой задачи берутся все их сильные стороны и ограничения.
1. Язык - это не весь мир
LLM великолепно работают с языком и кодом - по сути, тоже языком, просто формальным. И то и другое - мир символов, но не людей. Наглядно на примере: возьмем слово
Поэтому в медицине, финансах и инженерии, даже если используется LLM, то делает это как интерфейс или ассистент, а не как основной ”мозг”. Чтобы язык имел ценность, за ним должны стоять модели, которые работают с реальностью: числами, физическими измерениями, причинно-следственными связями. Без этого заземления интеллект остается поверхностным.
2. LLM - это про корелляцию, а не про логику
LLM идеально находят корреляции. Они знают, что за вспышкой молнии почти всегда следует раскат грома, они знают что это происходит из-за разницы скорости света и звука, но они не понимают, связи между этими явлениями. В ответе они оперируют паттернами из данных, а не законами логики и физики.
Это приводит к двум последствиям:
- Ненадежность в новых задачах: Если дать LLM нестандартную логическую головоломку, которой не было в обучающей выборке, она скорее всего ошибется, пытаясь решить ее “по аналогии”, а не путем строгих выводов. GPT 5 все еще не справляется с простой логической задачкой, которую я придумал почти год назад (см скрин)
- Шаблонность решений: LLM - это конструкторы. Если внимательно смотреть на сайты, дизайн, документацию, советы или даже код, созданные ИИ, то легко заметить повторяющиеся структуры, любимые фразы, характерные ошибки. Причём у каждой модели свой почерк, который легко распознать, если много с ними работаешь. Это значит, что LLM не генерируют принципиально новое - они комбинируют уже существующие паттерны.
3. Замороженные знания и неспособность учиться на лету
Модель обучается на статичном срезе данных (условно, интернет до декабря 2024). После этого ее знания зафиксированы. Если вы сообщите ей новый факт, она не встроит его в свою нейронную сеть. В новом окне она его забудет. Методы вроде RAG - это костыли, которые позволяют подсовывать модели актуальную информацию: in context learning - это не lifelong learning. Настоящий интеллект должен быть способен к непрерывному обучению - усваивать новую информацию на лету и интегрировать ее в существующую картину мира, не разрушая ее. LLM так не умеют, да и технически это сложно реализуемо.
Так что же нужно для AGI?
Это не одна гигантская нейросеть, а сложная гибридная система, где LLM - выполняют роль языкового процессора.
Настоящему AGI также понадобятся:
- способность симулировать реальность для планирования (ответ на вопрос: “А что, если?”);
- отдельное логическое ядро для проверки гипотез, которые генерят LLM;
⁃ воплощение в физическом мире для “заземления” знаний через датчики и манипуляторы;
⁃ агентность - умение самостоятельно ставить и достигать цели;
Из всего этого у нас есть подвижки только в агентности 😁
А что вы думаете про достижение AGI?
В конце вчерашнего поста по итогам презентации OpenAI я написал, что мы почти выжимаем максимум из LLM в их текущем виде. Эта мысль регулярно всплывает в разговорах с коллегами из индустрии - и сегодня хочу чуть подробнее расписать, почему я всё сильнее убеждаюсь, что LLM - это не прямой путь к AGI, а скорее один из важнейших, но не единственный, шаг к нему.
Фундаментально всё упирается в архитектуру. LLM - это гениальный автокомплит. Вся их магия - это невероятно сложная и отточенная на триллионах слов способность предсказывать следующее наиболее вероятное слово. И из этой задачи берутся все их сильные стороны и ограничения.
1. Язык - это не весь мир
LLM великолепно работают с языком и кодом - по сути, тоже языком, просто формальным. И то и другое - мир символов, но не людей. Наглядно на примере: возьмем слово
стул. Для LLM - это не предмет с ножками, на котором сидят, а вектор, статистически связанный с векторами сидеть, стол, мебель. Модель не знает, “Что есть стул в реальном мире?”, так как у нее нет опыта взаимодействия с этим миром. Она может написать, что если толкнуть стул, он упадет, потому что читала об этом. Но она не понимает этого на уровне интуитивной физики.Поэтому в медицине, финансах и инженерии, даже если используется LLM, то делает это как интерфейс или ассистент, а не как основной ”мозг”. Чтобы язык имел ценность, за ним должны стоять модели, которые работают с реальностью: числами, физическими измерениями, причинно-следственными связями. Без этого заземления интеллект остается поверхностным.
2. LLM - это про корелляцию, а не про логику
LLM идеально находят корреляции. Они знают, что за вспышкой молнии почти всегда следует раскат грома, они знают что это происходит из-за разницы скорости света и звука, но они не понимают, связи между этими явлениями. В ответе они оперируют паттернами из данных, а не законами логики и физики.
Это приводит к двум последствиям:
- Ненадежность в новых задачах: Если дать LLM нестандартную логическую головоломку, которой не было в обучающей выборке, она скорее всего ошибется, пытаясь решить ее “по аналогии”, а не путем строгих выводов. GPT 5 все еще не справляется с простой логической задачкой, которую я придумал почти год назад (см скрин)
- Шаблонность решений: LLM - это конструкторы. Если внимательно смотреть на сайты, дизайн, документацию, советы или даже код, созданные ИИ, то легко заметить повторяющиеся структуры, любимые фразы, характерные ошибки. Причём у каждой модели свой почерк, который легко распознать, если много с ними работаешь. Это значит, что LLM не генерируют принципиально новое - они комбинируют уже существующие паттерны.
3. Замороженные знания и неспособность учиться на лету
Модель обучается на статичном срезе данных (условно, интернет до декабря 2024). После этого ее знания зафиксированы. Если вы сообщите ей новый факт, она не встроит его в свою нейронную сеть. В новом окне она его забудет. Методы вроде RAG - это костыли, которые позволяют подсовывать модели актуальную информацию: in context learning - это не lifelong learning. Настоящий интеллект должен быть способен к непрерывному обучению - усваивать новую информацию на лету и интегрировать ее в существующую картину мира, не разрушая ее. LLM так не умеют, да и технически это сложно реализуемо.
Так что же нужно для AGI?
Это не одна гигантская нейросеть, а сложная гибридная система, где LLM - выполняют роль языкового процессора.
Настоящему AGI также понадобятся:
- способность симулировать реальность для планирования (ответ на вопрос: “А что, если?”);
- отдельное логическое ядро для проверки гипотез, которые генерят LLM;
⁃ воплощение в физическом мире для “заземления” знаний через датчики и манипуляторы;
⁃ агентность - умение самостоятельно ставить и достигать цели;
Из всего этого у нас есть подвижки только в агентности 😁
А что вы думаете про достижение AGI?
👍 23
❤ 11
🔥 5
🤔 2
24 29 1.3K
Обсуждение 24
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram