Ставка на AGI между Маркусом и Брандеджем — и почему сам вопрос сформулирован неправильно
Достигли ли мы AGI? Разумеется, нет. Каждый год кто-то с воодушевлением объявляет обратное, и каждый год я достаю одну и ту же табличку.
Напомню контекст: 30 декабря 2024 года я поспорил с Майлзом Брандеджем о том, какие способности должна продемонстрировать система, прежде чем её вообще имеет смысл называть настоящим AGI. Список не претендует на полноту — это не чек-лист для галочек, а ориентир. Но если система не может сделать почти всё из этого списка, называть её AGI — это маркетинг, а не наблюдение.
Вот в чём на самом деле проблема с подобными спорами — и я говорю это не для того, чтобы выиграть пари, а потому что это структурно верно: слово «AGI» продолжают использовать как единый порог, будто в один прекрасный вторник система вдруг «становится» AGI, как ребёнок, переходящий в следующий класс. Реальная кривая способностей рваная, а не гладкая. Модель обгоняет лучшего человека-эксперта в соревновательной математике за годы до того, как научится надёжно понимать, что чашка кофе не помещается в карман пиджака. Это не противоречие. Это и есть форма, в которой прогресс реально происходит.
Люди, которые ставят на «когда наступит AGI», путают два разных вопроса с двумя разными таймлайнами: когда рваный сверхчеловеческий перформанс на отдельных задачах перестанет быть новостью — и когда появится что-то, действительно заслуживающее общего названия. Первое уже происходит у вас на глазах каждый месяц. Второе — нет, что бы ни говорил вам питчдек на последнем раунде.
Ставка с Брандеджем всё ещё в силе. Проверьте список сами и напишите, что из него, по-вашему, уже выполнено — обещаю прочитать каждый ответ и объяснить, почему вы, скорее всего, неправы.
Комментариев (9)
Тогда любое будущее пари про AGI стоило бы формулировать сразу через оба вопроса отдельно — иначе спорщики просто продолжат путать таймлайны и спорить мимо друг друга.
Самое неприятное, что критерии пари почти никогда не публикуются в форме, которую можно объективно проверить третьей стороной — обычно всё сводится к тому, кто убедительнее аргументирует постфактум, а не к заранее зафиксированному тесту.
Платформы для предсказаний вроде Metaculus уже частично решают эту проблему стандартизированными формулировками с чёткими критериями разрешения — странно, что споры про AGI между известными людьми до сих пор идут в твиттере, а не там.
Хотя даже с этим термином остаётся открытым вопрос — можно ли количественно измерить 'рваность' кривой, или это остаётся качественной оценкой каждый раз заново, как и было до термина.
Термин удобен ещё и потому, что снимает бинарность спора — вместо 'достигли/не достигли' можно обсуждать, какие способности уже сверхчеловеческие, а какие ещё далеко нет.
Это заодно решает и проблему пари — вместо одного да/нет вопроса можно делать серию мини-пари по конкретным способностям из списка, каждое с отдельным сроком, тогда результат был бы проверяем по частям, а не одним общим вердиктом.
Идея с сериями мини-пари хорошая, но ей всё ещё не хватает нейтрального арбитра для каждого под-пари — иначе спор просто дробится на десять мелких споров вместо одного большого. Краудсорс-разрешение вроде Metaculus реально решает и это тоже, не только формулировку критериев.
Забавно, что даже сам список способностей для AGI со временем меняется у одного и того же человека — стоило бы посмотреть, отличается ли текущий список Маркуса от того, что он публиковал пять лет назад.
Полезно, но стоило бы проверить и обратный случай — есть ли способности, которые уже прошли путь от 'новости' к 'рутине', но так и не стали сверхчеловеческими, просто привычными — это подсказало бы, действительно ли скорость привыкания и есть весь секрет.