CUSP показал предел ИИ в науке: объяснять открытия модели умеют лучше, чем угадывать их

Искусственный интеллект уже неплохо разбирает научные прорывы, которые случились. А вот с будущими у него всё куда хуже. Это и показал тест CUSP: шесть крупных моделей прогнали через 4 760 научных событий из восьми дисциплин. И вышло довольно неприятно для тех, кто ждёт от ИИ почти пророческих способностей: объяснять и предсказывать — это разные задачи.
На проверке механизмов модели чаще угадывали правдоподобную цепочку событий. На вопрос «что могло привести к открытию?» ответы были заметно лучше, чем на «случится ли это вообще?» и «когда именно?». GPT-5.4 в задачах на выбор механизма дошёл до 79,2%, Claude S4.5 — до 69,9%. А вот там, где требовалось оценить сам факт реализации результата, всё уже выглядело скромнее: 49,1% у GPT-5.4 и 52,6% у Claude S4.5.
Отдельно всплыло ещё одно слабое место, о котором обычно говорят меньше, чем о длине контекста или скорости ответа. Модели чаще ошибались не в сторону слишком раннего прогноза, а наоборот — слишком позднего. Событие они нередко «замечали» уже после того, как оно становилось публичным фактом. Разброс по датам тоже оказался неприятным. У LLaMA 3.3 ошибка составила 4,9 месяца, у DeepSeek R1 — 15,7 месяца, а у моделей предыдущего поколения она уходила за два года.
Авторы CUSP сравнили ИИ с людьми, и картина получилась показательной. Эксперты оценили реализуемость научных событий точнее, чем GPT-4o: 73% против 52,5%. Это не делает модели бесполезными для науки. Но их сильная сторона сейчас, похоже, в другом: они лучше собирают уже накопленные знания в связный ответ, чем делают ставку на то, какая гипотеза дойдёт до статьи, патента или эксперимента.
ИИ в науке: почему он уверенно объясняет прошлое
Разница между «понять» и «предсказать» в науке оказалась жёстче, чем многие ожидали. ИИ спокойно работает там, где нужно склеить разрозненные факты в правдоподобную картину. Но когда речь идёт о редком событии, да ещё и в условиях неполной информации, он начинает спотыкаться.
Для языковых моделей это, в общем, естественная ловушка. Они учатся на массиве текстов, а не на самой механике научного процесса, где есть задержки, эксперименты, финансирование и просто случайность. И вот тут разница между красивым объяснением и реальным прогнозом становится очень заметной.
У CUSP есть и прикладной смысл, который выходит за рамки очередной проверки «умности» моделей. На фоне гонки между OpenAI, Anthropic, Google DeepMind и китайскими разработчиками научные сценарии всё чаще используют как аргумент в пользу более дорогих и более мощных систем. Но если модель убедительно расписывает путь к открытию и при этом промахивается со сроками почти на год, для лабораторий и фондов это уже совсем не мелочь.
Есть и более широкий фон. ИИ уже несколько лет пытаются пристроить к научному планированию: от подбора кандидатов для молекулярного дизайна до отбора тем для исследований и автоматизации литературных обзоров. При этом даже удачные кейсы в биологии, материаловедении и химии обычно остаются локальными: у модели есть чёткие рамки и много проверяемых данных. CUSP показывает, что на общую научную разведку это пока не очень переносится.
Что это меняет для лабораторий и инвесторов
Самый удобный сценарий для ИИ в науке всё тот же: ускорять анализ, подкидывать гипотезы, помогать разбирать варианты. Самый трудный — и самый дорогой — заранее понять, какой из этих вариантов действительно дойдёт до результата. Поэтому тесты вроде CUSP нужны не ради красивой демонстрации, а для довольно приземлённых решений: куда пойдут деньги, время и ресурсы.
Для научных организаций вывод простой. Модели уже можно использовать как сильный инструмент черновой аналитики, но не как самостоятельный компас для ставок на будущие открытия. А вот когда появятся более надёжные способы оценивать вероятность и сроки прорывов, рынок научного ИИ будет выглядеть совсем иначе. Пока же лучшие системы всё ещё лучше отвечают на вопрос «почему это сработало», чем на вопрос «сработает ли это вообще».



