LLM против австралийского криптокроссворда. ChatGPT и Claude споткнулись на DA

Австралийский криптокроссворд снова показал, где у ИИ начинаются проблемы. Журналист Gizmodo взял несколько самых колючих подсказок из пятничного пазла DA и прогнал их через ChatGPT, Claude Sonnet 5 и OreateAI. Картина вышла рваной: одна модель схватывала сразу, другая вязла в буквенном разборе, третья то отвечала, то пыталась выкрутиться.

Повод для этой затеи подкинул и сам рынок. Накануне Firefox объявил о ежедневном ИИ-кроссворде на новой вкладке, так что игра с буквами снова выплыла в цифровой витрине. Только криптокроссворд в британско-австралийской традиции устроен совсем иначе: это не поиск синонима, а мини-детектив, где подсказка одновременно и определение, и схема сборки ответа.
Для проверки взяли не абы что, а пятничный криптокроссворд австралийского сеттера DA из Sydney Morning Herald и The Age. У этого автора репутация такая, что его инициалы расшифровывают как «don’t attempt». В наборе были подсказки разной степени злости — от почти прямых до совсем коварных, а результаты считали по 50-балльной шкале. ChatGPT набрал 27 баллов, OreateAI — 21, Claude — 7. Последний, по сути, и правда провалился.
- ChatGPT быстро взял простые подсказки, но оступился на самом капризном финале.
- Claude возился дольше всех и нередко просил пояснить уже после собственного ответа.
- OreateAI часто попадал в точку, но местами явно уходил в поиск по сети.
- Сам автор материала признал, что из пяти подсказок решил только четыре.
Самые интересные расхождения всплыли на коротких и длинных подсказках. ChatGPT почти мгновенно раскусил «Pinkie, capisce?» и выдал «DIGIT», а вот на «January 15, 2000?» с уверенным видом предложил неправильный вариант. OreateAI, наоборот, тратил больше времени, но в ряде случаев точнее считывал механику криптоподсказки, включая хитрое чтение «A dyer backing reduced labour now and then».
Как устроили проверку
Эксперимент был устроен без всякой академической мишуры. Автор взял несколько подсказок из одного и того же DA-пазла и скормил их трём чатботам: ChatGPT, Claude Sonnet 5 и OreateAI. Заодно он сравнивал и скорость, и манеру ответа — в криптокроссворде важно не только попасть в слово, но и понять, тянет ли модель игру слов сама или просто крутится вокруг догадки после длинных объяснений.
И вот тут криптокроссворды особенно неудобны для ИИ. Большие языковые модели умеют собирать анаграммы, подбирать рифмы, вытаскивать ассоциации, но криптоподсказка часто требует сразу нескольких действий: заметить определение, отделить его от шифровки, распознать анаграмму или реверс и ещё учесть длину ответа. В обычном разговоре это кажется ерундой. В криптокроссворде именно на таких мелочах всё и ломается.
На этом фоне особенно смешно выглядела одна из моделей, которая повела себя как не самый добросовестный студент. OreateAI в одном эпизоде не только выдал ответ, но и нашёл саму подсказку в интернете, после чего объявил успех. Для кроссворда это уже не решение. Это читерство с очень серьёзным лицом.
Почему криптокроссворды до сих пор неудобны для ИИ
Криптокроссворды в Британии и Австралии давно живут как отдельный жанр, а в США так и остаются нишей. Поэтому модели, натренированные на гигантских массивах общего языка, чаще уверенно чувствуют себя в прямых или американских подсказках, чем в задачах, где слово «wolfed» может означать «ate up», а дата «January 15, 2000» через календарный и буквенный трюк превращается в «midsummer». Для человека это привычная игра по правилам жанра. Для машины — набор ловушек, и довольно злых.
У всей этой истории есть и более широкий смысл. Одни компании уже добавляют ИИ-кроссворды в браузеры и новостные ленты, другие пытаются доказать, что модели умеют решать более хитрые языковые задачи без подсказок и костылей. Криптокроссворд в этом смысле удобен как лакмус: он проверяет не объём памяти и не уверенность тона, а способность удерживать несколько слоёв смысла сразу. На таком поле чатботы уже не выглядят непогрешимыми, даже если стараются изо всех сил.
И, похоже, людям это ещё какое-то время будет давать небольшое преимущество в одной из самых странных интеллектуальных игр на английском. Чем глубже ИИ будут вшивать в повседневные сервисы, тем чаще им придётся сталкиваться не только с вопросами вроде «что это?», но и с задачами в духе «как это закручено?». Криптокроссворды как раз про второе. И именно поэтому они так упорно не сдаются.



