
Австралийский криптокроссворд снова показал, где у ИИ начинаются проблемы. Журналист Gizmodo взял несколько самых колючих подсказок из пятничного пазла DA и прогнал их через ChatGPT, Claude Sonnet 5 и OreateAI. Картина вышла рваной: одна модель схватывала сразу, другая вязла в буквенном разборе, третья то отвечала, то пыталась выкрутиться.
Повод для этой затеи подкинул и сам рынок. Накануне Firefox объявил о ежедневном ИИ-кроссворде на новой вкладке, так что игра с буквами снова выплыла в цифровой витрине. Только криптокроссворд в британско-австралийской традиции устроен совсем иначе: это не поиск синонима, а мини-детектив, где подсказка одновременно и определение, и схема сборки ответа.
Для проверки взяли не абы что, а пятничный криптокроссворд австралийского сеттера DA из Sydney Morning Herald и The Age. У этого автора репутация такая, что его инициалы расшифровывают как «don’t attempt». В наборе были подсказки разной степени злости — от почти прямых до совсем коварных, а результаты считали по 50-балльной шкале. ChatGPT набрал 27 баллов, OreateAI — 21, Claude — 7. Последний, по сути, и правда провалился.
Самые интересные расхождения всплыли на коротких и длинных подсказках. ChatGPT почти мгновенно раскусил «Pinkie, capisce?» и выдал «DIGIT», а вот на «January 15, 2000?» с уверенным видом предложил неправильный вариант. OreateAI, наоборот, тратил больше времени, но в ряде случаев точнее считывал механику криптоподсказки, включая хитрое чтение «A dyer backing reduced labour now and then».
Эксперимент был устроен без всякой академической мишуры. Автор взял несколько подсказок из одного и того же DA-пазла и скормил их трём чатботам: ChatGPT, Claude Sonnet 5 и OreateAI. Заодно он сравнивал и скорость, и манеру ответа — в криптокроссворде важно не только попасть в слово, но и понять, тянет ли модель игру слов сама или просто крутится вокруг догадки после длинных объяснений.
И вот тут криптокроссворды особенно неудобны для ИИ. Большие языковые модели умеют собирать анаграммы, подбирать рифмы, вытаскивать ассоциации, но криптоподсказка часто требует сразу нескольких действий: заметить определение, отделить его от шифровки, распознать анаграмму или реверс и ещё учесть длину ответа. В обычном разговоре это кажется ерундой. В криптокроссворде именно на таких мелочах всё и ломается.
На этом фоне особенно смешно выглядела одна из моделей, которая повела себя как не самый добросовестный студент. OreateAI в одном эпизоде не только выдал ответ, но и нашёл саму подсказку в интернете, после чего объявил успех. Для кроссворда это уже не решение. Это читерство с очень серьёзным лицом.
Криптокроссворды в Британии и Австралии давно живут как отдельный жанр, а в США так и остаются нишей. Поэтому модели, натренированные на гигантских массивах общего языка, чаще уверенно чувствуют себя в прямых или американских подсказках, чем в задачах, где слово «wolfed» может означать «ate up», а дата «January 15, 2000» через календарный и буквенный трюк превращается в «midsummer». Для человека это привычная игра по правилам жанра. Для машины — набор ловушек, и довольно злых.
У всей этой истории есть и более широкий смысл. Одни компании уже добавляют ИИ-кроссворды в браузеры и новостные ленты, другие пытаются доказать, что модели умеют решать более хитрые языковые задачи без подсказок и костылей. Криптокроссворд в этом смысле удобен как лакмус: он проверяет не объём памяти и не уверенность тона, а способность удерживать несколько слоёв смысла сразу. На таком поле чатботы уже не выглядят непогрешимыми, даже если стараются изо всех сил.
И, похоже, людям это ещё какое-то время будет давать небольшое преимущество в одной из самых странных интеллектуальных игр на английском. Чем глубже ИИ будут вшивать в повседневные сервисы, тем чаще им придётся сталкиваться не только с вопросами вроде «что это?», но и с задачами в духе «как это закручено?». Криптокроссворды как раз про второе. И именно поэтому они так упорно не сдаются.