
Сбер открыл доступ к библиотеке SIRIN. Она ищет в ответах языковых моделей вымышленные и неподтверждённые факты. Инструмент делают для разработчиков ИИ-сервисов, а внутри компании его уже проверяли на клиентских сценариях.
SIRIN умеет разбирать и весь ответ целиком, и отдельные куски текста. Система отмечает места, где могут прятаться ошибки, и заодно смотрит, хватает ли модели данных, чтобы отвечать уверенно.
Если данных мало, ИИ-агент может добрать их или просто не отвечать — вместо того чтобы додумывать детали. В Сбере говорят, что метамодели в основе SIRIN подняли точность поиска ошибок почти на 30%, хотя для обучения хватило 250 примеров.
Для рынка это вполне заметный сдвиг. Бизнес всё чаще подключает языковые модели к поддержке клиентов, внутренним базам знаний и агентским сценариям, а цена ошибки там совсем не та, что в чатах для развлечения. И вот тут проверка ответов становится уже отдельным слоем инфраструктуры, а не опцией «на всякий случай».
Проблема «галлюцинаций» у ИИ давно не выглядит чем-то теоретическим. Языковая модель строит ответ по вероятности продолжения текста, поэтому может с одинаковой уверенностью выдать и верный факт, и выдуманную цитату, и несуществующую цифру.
Для массовых сервисов это риск не только для репутации, но и для процессов. В банковских, страховых и сервисных сценариях неподтверждённый ответ может увести клиента по ложному маршруту, а разбираться с этим компании придётся уже после обращения или публикации.
Поэтому в индустрии всё чаще появляются инструменты, которые проверяют не только сам ответ, но и то, на чём он держится. Сейчас разработчикам нужен не просто «умный чат», а система, которая в нужный момент скажет: данных мало, лучше не фантазировать.
У SIRIN здесь есть понятный плюс: Сбер показывает не лабораторный прототип, а библиотеку, которую уже обкатали во внутренних сервисах. Дальше многое будет зависеть от того, как быстро такие проверки получится встроить во внешние продукты компаний, работающих с генеративным ИИ.