Категории Нейросети и ИИ

В Сбере открыли библиотеку SIRIN для поиска ошибок в ответах ИИ

В Сбере открыли библиотеку SIRIN для поиска ошибок в ответах ИИ

Сбер открыл доступ к библиотеке SIRIN. Она ищет в ответах языковых моделей вымышленные и неподтверждённые факты. Инструмент делают для разработчиков ИИ-сервисов, а внутри компании его уже проверяли на клиентских сценариях.

SIRIN умеет разбирать и весь ответ целиком, и отдельные куски текста. Система отмечает места, где могут прятаться ошибки, и заодно смотрит, хватает ли модели данных, чтобы отвечать уверенно.

Если данных мало, ИИ-агент может добрать их или просто не отвечать — вместо того чтобы додумывать детали. В Сбере говорят, что метамодели в основе SIRIN подняли точность поиска ошибок почти на 30%, хотя для обучения хватило 250 примеров.

Для рынка это вполне заметный сдвиг. Бизнес всё чаще подключает языковые модели к поддержке клиентов, внутренним базам знаний и агентским сценариям, а цена ошибки там совсем не та, что в чатах для развлечения. И вот тут проверка ответов становится уже отдельным слоем инфраструктуры, а не опцией «на всякий случай».

Читайте также:

Как SIRIN помогает проверять ответы ИИ

Проблема «галлюцинаций» у ИИ давно не выглядит чем-то теоретическим. Языковая модель строит ответ по вероятности продолжения текста, поэтому может с одинаковой уверенностью выдать и верный факт, и выдуманную цитату, и несуществующую цифру.

Для массовых сервисов это риск не только для репутации, но и для процессов. В банковских, страховых и сервисных сценариях неподтверждённый ответ может увести клиента по ложному маршруту, а разбираться с этим компании придётся уже после обращения или публикации.

Поэтому в индустрии всё чаще появляются инструменты, которые проверяют не только сам ответ, но и то, на чём он держится. Сейчас разработчикам нужен не просто «умный чат», а система, которая в нужный момент скажет: данных мало, лучше не фантазировать.

У SIRIN здесь есть понятный плюс: Сбер показывает не лабораторный прототип, а библиотеку, которую уже обкатали во внутренних сервисах. Дальше многое будет зависеть от того, как быстро такие проверки получится встроить во внешние продукты компаний, работающих с генеративным ИИ.