Почему одного слова «галлюцинация» недостаточно
Под общим термином объединяют разные дефекты: противоречие предоставленному документу, выдуманный факт о мире, несуществующую ссылку, ошибочный вывод и ответ на вопрос, для которого данных недостаточно. Обзор исследований по генерации текста различает формы недостоверности и показывает, что методы оценки зависят от задачи. основание
Если команда считает все ошибки одной долей, она теряет причину и способ исправления. Недостоверная сумма в пересказе договора лечится иначе, чем устаревший факт в ответе без источников. В первом случае можно сравнить вывод с документом; во втором нужен внешний эталон и дата актуальности.
Рабочая таксономия должна быть связана с продуктовым ущербом. Для редактора черновиков важна проверяемость утверждений, для поискового помощника — соответствие найденным фрагментам, для генератора идей часть внешней фактичности может вообще не быть целевой характеристикой.
Верность контексту и внешняя фактичность
Первое полезное разделение — faithfulness и factuality. Верность контексту отвечает на вопрос, следует ли утверждение из предоставленного материала. Внешняя фактичность проверяет соответствие реальному миру или авторитетной базе знаний. Одна и та же фраза может быть верна документу, но неверна в действительности, если исходный документ устарел.
NIST выделяет confabulation как один из рисков генеративного ИИ и связывает управление им с оценкой, документированием ограничений и проверкой результатов в конкретном контексте. основание Для RAG-приложения поэтому нужно отдельно измерять качество retrieval, поддержку ответа источниками и актуальность самих источников.
Практическая маркировка включает три значения: поддержано, противоречит и не подтверждается. Последняя категория важна: отсутствие подтверждения не всегда доказывает ложность, но указывает, что система вышла за доступное основание.
Виды недостоверных утверждений
На уровне содержания удобно выделить сущности, числа, отношения, события, даты, причинные связи и ссылки. Ошибка сущности заменяет участника или объект; числовая ошибка меняет сумму или процент; ошибка отношения неверно связывает факты; временная переносит событие в другой период. Отдельный класс составляют несуществующие документы, DOI, судебные решения и веб-адреса.
Исследовательский benchmark HaluEval формализует проверку галлюцинаций для нескольких типов заданий и демонстрирует необходимость специализированных примеров, а не только общей оценки полезности. основание Для прикладного корпуса категории следует адаптировать к реальным выходам: идентификаторы товаров, пункты регламента, поля договора или параметры кода.
Логические ошибки лучше учитывать отдельно от фактических. Все исходные факты могут быть процитированы правильно, но вывод не следовать из них. Такой дефект требует проверки рассуждения или бизнес-правила, а не поиска вымышленной сущности.
Методы измерения и их сочетание
Точный эталон подходит для закрытых вопросов и извлечения полей. Для длинного текста применяется атомизация: ответ разбивается на проверяемые утверждения, после чего каждое сопоставляется с источником. Итог можно считать как долю подтверждённых утверждений, долю ответов без критических дефектов и среднее число неподтверждённых фрагментов на тысячу слов.
QA-подходы генерируют вопросы по ответу и проверяют, совпадают ли ответы с исходным текстом. QAFactEval показывает, что качество такой метрики зависит от компонентов генерации вопросов, определения ответимости и сравнения ответов. основание Автоматическая оценка поэтому нуждается в калибровке на человеческой разметке.
Модель-судья удобна для масштаба, но может повторять ошибки генератора и быть чувствительной к формулировке рубрики. Практически надёжнее комбинировать автоматический фильтр, детерминированную проверку ссылок и ручной аудит стратифицированной выборки.
Практический пример: обзор нормативного документа
Предположим, помощник составляет обзор внутреннего положения. Ответ делится на предложения, а затем на атомарные тезисы. Для каждого тезиса оценщик указывает номер пункта, который его подтверждает. Если тезис объединяет два разных требования, он разбивается, чтобы частичная поддержка не считалась полной.
Команда вводит четыре типа дефекта: неверная обязанность, ошибочный срок, вымышленное исключение и несуществующая ссылка. Первые три оцениваются по тяжести, поскольку могут изменить действие сотрудника. Ошибка оформления ссылки считается некритической, пока пользователь способен найти правильный пункт.
Отчёт содержит factual precision — долю подтверждённых тезисов, coverage — долю важных требований, попавших в обзор, и critical answer rate — долю ответов без опасных ошибок. Модель с короткими, но подтверждёнными обзорами может быть предпочтительнее более полной версии с убедительными домыслами.
Критерии качественного измерения
Определение ошибки должно быть понятно двум независимым оценщикам. Категории не должны пересекаться без правила приоритета. Эталон обязан иметь дату и происхождение. Для открытых вопросов следует разрешить несколько корректных формулировок и отделять стилистические недостатки от недостоверности.
NIST рекомендует связывать измерения генеративного ИИ с конкретными рисками и контекстами применения, а не переносить один показатель между разными сценариями. основание Поэтому итоговая метрика должна отражать цену ошибки: вымышленная ссылка в юридическом обзоре и неточная деталь в творческом описании имеют разный вес.
Хороший отчёт показывает доверительный интервал или хотя бы объём выборки, разбивку по типам, примеры пограничных решений и согласованность разметки. Сводная цифра публикуется только вместе с этими условиями.
Ограничения автоматических метрик
Лексическое совпадение плохо работает с перефразированием, а семантическая близость может принять правдоподобное противоречие за правильный ответ. QA-метрики зависят от качества сгенерированных вопросов. Судья-LLM способен предпочитать длинные, уверенные или стилистически похожие ответы. Исследовательские обзоры отмечают отсутствие единой универсальной процедуры оценки галлюцинаций для всех задач. основание
Внешняя фактичность особенно сложна для свежих и спорных сведений. Источник может быть неполным, а «истина» меняться со временем. В таких случаях необходимо хранить дату проверки и допускать статус «не удалось установить».
Наконец, измерение по предложениям может скрывать неправильный общий вывод, а оценка только финального вывода — пропускать многочисленные мелкие выдумки. Гранулярность выбирают под действие пользователя и механизм возможного вреда.
Процесс разметки и анализа
Сначала команда собирает реальные ответы и выделяет предварительные категории без попытки сразу вычислить единую метрику. После просмотра нескольких десятков случаев создаётся инструкция с положительными, отрицательными и спорными примерами. Два оценщика размечают пересекающуюся часть, обсуждают расхождения и уточняют границы.
Затем каждому классу назначается способ обнаружения. Ссылки проверяются программно, числа и даты могут сравниваться с таблицами, поддержка текстом оценивается вручную или калиброванной моделью. Новые типы ошибок не втискиваются насильно в старую схему: они попадают в журнал для пересмотра таксономии.
При релизе сравниваются не только средние значения, но и переходы между классами. Версия может снизить число вымышленных фактов, одновременно увеличив необоснованные отказы. Решение должно учитывать обе стороны.
Единица подсчёта и тяжесть дефекта
Доля ошибочных ответов зависит от выбранной единицы. Один длинный ответ может содержать двадцать утверждений и одну ошибку, а короткий — единственный неверный факт. На уровне ответов оба считаются провалом; на уровне утверждений картина различается. Для пользовательского риска полезно публиковать обе перспективы: насколько часто человек встречает хотя бы один дефект и какова плотность недостоверных тезисов.
Тяжесть задаётся через возможное действие. Критический класс включает утверждения, способные изменить платёж, право, медицинское решение или доступ. Существенный класс создаёт заметную потерю времени либо неверный рабочий шаг. Незначительный затрагивает второстепенную деталь без влияния на решение. Эта шкала является редакционной моделью и должна адаптироваться к предметной области.
Нужно учитывать отказ модели от ответа. Агрессивное снижение галлюцинаций может повысить число бесполезных отказов. Поэтому рядом с factuality измеряются answer rate, полнота и способность корректно сообщить о нехватке данных. Иначе система оптимизируется до безопасного, но практически пустого поведения.
Анализ причины после измерения
Тип ошибки не всегда указывает на её источник. Вымышленный факт может появиться из-за плохого retrieval, двусмысленного промпта, устаревшего документа или поведения базовой модели. После разметки полезно проводить root-cause review на выборке критических случаев. Для каждого фиксируются доступный контекст, промежуточные результаты и версия компонентов.
Такая диагностика не входит непосредственно в метрику, но определяет меру. Добавление ещё одного фильтра не поможет, если нужный документ отсутствует в индексе. Напротив, улучшение поиска не устранит склонность модели дополнять ответ сведениями вне контекста. Таксономия результата и таксономия причины должны храниться раздельно.
Вывод
Галлюцинации становятся измеримыми после разложения на конкретные дефекты: противоречие контексту, неподтверждённое внешнее утверждение, ошибку сущности или числа, вымышленную ссылку и логически неверный вывод. Для каждого класса нужен собственный эталон и метод обнаружения.
Практическая система оценки сочетает атомарную разметку, автоматические проверки, ручной контроль и отчёт по тяжести. Она не обещает доказать абсолютную истинность любого текста, но позволяет сравнивать версии и устанавливать границы допустимого использования. Главное — не скрывать неоднородность ошибок за одной удобной цифрой.
Источники
- Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
- Survey of Hallucination in Natural Language Generation
- HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models
- QAFactEval: Improved QA-Based Factual Consistency Evaluation for Summarization