Блог / ИИ-агенты, скиллы и автоматизация
ИИ-агенты, скиллы и автоматизация
Галлюцинации в RAG: почему retrieval не гарантирует правдивый ответ
Практический разбор: снижать hallucinations в RAG: answerability, context precision, conflicting sources, grounded generation, citations, abstention и evals.
ИИ-агенты, скиллы и автоматизация
Коротко о главном
Система может найти нерелевантный chunk, пропустить условие, смешать версии или проигнорировать контекст. Ошибка делится на retrieval, context assembly и generation. Разделяйте context recall, context precision, faithfulness, answer correctness и abstention quality. Regression включает прошлые инциденты и отрицательные вопросы.
RAG не является гарантией
Система может найти нерелевантный chunk, пропустить условие, смешать версии или проигнорировать контекст. Ошибка делится на retrieval, context assembly и generation.
Answerability gate
До ответа оцените, есть ли достаточное evidence. Ближайший vector существует почти всегда, даже для бессмысленного вопроса; поэтому нужен calibrated отказ.
Context precision
Большой top-k добавляет шум и противоречия. Reranking, deduplication и context budget повышают долю полезного evidence, но не исправляют отсутствующий документ.
Конфликт источников
Показывайте версии и даты, применяйте authority policy и не сливайте несовместимые цифры. Если конфликт не разрешён — сообщите его явно.
Grounded generation
Модель получает IDs evidence и должна связывать claims с ними. Сервер валидирует citations; неподтверждённые claims удаляются или отправляются на review.
Evals
Разделяйте context recall, context precision, faithfulness, answer correctness и abstention quality. Regression включает прошлые инциденты и отрицательные вопросы.
Какой первый шаг?
Зафиксировать корпус, реальные запросы и baseline; без версий сравнение невоспроизводимо.
Что измерять?
Retrieval relevance, grounded correctness, p95 latency, стоимость и ошибки по сегментам.
Можно ли доверить оценку одной LLM?
Нет. LLM judge полезен как сигнал, но критические выборки требуют детерминированных проверок и экспертной разметки.
Как обновлять систему?
Через новую версию, offline eval, shadow, canary и заранее подготовленный rollback.
Что делать с чувствительными данными?
Минимизировать, ограничивать доступ, применять ACL до retrieval и задавать retention для traces и eval-наборов.
Как избежать каннибализации экспериментов?
Менять один слой за раз и хранить control, candidate, corpus version и сегментированные результаты.
← Все статьи блога