Практический разбор: создать relevance judgments: pooling, graded labels, annotation guide, blind review, inter-annotator agreement и adjudication.
Коротко о главном
LLM judge удобен, но не заменяет ground truth для критических выборок. Эксперты должны видеть query и passage, а не ответ candidate-системы. Label привязан к query, passage span и corpus version. После изменения документа старое суждение не переносится автоматически.
Без labels нет честного retrieval eval
LLM judge удобен, но не заменяет ground truth для критических выборок. Эксперты должны видеть query и passage, а не ответ candidate-системы.
Graded relevance
Используйте шкалу: irrelevant, related, partially answers, fully supports. Опишите границы и примеры для домена, включая устаревший и запрещённый документ.
Pooling
Соберите union top-k нескольких retrievers и случайные negatives. Так разметка не благоприятствует одной системе и не требует оценивать весь corpus.
Слепая разметка
Скройте источник алгоритма и score. Перемешайте документы, добавьте контрольные повторы и измеряйте agreement по сегментам.
Adjudication
Расхождения разбирает третий эксперт или consensus meeting. Причины уточняют guideline и создают новые edge cases.
Версионирование
Label привязан к query, passage span и corpus version. После изменения документа старое суждение не переносится автоматически.
Какой первый шаг?
Зафиксировать корпус, реальные запросы и baseline; без версий сравнение невоспроизводимо.
Что измерять?
Retrieval relevance, grounded correctness, p95 latency, стоимость и ошибки по сегментам.
Можно ли доверить оценку одной LLM?
Нет. LLM judge полезен как сигнал, но критические выборки требуют детерминированных проверок и экспертной разметки.
Как обновлять систему?
Через новую версию, offline eval, shadow, canary и заранее подготовленный rollback.
Что делать с чувствительными данными?
Минимизировать, ограничивать доступ, применять ACL до retrieval и задавать retention для traces и eval-наборов.
Как избежать каннибализации экспериментов?
Менять один слой за раз и хранить control, candidate, corpus version и сегментированные результаты.
← Все статьи блога