Без labels нет честного retrieval eval

LLM judge удобен, но не заменяет ground truth для критических выборок. Эксперты должны видеть query и passage, а не ответ candidate-системы.

Graded relevance

Используйте шкалу: irrelevant, related, partially answers, fully supports. Опишите границы и примеры для домена, включая устаревший и запрещённый документ.

Pooling

Соберите union top-k нескольких retrievers и случайные negatives. Так разметка не благоприятствует одной системе и не требует оценивать весь corpus.

Слепая разметка

Скройте источник алгоритма и score. Перемешайте документы, добавьте контрольные повторы и измеряйте agreement по сегментам.

Adjudication

Расхождения разбирает третий эксперт или consensus meeting. Причины уточняют guideline и создают новые edge cases.

Версионирование

Label привязан к query, passage span и corpus version. После изменения документа старое суждение не переносится автоматически.

Какой первый шаг?
Зафиксировать корпус, реальные запросы и baseline; без версий сравнение невоспроизводимо.
Что измерять?
Retrieval relevance, grounded correctness, p95 latency, стоимость и ошибки по сегментам.
Можно ли доверить оценку одной LLM?
Нет. LLM judge полезен как сигнал, но критические выборки требуют детерминированных проверок и экспертной разметки.
Как обновлять систему?
Через новую версию, offline eval, shadow, canary и заранее подготовленный rollback.
Что делать с чувствительными данными?
Минимизировать, ограничивать доступ, применять ACL до retrieval и задавать retention для traces и eval-наборов.
Как избежать каннибализации экспериментов?
Менять один слой за раз и хранить control, candidate, corpus version и сегментированные результаты.
← Все статьи блога