Что такое flywheel

Production usage создаёт сигналы, они превращаются в размеченные cases, изменения проходят eval и снова выпускаются. Без quality gate это не маховик, а автоматическое закрепление ошибок.

Какие события собирать

Query class, retrieved IDs/ranks, citations opened, user correction, escalation и outcome. Клики неоднозначны, поэтому не называйте их relevance без дополнительного анализа.

Privacy и sampling

Минимизируйте payload, применяйте retention и доступы, исключайте секреты. Стратифицированная выборка должна включать редкие tenants и failures, а не только частые успешные запросы.

Failure taxonomy

Классифицируйте no result, wrong source, stale source, permission denial, unsupported claim и poor answer. Каждому типу соответствует свой слой исправления.

От feedback к eval

Подтверждённый случай становится regression test с source version и expected behavior. Стабильный набор дополняется свежей выборкой для drift.

Безопасный выпуск

Один фактор меняется за эксперимент, затем offline, shadow и canary. Следите за сегментами и откатывайте при ухудшении critical metrics.

Какой первый шаг?
Зафиксировать корпус, реальные запросы и baseline; без версий сравнение невоспроизводимо.
Что измерять?
Retrieval relevance, grounded correctness, p95 latency, стоимость и ошибки по сегментам.
Можно ли доверить оценку одной LLM?
Нет. LLM judge полезен как сигнал, но критические выборки требуют детерминированных проверок и экспертной разметки.
Как обновлять систему?
Через новую версию, offline eval, shadow, canary и заранее подготовленный rollback.
Что делать с чувствительными данными?
Минимизировать, ограничивать доступ, применять ACL до retrieval и задавать retention для traces и eval-наборов.
Как избежать каннибализации экспериментов?
Менять один слой за раз и хранить control, candidate, corpus version и сегментированные результаты.
← Все статьи блога