Когда одного поиска мало

Если вопрос связывает фильм с режиссёром и режиссёра с местом рождения, второй документ не содержит исходные слова. Reranking не поможет: он переставляет только уже найденное.

Цикл hop

Первый retrieval находит стартовые сущности. Planner формулирует один недостающий под-вопрос, выполняется следующий retrieval, а evidence добавляется в состояние. Число hops и общий token budget ограничены.

Evidence graph

Храните nodes-факты и edges-связи с source IDs. Финальный ответ должен опираться на полный путь, а не только последний документ. Конфликтующие ветви сохраняются до явного разрешения.

Stopping rules

Остановка наступает, когда все обязательные slots подтверждены, достигнут max hops или новые запросы не добавляют evidence. Ответ DONE от модели проверяется структурированным contract.

Fusion и дедупликация

Объединяйте результаты всех hops, например через RRF, затем удаляйте перекрывающиеся chunks. Не выбрасывайте ранний документ: он связывает финальный факт с исходным вопросом.

Стоимость и безопасность

Каждый hop умножает model calls и поверхность prompt injection. ACL применяется заново на каждом retrieval; tools имеют лимиты; trace связывает subquery, candidates и решение planner.

Eval-набор

Отдельно размечайте single-hop и multi-hop вопросы, правильные intermediate entities и полный supporting path. Измеряйте hop recall, path completeness, correctness, citations, latency и runaway rate.

С чего начать?
С ограниченного корпуса, реальных запросов и измеримого baseline. Зафиксируйте версии данных, retrieval и модели до эксперимента.
Какие метрики обязательны?
Retrieval quality, correctness ответа, p95 latency, стоимость и ошибки по отдельным сегментам запросов.
Можно ли копировать настройки из документации?
Только как baseline. Финальные параметры выбираются по вашему корпусу, фильтрам, языку и нагрузке.
Как выпускать изменение?
Собрать новую версию рядом, прогнать offline eval и shadow, затем canary с готовым rollback.
Что логировать?
Trace ID, версии pipeline и индекса, transformed queries, candidate IDs, filters и итоговые метрики без лишнего чувствительного payload.
Как избежать утечки данных?
Проверять identity и ACL до retrieval, изолировать кэши и повторно проверять права при показе citations.
← Все статьи блога