Observatório de sistemas

Por que 965 documentos não bastaram neste experimento de RAG

O corpus escrito reuniu 965 documentos e passou por verificações agregadas de chunks. Ainda assim, a união entre busca semântica e híbrida deixou 3 das 16 consultas sem o resultado esperado no top 5.

Do recorte do corpus à auditoria de chunks[build-stats][chunk-audit]

O recorte deste experimento começou com 12.618 registros, manteve 3.722 itens elegíveis após deduplicação e escreveu 965 documentos.[build-stats]

A auditoria agregada registrou 965 documentos e 8.704 chunks, sem chunks vazios, IDs de chunk duplicados ou documentos sem chunks.[chunk-audit]

A recuperação observada na avaliação de 16 consultas[retrieval-eval][evaluation-scope]

Na avaliação com 16 consultas, a busca semântica registrou recall@5 de 0,6875 e MRR de 0,4798. A busca híbrida registrou recall@5 de 0,75 e MRR de 0,5021.[retrieval-eval][evaluation-scope]

A união dos resultados semântico e híbrido registrou recall@5 de 0,8125 e MRR de 0,54375, mas ainda teve 3 misses entre as 16 consultas.[union-eval][evaluation-scope]

Enriquecimento e descritor nas métricas observadas[retrieval-eval][enriched-eval][descriptor-eval]

O enriquecimento testado manteve as métricas de recall@5 e MRR da avaliação base e apresentou medianas de latência maiores no ambiente observado: 403,67 ms no modo semântico e 616,04 ms no híbrido, ante 345,34 ms e 458,87 ms na avaliação base.[retrieval-eval][enriched-eval]

O descritor testado registrou recall@5 de 0,75 e MRR de 0,5021, sem melhora agregada sobre a busca híbrida base nessas duas métricas. Sua latência mediana observada foi de 709,19 ms.[retrieval-eval][descriptor-eval]

Escopo das conclusões[evaluation-scope][sanitization-scope]

Estes resultados se restringem ao corpus, à coleção, às configurações e ao ambiente deste experimento. Recall@5 registra a presença do resultado esperado no top 5, enquanto MRR considera sua posição; isoladamente, essas métricas não avaliam qualidade de resposta, utilidade ao usuário ou prontidão operacional.[evaluation-scope]

As latências relatadas são observações deste ambiente, e não um benchmark controlado entre infraestruturas.[retrieval-eval][enriched-eval][descriptor-eval][evaluation-scope]

O pacote editorial contém somente métricas agregadas e sanitizadas; consultas, documentos, respostas, identificadores internos e resultados individuais não foram incluídos.[sanitization-scope]

Limitações

Onde esta conclusão termina.

  • A avaliação contém somente 16 consultas e não sustenta generalizações universais sobre sistemas RAG.
  • Os resultados descrevem um corpus, uma coleção, configurações e um ambiente específicos.
  • Recall@5 e MRR medem esta tarefa de recuperação; não medem sozinhos qualidade de resposta, utilidade ao usuário ou prontidão operacional.
  • Latências são observações deste ambiente e não um benchmark controlado entre infraestruturas.
  • O pacote editorial inclui somente métricas agregadas e sanitizadas; consultas, documentos, respostas, IDs internos e resultados individuais não foram incluídos.

Proveniência

Fontes citadas.

  1. [build-stats]Estatísticas agregadas da preparação do corpus
  2. [chunk-audit]Auditoria agregada de chunks do corpus
  3. [retrieval-eval]Resumo agregado da avaliação base de retrieval
  4. [union-eval]Resumo agregado da união semântica e híbrida
  5. [enriched-eval]Resumo agregado da avaliação com enriquecimento
  6. [descriptor-eval]Resumo agregado da avaliação com descritor
  7. [evaluation-scope]Registro metodológico e de escopo da avaliação
  8. [sanitization-scope]Registro do escopo de sanitização