Observatório de sistemas
Por que 965 documentos não bastaram neste experimento de RAG
O corpus escrito reuniu 965 documentos e passou por verificações agregadas de chunks. Ainda assim, a união entre busca semântica e híbrida deixou 3 das 16 consultas sem o resultado esperado no top 5.
Do recorte do corpus à auditoria de chunks[build-stats][chunk-audit]
O recorte deste experimento começou com 12.618 registros, manteve 3.722 itens elegíveis após deduplicação e escreveu 965 documentos.[build-stats]
A auditoria agregada registrou 965 documentos e 8.704 chunks, sem chunks vazios, IDs de chunk duplicados ou documentos sem chunks.[chunk-audit]
A recuperação observada na avaliação de 16 consultas[retrieval-eval][evaluation-scope]
Na avaliação com 16 consultas, a busca semântica registrou recall@5 de 0,6875 e MRR de 0,4798. A busca híbrida registrou recall@5 de 0,75 e MRR de 0,5021.[retrieval-eval][evaluation-scope]
A união dos resultados semântico e híbrido registrou recall@5 de 0,8125 e MRR de 0,54375, mas ainda teve 3 misses entre as 16 consultas.[union-eval][evaluation-scope]
Enriquecimento e descritor nas métricas observadas[retrieval-eval][enriched-eval][descriptor-eval]
O enriquecimento testado manteve as métricas de recall@5 e MRR da avaliação base e apresentou medianas de latência maiores no ambiente observado: 403,67 ms no modo semântico e 616,04 ms no híbrido, ante 345,34 ms e 458,87 ms na avaliação base.[retrieval-eval][enriched-eval]
O descritor testado registrou recall@5 de 0,75 e MRR de 0,5021, sem melhora agregada sobre a busca híbrida base nessas duas métricas. Sua latência mediana observada foi de 709,19 ms.[retrieval-eval][descriptor-eval]
Escopo das conclusões[evaluation-scope][sanitization-scope]
Estes resultados se restringem ao corpus, à coleção, às configurações e ao ambiente deste experimento. Recall@5 registra a presença do resultado esperado no top 5, enquanto MRR considera sua posição; isoladamente, essas métricas não avaliam qualidade de resposta, utilidade ao usuário ou prontidão operacional.[evaluation-scope]
As latências relatadas são observações deste ambiente, e não um benchmark controlado entre infraestruturas.[retrieval-eval][enriched-eval][descriptor-eval][evaluation-scope]
O pacote editorial contém somente métricas agregadas e sanitizadas; consultas, documentos, respostas, identificadores internos e resultados individuais não foram incluídos.[sanitization-scope]
Limitações
Onde esta conclusão termina.
- A avaliação contém somente 16 consultas e não sustenta generalizações universais sobre sistemas RAG.
- Os resultados descrevem um corpus, uma coleção, configurações e um ambiente específicos.
- Recall@5 e MRR medem esta tarefa de recuperação; não medem sozinhos qualidade de resposta, utilidade ao usuário ou prontidão operacional.
- Latências são observações deste ambiente e não um benchmark controlado entre infraestruturas.
- O pacote editorial inclui somente métricas agregadas e sanitizadas; consultas, documentos, respostas, IDs internos e resultados individuais não foram incluídos.
Proveniência
Fontes citadas.
- [build-stats]Estatísticas agregadas da preparação do corpus
- [chunk-audit]Auditoria agregada de chunks do corpus
- [retrieval-eval]Resumo agregado da avaliação base de retrieval
- [union-eval]Resumo agregado da união semântica e híbrida
- [enriched-eval]Resumo agregado da avaliação com enriquecimento
- [descriptor-eval]Resumo agregado da avaliação com descritor
- [evaluation-scope]Registro metodológico e de escopo da avaliação
- [sanitization-scope]Registro do escopo de sanitização