RAG sin LLM: búsqueda efectiva con BM25 y TF-IDF
Abstract
Esta nota técnica documenta la implementación de un sistema de búsqueda tipo RAG (Retrieval-Augmented Generation) para consultas ciudadanas sobre trámites del Estado chileno, sin utilizar modelos de lenguaje (LLM). El sistema usa BM25 + TF-IDF con Reciprocal Rank Fusion sobre un corpus de 2.602 fichas de ChileAtiende, logrando resultados competitivos para consultas informacionales directas con latencia inferior a 50ms y costo operacional cero.
Contexto y motivación
Los sistemas RAG actuales asumen que la "G" (Generation) requiere un LLM. Pero para muchas aplicaciones gubernamentales, la generación no es necesaria — basta con encontrar y presentar la información correcta. Las fichas de ChileAtiende ya estan escritas en lenguaje ciudadano; el desafio es encontrar la ficha correcta, no reformularla.
Esto abre una pregunta práctica: hasta donde llega un sistema RAG que solo hace retrieval, sin generation?
Enfoque
Corpus
2.602 fichas scrapeadas de ChileAtiende.gob.cl, cada una con: - Título del trámite - Descripción - Requisitos - Documentos necesarios - Donde realizar el tramite - Costo - Vigencia
Pipeline de búsqueda
- Preprocesamiento: Tokenización, remoción de stopwords en español, stemming con Snowball
- BM25: Ranking probabilístico sobre el corpus completo (k1=1.5, b=0.75)
- TF-IDF: Vectorización con scikit-learn, similitud coseno
- Reciprocal Rank Fusion (RRF): Combinación de rankings con k=60
- Presentación: Top-3 fichas con score de confianza
Evaluación
Benchmark de 100 consultas ciudadanas reales (extraídas de búsquedas en el sitio de ChileAtiende), con ficha correcta etiquetada manualmente.
Hallazgos
- Precision@1: 78% (la ficha correcta es el primer resultado)
- Precision@3: 91% (la ficha correcta esta en los primeros 3)
- Latencia promedio: 23ms (BM25) + 18ms (TF-IDF) + 2ms (fusion) = 43ms total
- RRF mejora ambos métodos individuales en 5-8 puntos porcentuales
Discusión
Para consultas informacionales directas ("como sacar el certificado de nacimiento", "requisitos para la licencia de conducir"), el sistema funciona sorprendentemente bien. Las limitaciones aparecen con consultas ambiguas o que requieren razonamiento ("que subsidio me conviene si soy estudiante y arriendo").
La ventaja principal sobre un RAG con LLM es la transparencia total: no hay alucinación posible, la respuesta siempre es una ficha oficial existente.
Implicancias
- Para muchos casos de uso gubernamentales, retrieval sin generation es suficiente
- BM25+TF-IDF+RRF es un baseline competitivo que debería evalúarse antes de recurrir a LLMs
- La latencia sub-50ms permite correr en hardware modesto (Raspberry Pi)
AI Disclosure
Nivel de uso de IA: Minima
- Revisión: Claude revisó el borrador final de esta nota
- Implementación: El código fue escrito manualmente sin asistencia de IA
- Herramientas: Claude (Haiku, solo para revisión)
Referencias
- Robertson, S., & Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond.
- Cormack, G. V., Clarke, C. L., & Buettcher, S. (2009). Reciprocal Rank Fusion outperforms Condorcet and individual Rank Learning Methods.
- ChileAtiende. (2025). Portal de trámites y servicios del Estado.
Uso de IA en este texto: mínima. Herramientas: Claude. Tareas: revisión.