Research Paper · 2026-03-15 · NLIDB-Gov

NLIDB-Gov: Interfaces de lenguaje natural para bases de datos gubernamentales

Abstract

Este paper evalúa la aplicabilidad de interfaces de lenguaje natural a bases de datos (NLIDB) en el contexto de sistemas gubernamentales chilenos, específicamente sobre la plataforma Mercado Público. Se comparan dos enfoques: (1) Text-to-SQL mediado por LLM (GPT-4, Claude) y (2) búsqueda sobre catálogos de gold queries usando BM25 sin LLM. Los resultados muestran que el enfoque basado en gold queries alcanza precisión comparable al Text-to-SQL con LLM para consultas frecuentes, con ventajas significativas en reproducibilidad, auditabilidad y costo operacional. Se propone un framework de evalúación específico para NLIDB en contextos gubernamentales latinoamericanos.

Contexto y motivación

Las bases de datos del Estado chileno no estan diseñadas para ser consultadas directamente por funcionarios públicos. El sistema de compras públicas Mercado Público, por ejemplo, tiene un esquema relacional complejo con más de 200 tablas, nomenclaturas internas y relaciones implícitas que requieren conocimiento institucional para interpretar correctamente.

Los funcionarios que necesitan información — desde analistas del Observatorio hasta fiscalizadores de la Contraloría — dependen de intermediarios técnicos o reportes pre-construidos. Esto crea un cuello de botella que limita la capacidad analítica institucional.

NLIDB-Gov explora si es posible eliminar esta barrera permitiendo consultas en español natural.

Metodología

Se construyó un benchmark de 150 preguntas frecuentes sobre compras públicas, clasificadas en tres niveles de complejidad:

  • Nivel 1 (simple): Consultas sobre una tabla, sin joins (ej: "cuántas licitaciones hubo en marzo 2025")
  • Nivel 2 (medio): Consultas con 1-2 joins y filtros compuestos (ej: "proveedores con más de 5 órdenes de compra en salud")
  • Nivel 3 (complejo): Consultas con subqueries, agregaciones y lógica condicional (ej: "organismos cuyo gasto promedio por OC supera la mediana del sector")

Cada pregunta tiene una gold query SQL validada manualmente contra la base de datos real.

Enfoques evalúados

  1. Text-to-SQL con LLM: GPT-4 y Claude con schema completo + few-shot examples
  2. Gold query retrieval: BM25 sobre catálogo de preguntas-queries pre-validadas
  3. Híbrido: BM25 para retrieval + LLM para adaptacion de parámetros

Hallazgos

  1. Gold query retrieval iguala al Text-to-SQL para Nivel 1 y 2 (87% vs 89% de precisión en ejecución)
  2. Text-to-SQL con LLM es superior en Nivel 3 (72% vs 41%) pero con errores silenciosos peligrosos
  3. Los errores del LLM son más graves que los de retrieval: queries que ejecutan sin error pero devuelven datos incorrectos
  4. El enfoque híbrido obtiene los mejores resultados (91% Nivel 1-2, 68% Nivel 3) con auditabilidad mejorada

Discusión

El hallazgo más relevante no es la precisión bruta sino la naturaleza de los errores. Un sistema NLIDB para gobierno necesita fallar de forma segura: es preferible responder "no se como contestar eso" a devolver datos incorrectos que parecen correctos.

El enfoque basado en gold queries tiene una ventaja crítica: cada respuesta es trazable a una query validada por un humano. Esto permite auditoría y accountability, requisitos no negociables en el sector público.

Implicancias

  • Los sistemas NLIDB gubernamentales deberían priorizar precisión sobre cobertura
  • El catálogo de gold queries funciona como una forma de "conocimiento institucional codificado"
  • La combinación retrieval + adaptacion paramétrica con LLM es el punto óptimo para la mayoría de casos de uso

AI Disclosure

Nivel de uso de IA: Significativa

  • Análisis de datos: Claude y GPT-4 se usaron para generar y validar queries SQL durante la fase experimental
  • Escritura de código: Claude Code generó los scripts de evalúación y benchmarking
  • Revisión de texto: Claude asistió en la revisión y edición del manuscrito
  • Generación de ideas: Las sesiones de brainstorming con Claude ayudaron a definir la taxonomía de niveles de complejidad
  • Herramientas: Claude (Opus), GPT-4

Referencias

  1. Zhong, V., et al. (2017). Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning.
  2. Yu, T., et al. (2018). Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task.
  3. Rajkumar, N., et al. (2022). Evaluating the Text-to-SQL Capabilities of Large Language Models.
  4. Dirección ChileCompra. (2024). Manual técnico de integración API Mercado Público.

Uso de IA en este texto: significativa. Herramientas: Claude, GPT-4. Tareas: análisis, código, revisión.