Metodología · 4 MIN

Descomposición de consultas y la caja de herramientas de RAG avanzado: ajusta el método al fallo

Descomposición de consultas, HyDE, RAG-Fusion, GraphRAG arreglan cada uno un fallo. El RAG sofisticado de 2026 sabe cuándo no usar ninguno.

Descomposición de consultas y la caja de herramientas de RAG avanzado: ajusta el método al fallo
UBICACIÓN
Todo el mundo
AUTOR
Sayan Sinha
PUBLICADO
25 jun 2026
IMAGEN
GENERADO CON IA

Traducción generada automáticamente con IA. La versión alemana es el original revisado por la redacción.

Las técnicas de RAG avanzado no son una escalera de madurez que subes. Son una caja de herramientas de diagnóstico, indexada por el fallo que de verdad observas. La descomposición de consultas arregla las preguntas multisalto. HyDE arregla el desajuste de vocabulario. GraphRAG responde preguntas sobre todo el corpus que en realidad no son retrieval en absoluto. Apilar todas ellas sobre cada consulta multiplica tu coste y latencia para consultas que nunca necesitaron la ayuda. El sistema sofisticado de 2026 no es el que tiene más técnicas; es el que sabe cuándo no usar ninguna.

01. Empieza por el suelo, no por el techo

Antes de cualquier método ingenioso, acierta la base, porque arregla la mayoría de las quejas. El valor por defecto de producción de 2026 es la búsqueda híbrida (embeddings densos más BM25 por palabra clave) seguida de un reranker de cross-encoder. La búsqueda híbrida capta tanto coincidencias semánticas como de término exacto; el reranker repuntúa un gran conjunto de candidatos hasta los pocos pasajes que son de verdad relevantes, no solo temáticamente cercanos. Las guías de profesionales reportan que esta combinación eleva la calidad del retrieval del 15 al 30 por ciento en conjuntos de evaluación estándar.

Esto importa porque la mayoría de los fallos del mundo real son del tipo simple: la respuesta estaba en los documentos, pero el sistema no la sacó a la luz. Eso es un problema de recall y ranking, y el suelo de arriba lo arregla. Demuestra que necesitas más antes de construir más. Cada técnica más allá de este punto añade llamadas al LLM, latencia y coste, así que cada una debe ganarse su lugar contra un fallo medido, no una corazonada.

02. La caja de herramientas, indexada por el fallo que arregla

La forma útil de sostener todo el zoológico de métodos es mapear cada uno al único modo de fallo que aborda. Recurre a un método cuando veas su fallo, no antes.

El fallo que vesEl método que lo arregla
Pregunta de varias partes o multisalto, hechos repartidos en documentosDescomposición de consultas en subpreguntas
Consulta escueta o ambigua que se incrusta malHyDE, reescritura de consultas
Una formulación pierde pasajes relevantesRAG-Fusion (varias variantes de consulta, fusionadas)
La pregunta necesita primero un principio generalPrompting de paso atrás
Corpus y tipos de consulta heterogéneosEnrutamiento al índice o pipeline correcto
Restricciones estructuradas duras (fechas, tipos)Autoconsulta (filtros de metadatos)
El retrieval devuelve en silencio documentos equivocadosRAG correctivo (un calificador más respaldo)
Pregunta global sobre todo el corpusGraphRAG (grafo de entidades más resúmenes)

Cada fila tiene procedencia real: HyDE viene de un paper de CMU de 2022 sobre retrieval denso zero-shot; el prompting de paso atrás de Google DeepMind, 2023; GraphRAG de Microsoft, 2024. Esta es la misma disciplina de decisión por fallo detrás de nuestra mirada a RAG-Fusion y en qué se diferencia del RAG simple.

03. Descomposición de consultas, en concreto

La descomposición de consultas divide una consulta compleja en subpreguntas independientes, recupera para cada una y luego sintetiza una respuesta. Es la herramienta correcta cuando una sola pasada de retrieval no puede funcionar, porque los hechos viven en distintos documentos o un hecho depende de otro (quién dirigió la película que ganó un premio concreto). El linaje corre del prompting de menos a más de 2022 a los motores de consulta de subpreguntas de los frameworks actuales.

La parte honesta es que no es gratis, y puede perjudicar. Un estudio de julio de 2025 de HU Berlin midió que la descomposición más reranking elevó el recall multisalto (Hits@10) del 74,7 al 87,2 por ciento, una ganancia real. El mismo estudio midió el coste: unos 16,7 segundos por consulta frente a 0,03 segundos para el retrieval ingenuo, y encontró que descomponer una consulta ya específica introduce ruido y empeora la respuesta. Así que la descomposición pertenece a preguntas genuinamente multisalto, no a cada consulta por defecto. La habilidad es distinguir las dos.

04. La palanca que se paga sola es el enrutamiento

Si te llevas una idea operativa de esto, que sea el enrutamiento. Clasifica la consulta primero, luego gasta complejidad solo donde se gana. Un análisis de 2026 sobre enrutamiento consciente del coste recortó los tokens facturados un 26 por ciento y la latencia media un 34 por ciento a igual calidad de respuesta, enviando solo alrededor del 18 por ciento de las consultas a retrieval pesado y el 14 por ciento a ningún retrieval en absoluto. Los métodos caros se reservaron para las consultas que los necesitaban.

Para un equipo de una pyme alemana esto es una historia de gobernanza y coste tanto como de calidad. Menos llamadas al LLM justificadas significan gasto predecible, menor latencia y un sistema que puedes explicar a una parte interesada consciente del cumplimiento: aquí está por qué esta consulta tomó el camino caro, y aquí por qué aquella no. El retrieval sobreingenierizado no solo es lento, es gasto inexplicable. El sistema RAG sofisticado en 2026 es el que sabe cuándo no usar ninguno de sus trucos.

← Signals

Wayne Dyer

“Si cambias la forma en que miras las cosas, las cosas que miras cambian.”