Volver · Guides
GuidesEnterprise AI

RAG en producción: cómo preparar, indexar y evaluar conocimiento empresarial

Una guía técnica para diseñar fuentes, chunking, metadata, ACL, retrieval, reranking y evaluación antes de culpar al modelo.

VVeetcuna

El problema: actividad visible, continuidad invisible

Imagina esta situación: un asistente empresarial responde con seguridad, pero mezcla políticas vencidas, omite restricciones de acceso y recupera fragmentos que contienen palabras parecidas sin resolver la pregunta del usuario. Cada equipo puede demostrar que cumplió su parte y, aun así, el resultado de extremo a extremo es frágil. El problema aparece en las transiciones: una decisión cambia de dueño, un dato pierde contexto o una excepción queda sin responsable. Cuando eso ocurre, más actividad produce más ruido, no más control.

Las primeras señales suelen parecer pequeñas. Una reunión se dedica a reconstruir qué ocurrió; dos reportes muestran cifras diferentes; un responsable espera información que el anterior considera entregada; una fecha cambia sin registrar la condición que la movió. Estas señales importan porque revelan que la operación depende de memoria individual y coordinación informal. RAG en producción: cómo preparar, indexar y evaluar conocimiento empresarial empieza por convertir esas dependencias en un modelo observable.

La pregunta de diagnóstico no es “¿tenemos una herramienta para esto?”, sino “¿podemos explicar el estado actual, la evidencia que lo sostiene, quién decide el siguiente cambio y qué sucede si la condición no se cumple?”. Si la respuesta requiere preguntar a varias personas o revisar mensajes dispersos, todavía no existe un sistema operativo confiable.

SeñalPregunta de verificaciónEvidencia esperada
Inventariar fuentes, owners y vigencia¿Existe una definición común y observable?Arquitectura RAG end-to-end
Normalizar y segmentar según estructura semántica¿Se conoce la fuente autoritativa?Ejemplo JSON de metadata y ACL
Diseñar metadata, versionado y ACL¿Hay owner, plazo y criterio de salida?Retrieval TypeScript con filtros
context recall¿Se calcula con el mismo denominador?Definición y consulta reproducible

Por qué el enfoque habitual falla

El primer error es empezar por configuración. Se crean campos, automatizaciones o tableros antes de acordar qué decisión representa cada cambio de estado. La interfaz queda terminada, pero los equipos continúan usando interpretaciones diferentes. Una automatización aplicada sobre una definición ambigua solo mueve la ambigüedad más rápido.

El segundo error es modelar el camino ideal e ignorar las excepciones. En este caso deben contemplarse, como mínimo, documentos con tablas extensas, contenido altamente cambiante, fuentes multilingües y preguntas que requieren cálculo o sistemas transaccionales. Si el diseño no define cómo detectar, asignar y cerrar esas situaciones, los usuarios crearán canales paralelos. La excepción no desaparece: deja de ser visible para el sistema.

El tercer error es medir resultados finales sin observar los mecanismos que los producen. context recall, context precision y respuestas con cita válida no pueden interpretarse correctamente si no se conservan estados, timestamps, owners y razones de cambio. Un indicador sin trazabilidad permite describir el pasado, pero rara vez ayuda a decidir la siguiente acción.

El cuarto error es confundir documentación con operación. Un diagrama aprobado en un workshop pierde valor cuando no se traduce a reglas, campos mínimos, permisos, alertas y cadencias. El diseño debe vivir donde ocurre el trabajo y debe producir evidencia por defecto; depender de que alguien recuerde documentar después es una forma silenciosa de deuda operativa.

  • Comprar o configurar antes de acordar decisiones y definiciones.
  • Automatizar el happy path sin una cola explícita de excepciones.
  • Duplicar el mismo dato en varios sistemas sin source of truth.
  • Usar porcentajes agregados sin cohorte, ventana ni denominador.
  • Asignar responsabilidad a “el equipo” en lugar de a un rol concreto.

La tesis: Pipeline RAG evaluable

La calidad de RAG depende más del pipeline de conocimiento y de su evaluación que del modelo generativo conectado al final.

Este modelo separa cuatro capas que suelen mezclarse. La capa de negocio define estados, decisiones y límites. La capa de información conserva identidad, contexto, versiones y evidencia. La capa de ejecución asigna owners, SLAs, automatizaciones y excepciones. La capa de aprendizaje compara lo esperado con lo ocurrido y modifica reglas. Saltarse una capa genera soluciones que funcionan en una demo, pero se degradan cuando aumenta el volumen o cambia el contexto.

La unidad de diseño no es la pantalla ni la integración: es la decisión verificable. Cada decisión necesita una entrada válida, una salida observable y una persona o política responsable. Esta perspectiva permite cambiar herramientas sin perder el modelo y evita que la arquitectura quede atada a nombres de campos o funciones particulares de un proveedor.

CapaPregunta que debe responderResultado
Negocio¿Qué cambió y por qué importa?Estado y criterio de decisión
Información¿Qué evidencia y versión lo sostienen?Datos trazables y autorizados
Ejecución¿Quién actúa y dentro de qué límite?Owner, SLA, automatización y excepción
Aprendizaje¿Cómo sabremos si la regla funciona?Métrica, revisión y backlog

Framework paso a paso

1. Inventariar fuentes, owners y vigencia

El objetivo de esta etapa es convertir “inventariar fuentes, owners y vigencia” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Arquitectura RAG end-to-end para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para documentos con tablas extensas. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta context recall desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Inventariar fuentes, owners y vigencia”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: documentos con tablas extensas entra a una cola con prioridad y fecha.
  • Evidencia: Arquitectura RAG end-to-end conserva decisión, versión y responsable.

2. Normalizar y segmentar según estructura semántica

El objetivo de esta etapa es convertir “normalizar y segmentar según estructura semántica” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Ejemplo JSON de metadata y ACL para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para contenido altamente cambiante. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta context precision desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Normalizar y segmentar según estructura semántica”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: contenido altamente cambiante entra a una cola con prioridad y fecha.
  • Evidencia: Ejemplo JSON de metadata y ACL conserva decisión, versión y responsable.

3. Diseñar metadata, versionado y ACL

El objetivo de esta etapa es convertir “diseñar metadata, versionado y acl” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Retrieval TypeScript con filtros para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para fuentes multilingües. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta respuestas con cita válida desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Diseñar metadata, versionado y ACL”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: fuentes multilingües entra a una cola con prioridad y fecha.
  • Evidencia: Retrieval TypeScript con filtros conserva decisión, versión y responsable.

4. Configurar retrieval, filtros y reranking

El objetivo de esta etapa es convertir “configurar retrieval, filtros y reranking” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Dataset de evaluación para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para preguntas que requieren cálculo o sistemas transaccionales. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta violaciones de ACL desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Configurar retrieval, filtros y reranking”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: preguntas que requieren cálculo o sistemas transaccionales entra a una cola con prioridad y fecha.
  • Evidencia: Dataset de evaluación conserva decisión, versión y responsable.

5. Construir un dataset de evaluación y operar fallos

El objetivo de esta etapa es convertir “construir un dataset de evaluación y operar fallos” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Failure-mode scorecard para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para documentos con tablas extensas. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta freshness lag de las fuentes desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Construir un dataset de evaluación y operar fallos”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: documentos con tablas extensas entra a una cola con prioridad y fecha.
  • Evidencia: Failure-mode scorecard conserva decisión, versión y responsable.

Ejemplo trabajado de principio a fin

Supongamos una organización ficticia llamada Andina Norte que enfrenta este escenario: un asistente empresarial responde con seguridad, pero mezcla políticas vencidas, omite restricciones de acceso y recupera fragmentos que contienen palabras parecidas sin resolver la pregunta del usuario. El equipo selecciona veinte casos recientes, incluyendo cuatro excepciones, y reconstruye el recorrido con timestamps y decisiones. Descubre que el problema no está distribuido uniformemente: se concentra en dos transiciones donde cambia el owner y la evidencia llega en formatos distintos.

En lugar de rediseñar todo, Andina Norte define una primera versión de Pipeline RAG evaluable. Conserva un identificador estable, exige la evidencia mínima y crea una cola común para excepciones. El caso solo avanza cuando el owner receptor acepta el paquete; si falta información, vuelve al estado anterior con una razón estructurada. Esta regla evita que “transferido” signifique cosas diferentes para quien entrega y quien recibe.

MomentoDecisión ilustrativaEvidenciaOwner
Semana 1Inventariar fuentes, owners y vigenciaArquitectura RAG end-to-endOwner del proceso
Semana 2Normalizar y segmentar según estructura semánticaEjemplo JSON de metadata y ACLData owner
Semana 3Diseñar metadata, versionado y ACLRetrieval TypeScript con filtrosOperations owner
Semana 4Configurar retrieval, filtros y rerankingDataset de evaluaciónAutomation owner
RevisiónConstruir un dataset de evaluación y operar falloscontext recall + context precisionBusiness owner

Durante el piloto, el equipo no declara éxito por haber configurado el flujo. Compara una cohorte posterior con el baseline, revisa cada excepción y pregunta si el sistema produjo una mejor decisión. Si context recall mejora pero context precision empeora, el diseño puede estar desplazando trabajo en lugar de eliminarlo. La revisión combina resultado, calidad y costo operativo.

El aprendizaje más útil no es una cifra aislada, sino la relación causal que puede defenderse. Por ejemplo: una definición más estricta reduce casos aceptados, pero aumenta la calidad de la transición; o una automatización ahorra tiempo en casos estándar, pero necesita un umbral diferente para documentos con tablas extensas. Esa evidencia permite ajustar una regla concreta sin rehacer toda la solución.

Artefactos que convierten el modelo en operación

ArtefactoDecisión que habilitaOwner sugeridoCadencia
Arquitectura RAG end-to-endValidar inventariar fuentes, owners y vigenciaBusiness ownerPor cambio de modelo
Ejemplo JSON de metadata y ACLValidar normalizar y segmentar según estructura semánticaBusiness ownerSemanal durante el piloto
Retrieval TypeScript con filtrosValidar diseñar metadata, versionado y aclOperations ownerSemanal durante el piloto
Dataset de evaluaciónValidar configurar retrieval, filtros y rerankingOperations ownerSemanal durante el piloto
Failure-mode scorecardValidar construir un dataset de evaluación y operar fallosOperations ownerSemanal durante el piloto

Arquitectura RAG end-to-end

Arquitectura RAG end-to-end debe responder una pregunta concreta: ¿podemos ejecutar y revisar inventariar fuentes, owners y vigencia sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a documentos con tablas extensas. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

Ejemplo JSON de metadata y ACL

Ejemplo JSON de metadata y ACL debe responder una pregunta concreta: ¿podemos ejecutar y revisar normalizar y segmentar según estructura semántica sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a contenido altamente cambiante. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

Retrieval TypeScript con filtros

Retrieval TypeScript con filtros debe responder una pregunta concreta: ¿podemos ejecutar y revisar diseñar metadata, versionado y acl sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a fuentes multilingües. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

Dataset de evaluación

Dataset de evaluación debe responder una pregunta concreta: ¿podemos ejecutar y revisar configurar retrieval, filtros y reranking sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a preguntas que requieren cálculo o sistemas transaccionales. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

Failure-mode scorecard

Failure-mode scorecard debe responder una pregunta concreta: ¿podemos ejecutar y revisar construir un dataset de evaluación y operar fallos sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a documentos con tablas extensas. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

Arquitectura y patrón técnico

El siguiente diagrama expresa el flujo lógico. No obliga a usar cinco servicios ni cinco pantallas: varias etapas pueden vivir en una misma aplicación. Lo importante es conservar las fronteras de decisión y la evidencia que cruza cada una. Una implementación monolítica con contratos claros suele ser preferible a una arquitectura distribuida sin ownership.

Diagrama
Renderizando diagrama…
Flujo lógico de Pipeline RAG evaluable
Ver código fuente
flowchart LR
  S1[Inventariar fuentes, owners y vigencia]
  S2[Normalizar y segmentar según estructura semántica]
  S3[Diseñar metadata, versionado y ACL]
  S4[Configurar retrieval, filtros y reranking]
  S5[Construir un dataset de evaluación y operar fallos]
  S1 --> S2
  S2 --> S3
  S3 --> S4
  S4 --> S5

El contrato técnico mínimo debe ser pequeño, versionable e idempotente cuando produce efectos. Registra identificadores de correlación y evita usar texto libre como única señal para una decisión material. El ejemplo siguiente muestra una estructura de referencia; debe adaptarse al dominio, controles de acceso y lifecycle real.

typescript
type RetrievalQuery = {
  query: string;
  tenantId: string;
  principalGroups: string[];
  asOf: string;
};

async function retrieve(input: RetrievalQuery) {
  const candidates = await vectorStore.search({
    text: input.query,
    limit: 40,
    filter: { tenantId: input.tenantId, activeAt: input.asOf },
  });
  const authorized = candidates.filter((item) =>
    item.metadata.acl.some((group: string) => input.principalGroups.includes(group)),
  );
  return rerank(input.query, authorized).then((items) => items.slice(0, 8));
}
Retriever con filtros de ACL y trazabilidad

Trade-offs, excepciones y límites

No existe una configuración universal para Pipeline RAG evaluable. Aumentar control puede reducir velocidad; reducir captura puede quitar evidencia; centralizar definiciones puede ralentizar cambios locales; distribuir ownership puede generar divergencia. La decisión correcta explicita qué riesgo acepta y durante cuánto tiempo, en vez de presentar toda simplificación como mejora gratuita.

CondiciónQué cambia en el diseñoControl compensatorio
documentos con tablas extensasAjustar inventariar fuentes, owners y vigenciaRevisión de arquitectura rag end-to-end
contenido altamente cambianteAjustar normalizar y segmentar según estructura semánticaRevisión de ejemplo json de metadata y acl
fuentes multilingüesAjustar diseñar metadata, versionado y aclRevisión de retrieval typescript con filtros
preguntas que requieren cálculo o sistemas transaccionalesAjustar configurar retrieval, filtros y rerankingRevisión de dataset de evaluación

Usa excepciones con fecha de expiración. Una regla temporal sin revisión suele convertirse en arquitectura permanente. Registra motivo, aprobador, alcance, evidencia y fecha de reevaluación. Cuando el volumen de una excepción supera el umbral acordado, crea un cambio de modelo; no aumentes indefinidamente la capacidad de la cola manual.

  • Anti-pattern: usar una métrica objetivo como sustituto de calidad o resultado.
  • Anti-pattern: permitir cambios de estado sin evidencia o razón estructurada.
  • Anti-pattern: crear una automatización sin owner ni procedimiento de corrección.
  • Anti-pattern: duplicar reglas en varios sistemas sin versionado coordinado.
  • Anti-pattern: declarar adopción por número de usuarios conectados.
  • Anti-pattern: ocultar excepciones para que el dashboard parezca saludable.

Métricas y criterios de éxito

Un scorecard equilibrado combina resultado, flujo, calidad y riesgo. El resultado indica si el problema importa; el flujo muestra dónde se acumula trabajo; la calidad evita optimizar velocidad a costa de errores; el riesgo confirma que la automatización no excede sus límites. Cada métrica debe tener owner y una acción asociada cuando cruza un umbral.

MétricaDefinición operativaOwnerCadencia
context recallMedir context recall con cohorte, ventana y fuente documentadasBusiness ownerSemanal
context precisionMedir context precision con cohorte, ventana y fuente documentadasBusiness ownerMensual
respuestas con cita válidaMedir respuestas con cita válida con cohorte, ventana y fuente documentadasOperations / DataMensual
violaciones de ACLMedir violaciones de ACL con cohorte, ventana y fuente documentadasOperations / DataMensual
freshness lag de las fuentesMedir freshness lag de las fuentes con cohorte, ventana y fuente documentadasOperations / DataMensual

Antes del piloto captura baseline con la misma definición que usarás después. Evita comparar una muestra limpia posterior con un histórico que incluía casos incompletos. Segmenta por las condiciones que cambian el proceso y conserva intervalos, no solo promedios. Una mejora agregada puede esconder deterioro en un grupo pequeño pero material.

Plan de implementación en 30 días

PeriodoTrabajo principalEvidencia de salida
Días 1–5Diagnosticar un asistente empresarial responde con seguridad, pero mezcla políticas vencidas, omite restricciones de acceso y recupera fragmentos que contienen palabras parecidas sin resolver la pregunta del usuarioBaseline y muestra de casos
Días 6–10Definir Pipeline RAG evaluableArquitectura RAG end-to-end
Días 11–20Pilotar Inventariar fuentes, owners y vigencia, Normalizar y segmentar según estructura semántica, Diseñar metadata, versionado y ACLRetrieval TypeScript con filtros
Días 21–25Instrumentar métricas y excepcionesFailure-mode scorecard
Días 26–30Revisar evidencia y decidir siguiente alcanceDecisión documentada y backlog

Durante los primeros cinco días evita diseñar desde opiniones agregadas. Selecciona casos concretos, reconstruye timestamps y entrevista a quienes entregan y reciben trabajo. La discrepancia entre sus versiones contiene información útil: muestra dónde el sistema necesita una definición, una transferencia o una evidencia adicional.

En la segunda semana trabaja con el menor grupo capaz de decidir. Valida vocabulario, estados y límites, y registra preguntas no resueltas. La aprobación del diseño no significa unanimidad; significa que existe un owner con autoridad para elegir y que los desacuerdos relevantes quedan visibles como riesgos o experimentos.

En la tercera semana ejecuta el flujo con volumen controlado. Observa trabajo manual, tiempos de espera y correcciones. No amplíes el piloto solo porque no aparecieron errores: incluye intencionalmente casos de documentos con tablas extensas y contenido altamente cambiante para probar que el sistema se detiene o escala de manera segura.

En la última semana compara el resultado con el baseline y toma una decisión explícita: ampliar, corregir, mantener limitado o detener. Cada opción es válida si la evidencia la sostiene. El cierre del piloto debe dejar un owner, una cadencia, un backlog priorizado y una ruta de rollback.

Preguntas para un workshop de diseño

Preguntas sobre inventariar fuentes, owners y vigencia

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa documentos con tablas extensas? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular context recall— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Preguntas sobre normalizar y segmentar según estructura semántica

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa contenido altamente cambiante? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular context precision— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Preguntas sobre diseñar metadata, versionado y acl

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa fuentes multilingües? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular respuestas con cita válida— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Preguntas sobre configurar retrieval, filtros y reranking

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa preguntas que requieren cálculo o sistemas transaccionales? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular violaciones de ACL— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Preguntas sobre construir un dataset de evaluación y operar fallos

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa documentos con tablas extensas? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular freshness lag de las fuentes— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Checklist: qué hacer mañana

  • Seleccionar diez casos reales relacionados con Pipeline RAG evaluable.
  • Nombrar un owner para inventariar fuentes, owners y vigencia.
  • Documentar una primera versión de arquitectura rag end-to-end.
  • Definir evento, denominador y fuente para context recall.
  • Crear una cola explícita para documentos con tablas extensas.
  • Elegir un piloto pequeño con fecha de revisión y criterio de salida.
  • Registrar baseline antes de cambiar reglas o automatizaciones.
  • Acordar cómo detener y revertir el piloto si aparece un riesgo material.

Siguiente lectura: Enterprise AI Engineering

Este artículo forma parte del cluster Enterprise AI Engineering. Para continuar, conecta este modelo con las siguientes decisiones:

Document AI en producción: extracción, validación y automatización sin perder control

RAG en producción: cómo preparar, indexar y evaluar conocimiento empresarial | Veetcuna