Volver · Insights
InsightsAI Governance / Agents

Qué puede hacer un agente de AI sin aprobación humana: un framework de 5 niveles

Cinco niveles de autonomía para vincular cada acción con riesgo, reversibilidad, evidencia, aprobación y capacidad de detenerse.

VVeetcuna

El problema: actividad visible, continuidad invisible

Imagina esta situación: un agente consulta el CRM, modifica oportunidades y puede enviar propuestas; el equipo habla de darle autonomía sin separar acciones informativas, reversibles, materiales e irreversibles. Cada equipo puede demostrar que cumplió su parte y, aun así, el resultado de extremo a extremo es frágil. El problema aparece en las transiciones: una decisión cambia de dueño, un dato pierde contexto o una excepción queda sin responsable. Cuando eso ocurre, más actividad produce más ruido, no más control.

Las primeras señales suelen parecer pequeñas. Una reunión se dedica a reconstruir qué ocurrió; dos reportes muestran cifras diferentes; un responsable espera información que el anterior considera entregada; una fecha cambia sin registrar la condición que la movió. Estas señales importan porque revelan que la operación depende de memoria individual y coordinación informal. Qué puede hacer un agente de AI sin aprobación humana: un framework de 5 niveles empieza por convertir esas dependencias en un modelo observable.

La pregunta de diagnóstico no es “¿tenemos una herramienta para esto?”, sino “¿podemos explicar el estado actual, la evidencia que lo sostiene, quién decide el siguiente cambio y qué sucede si la condición no se cumple?”. Si la respuesta requiere preguntar a varias personas o revisar mensajes dispersos, todavía no existe un sistema operativo confiable.

SeñalPregunta de verificaciónEvidencia esperada
Nivel 0: observar y explicar¿Existe una definición común y observable?Matriz de autonomía por acción
Nivel 1: recomendar con evidencia¿Se conoce la fuente autoritativa?State machine con aprobación
Nivel 2: ejecutar acciones reversibles¿Hay owner, plazo y criterio de salida?Policy de herramientas
acciones por nivel¿Se calcula con el mismo denominador?Definición y consulta reproducible

Por qué el enfoque habitual falla

El primer error es empezar por configuración. Se crean campos, automatizaciones o tableros antes de acordar qué decisión representa cada cambio de estado. La interfaz queda terminada, pero los equipos continúan usando interpretaciones diferentes. Una automatización aplicada sobre una definición ambigua solo mueve la ambigüedad más rápido.

El segundo error es modelar el camino ideal e ignorar las excepciones. En este caso deben contemplarse, como mínimo, acciones financieras, comunicaciones externas, cambios de permisos y datos personales o regulados. Si el diseño no define cómo detectar, asignar y cerrar esas situaciones, los usuarios crearán canales paralelos. La excepción no desaparece: deja de ser visible para el sistema.

El tercer error es medir resultados finales sin observar los mecanismos que los producen. acciones por nivel, aprobaciones aceptadas y rechazadas y reversiones no pueden interpretarse correctamente si no se conservan estados, timestamps, owners y razones de cambio. Un indicador sin trazabilidad permite describir el pasado, pero rara vez ayuda a decidir la siguiente acción.

El cuarto error es confundir documentación con operación. Un diagrama aprobado en un workshop pierde valor cuando no se traduce a reglas, campos mínimos, permisos, alertas y cadencias. El diseño debe vivir donde ocurre el trabajo y debe producir evidencia por defecto; depender de que alguien recuerde documentar después es una forma silenciosa de deuda operativa.

  • Comprar o configurar antes de acordar decisiones y definiciones.
  • Automatizar el happy path sin una cola explícita de excepciones.
  • Duplicar el mismo dato en varios sistemas sin source of truth.
  • Usar porcentajes agregados sin cohorte, ventana ni denominador.
  • Asignar responsabilidad a “el equipo” en lugar de a un rol concreto.

La tesis: Cinco niveles de autonomía de agentes

La autonomía debe concederse por acción y contexto, no por agente completo; cada nivel necesita límites, evidencia y una ruta explícita de escalamiento.

Este modelo separa cuatro capas que suelen mezclarse. La capa de negocio define estados, decisiones y límites. La capa de información conserva identidad, contexto, versiones y evidencia. La capa de ejecución asigna owners, SLAs, automatizaciones y excepciones. La capa de aprendizaje compara lo esperado con lo ocurrido y modifica reglas. Saltarse una capa genera soluciones que funcionan en una demo, pero se degradan cuando aumenta el volumen o cambia el contexto.

La unidad de diseño no es la pantalla ni la integración: es la decisión verificable. Cada decisión necesita una entrada válida, una salida observable y una persona o política responsable. Esta perspectiva permite cambiar herramientas sin perder el modelo y evita que la arquitectura quede atada a nombres de campos o funciones particulares de un proveedor.

CapaPregunta que debe responderResultado
Negocio¿Qué cambió y por qué importa?Estado y criterio de decisión
Información¿Qué evidencia y versión lo sostienen?Datos trazables y autorizados
Ejecución¿Quién actúa y dentro de qué límite?Owner, SLA, automatización y excepción
Aprendizaje¿Cómo sabremos si la regla funciona?Métrica, revisión y backlog

Framework paso a paso

1. Nivel 0: observar y explicar

El objetivo de esta etapa es convertir “nivel 0: observar y explicar” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Matriz de autonomía por acción para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para acciones financieras. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta acciones por nivel desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Nivel 0: observar y explicar”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: acciones financieras entra a una cola con prioridad y fecha.
  • Evidencia: Matriz de autonomía por acción conserva decisión, versión y responsable.

2. Nivel 1: recomendar con evidencia

El objetivo de esta etapa es convertir “nivel 1: recomendar con evidencia” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa State machine con aprobación para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para comunicaciones externas. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta aprobaciones aceptadas y rechazadas desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Nivel 1: recomendar con evidencia”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: comunicaciones externas entra a una cola con prioridad y fecha.
  • Evidencia: State machine con aprobación conserva decisión, versión y responsable.

3. Nivel 2: ejecutar acciones reversibles

El objetivo de esta etapa es convertir “nivel 2: ejecutar acciones reversibles” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Policy de herramientas para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para cambios de permisos. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta reversiones desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Nivel 2: ejecutar acciones reversibles”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: cambios de permisos entra a una cola con prioridad y fecha.
  • Evidencia: Policy de herramientas conserva decisión, versión y responsable.

4. Nivel 3: ejecutar dentro de políticas y umbrales

El objetivo de esta etapa es convertir “nivel 3: ejecutar dentro de políticas y umbrales” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Registro de decisiones para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para datos personales o regulados. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta violaciones de política bloqueadas desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Nivel 3: ejecutar dentro de políticas y umbrales”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: datos personales o regulados entra a una cola con prioridad y fecha.
  • Evidencia: Registro de decisiones conserva decisión, versión y responsable.

5. Nivel 4: autonomía supervisada con excepciones obligatorias

El objetivo de esta etapa es convertir “nivel 4: autonomía supervisada con excepciones obligatorias” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.

La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Plan de escalamiento de nivel para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.

Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para acciones financieras. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.

Instrumenta incidentes por autonomía desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.

  • Criterio de entrada: existe evidencia suficiente para iniciar “Nivel 4: autonomía supervisada con excepciones obligatorias”.
  • Owner: un rol puede aceptar, rechazar o devolver el caso.
  • Criterio de salida: el siguiente estado es verificable sin interpretación privada.
  • Excepción: acciones financieras entra a una cola con prioridad y fecha.
  • Evidencia: Plan de escalamiento de nivel conserva decisión, versión y responsable.

Ejemplo trabajado de principio a fin

Supongamos una organización ficticia llamada Andina Norte que enfrenta este escenario: un agente consulta el CRM, modifica oportunidades y puede enviar propuestas; el equipo habla de darle autonomía sin separar acciones informativas, reversibles, materiales e irreversibles. El equipo selecciona veinte casos recientes, incluyendo cuatro excepciones, y reconstruye el recorrido con timestamps y decisiones. Descubre que el problema no está distribuido uniformemente: se concentra en dos transiciones donde cambia el owner y la evidencia llega en formatos distintos.

En lugar de rediseñar todo, Andina Norte define una primera versión de Cinco niveles de autonomía de agentes. Conserva un identificador estable, exige la evidencia mínima y crea una cola común para excepciones. El caso solo avanza cuando el owner receptor acepta el paquete; si falta información, vuelve al estado anterior con una razón estructurada. Esta regla evita que “transferido” signifique cosas diferentes para quien entrega y quien recibe.

MomentoDecisión ilustrativaEvidenciaOwner
Semana 1Nivel 0: observar y explicarMatriz de autonomía por acciónOwner del proceso
Semana 2Nivel 1: recomendar con evidenciaState machine con aprobaciónData owner
Semana 3Nivel 2: ejecutar acciones reversiblesPolicy de herramientasOperations owner
Semana 4Nivel 3: ejecutar dentro de políticas y umbralesRegistro de decisionesAutomation owner
RevisiónNivel 4: autonomía supervisada con excepciones obligatoriasacciones por nivel + aprobaciones aceptadas y rechazadasBusiness owner

Durante el piloto, el equipo no declara éxito por haber configurado el flujo. Compara una cohorte posterior con el baseline, revisa cada excepción y pregunta si el sistema produjo una mejor decisión. Si acciones por nivel mejora pero aprobaciones aceptadas y rechazadas empeora, el diseño puede estar desplazando trabajo en lugar de eliminarlo. La revisión combina resultado, calidad y costo operativo.

El aprendizaje más útil no es una cifra aislada, sino la relación causal que puede defenderse. Por ejemplo: una definición más estricta reduce casos aceptados, pero aumenta la calidad de la transición; o una automatización ahorra tiempo en casos estándar, pero necesita un umbral diferente para acciones financieras. Esa evidencia permite ajustar una regla concreta sin rehacer toda la solución.

Artefactos que convierten el modelo en operación

ArtefactoDecisión que habilitaOwner sugeridoCadencia
Matriz de autonomía por acciónValidar nivel 0: observar y explicarBusiness ownerPor cambio de modelo
State machine con aprobaciónValidar nivel 1: recomendar con evidenciaBusiness ownerSemanal durante el piloto
Policy de herramientasValidar nivel 2: ejecutar acciones reversiblesOperations ownerSemanal durante el piloto
Registro de decisionesValidar nivel 3: ejecutar dentro de políticas y umbralesOperations ownerSemanal durante el piloto
Plan de escalamiento de nivelValidar nivel 4: autonomía supervisada con excepciones obligatoriasOperations ownerSemanal durante el piloto

Matriz de autonomía por acción

Matriz de autonomía por acción debe responder una pregunta concreta: ¿podemos ejecutar y revisar nivel 0: observar y explicar sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a acciones financieras. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

State machine con aprobación

State machine con aprobación debe responder una pregunta concreta: ¿podemos ejecutar y revisar nivel 1: recomendar con evidencia sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a comunicaciones externas. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

Policy de herramientas

Policy de herramientas debe responder una pregunta concreta: ¿podemos ejecutar y revisar nivel 2: ejecutar acciones reversibles sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a cambios de permisos. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

Registro de decisiones

Registro de decisiones debe responder una pregunta concreta: ¿podemos ejecutar y revisar nivel 3: ejecutar dentro de políticas y umbrales sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a datos personales o regulados. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

Plan de escalamiento de nivel

Plan de escalamiento de nivel debe responder una pregunta concreta: ¿podemos ejecutar y revisar nivel 4: autonomía supervisada con excepciones obligatorias sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.

Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a acciones financieras. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.

Arquitectura y patrón técnico

El siguiente diagrama expresa el flujo lógico. No obliga a usar cinco servicios ni cinco pantallas: varias etapas pueden vivir en una misma aplicación. Lo importante es conservar las fronteras de decisión y la evidencia que cruza cada una. Una implementación monolítica con contratos claros suele ser preferible a una arquitectura distribuida sin ownership.

Diagrama
Renderizando diagrama…
Flujo lógico de Cinco niveles de autonomía de agentes
Ver código fuente
flowchart LR
  S1[Nivel 0: observar y explicar]
  S2[Nivel 1: recomendar con evidencia]
  S3[Nivel 2: ejecutar acciones reversibles]
  S4[Nivel 3: ejecutar dentro de políticas y umbrales]
  S5[Nivel 4: autonomía supervisada con excepciones obligatorias]
  S1 --> S2
  S2 --> S3
  S3 --> S4
  S4 --> S5

El contrato técnico mínimo debe ser pequeño, versionable e idempotente cuando produce efectos. Registra identificadores de correlación y evita usar texto libre como única señal para una decisión material. El ejemplo siguiente muestra una estructura de referencia; debe adaptarse al dominio, controles de acceso y lifecycle real.

typescript
type AgentDecision = {
  action: string;
  risk: 'low' | 'medium' | 'high' | 'critical';
  reversible: boolean;
  evidence: string[];
};

function requiresApproval(input: AgentDecision) {
  if (input.risk === 'critical' || input.risk === 'high') return true;
  if (!input.reversible) return true;
  return input.evidence.length === 0;
}
Policy gate por acción, riesgo y reversibilidad

Trade-offs, excepciones y límites

No existe una configuración universal para Cinco niveles de autonomía de agentes. Aumentar control puede reducir velocidad; reducir captura puede quitar evidencia; centralizar definiciones puede ralentizar cambios locales; distribuir ownership puede generar divergencia. La decisión correcta explicita qué riesgo acepta y durante cuánto tiempo, en vez de presentar toda simplificación como mejora gratuita.

CondiciónQué cambia en el diseñoControl compensatorio
acciones financierasAjustar nivel 0: observar y explicarRevisión de matriz de autonomía por acción
comunicaciones externasAjustar nivel 1: recomendar con evidenciaRevisión de state machine con aprobación
cambios de permisosAjustar nivel 2: ejecutar acciones reversiblesRevisión de policy de herramientas
datos personales o reguladosAjustar nivel 3: ejecutar dentro de políticas y umbralesRevisión de registro de decisiones

Usa excepciones con fecha de expiración. Una regla temporal sin revisión suele convertirse en arquitectura permanente. Registra motivo, aprobador, alcance, evidencia y fecha de reevaluación. Cuando el volumen de una excepción supera el umbral acordado, crea un cambio de modelo; no aumentes indefinidamente la capacidad de la cola manual.

  • Anti-pattern: usar una métrica objetivo como sustituto de calidad o resultado.
  • Anti-pattern: permitir cambios de estado sin evidencia o razón estructurada.
  • Anti-pattern: crear una automatización sin owner ni procedimiento de corrección.
  • Anti-pattern: duplicar reglas en varios sistemas sin versionado coordinado.
  • Anti-pattern: declarar adopción por número de usuarios conectados.
  • Anti-pattern: ocultar excepciones para que el dashboard parezca saludable.

Métricas y criterios de éxito

Un scorecard equilibrado combina resultado, flujo, calidad y riesgo. El resultado indica si el problema importa; el flujo muestra dónde se acumula trabajo; la calidad evita optimizar velocidad a costa de errores; el riesgo confirma que la automatización no excede sus límites. Cada métrica debe tener owner y una acción asociada cuando cruza un umbral.

MétricaDefinición operativaOwnerCadencia
acciones por nivelMedir acciones por nivel con cohorte, ventana y fuente documentadasBusiness ownerSemanal
aprobaciones aceptadas y rechazadasMedir aprobaciones aceptadas y rechazadas con cohorte, ventana y fuente documentadasBusiness ownerMensual
reversionesMedir reversiones con cohorte, ventana y fuente documentadasOperations / DataMensual
violaciones de política bloqueadasMedir violaciones de política bloqueadas con cohorte, ventana y fuente documentadasOperations / DataMensual
incidentes por autonomíaMedir incidentes por autonomía con cohorte, ventana y fuente documentadasOperations / DataMensual

Antes del piloto captura baseline con la misma definición que usarás después. Evita comparar una muestra limpia posterior con un histórico que incluía casos incompletos. Segmenta por las condiciones que cambian el proceso y conserva intervalos, no solo promedios. Una mejora agregada puede esconder deterioro en un grupo pequeño pero material.

Plan de implementación en 30 días

PeriodoTrabajo principalEvidencia de salida
Días 1–5Diagnosticar un agente consulta el CRM, modifica oportunidades y puede enviar propuestas; el equipo habla de darle autonomía sin separar acciones informativas, reversibles, materiales e irreversiblesBaseline y muestra de casos
Días 6–10Definir Cinco niveles de autonomía de agentesMatriz de autonomía por acción
Días 11–20Pilotar Nivel 0: observar y explicar, Nivel 1: recomendar con evidencia, Nivel 2: ejecutar acciones reversiblesPolicy de herramientas
Días 21–25Instrumentar métricas y excepcionesPlan de escalamiento de nivel
Días 26–30Revisar evidencia y decidir siguiente alcanceDecisión documentada y backlog

Durante los primeros cinco días evita diseñar desde opiniones agregadas. Selecciona casos concretos, reconstruye timestamps y entrevista a quienes entregan y reciben trabajo. La discrepancia entre sus versiones contiene información útil: muestra dónde el sistema necesita una definición, una transferencia o una evidencia adicional.

En la segunda semana trabaja con el menor grupo capaz de decidir. Valida vocabulario, estados y límites, y registra preguntas no resueltas. La aprobación del diseño no significa unanimidad; significa que existe un owner con autoridad para elegir y que los desacuerdos relevantes quedan visibles como riesgos o experimentos.

En la tercera semana ejecuta el flujo con volumen controlado. Observa trabajo manual, tiempos de espera y correcciones. No amplíes el piloto solo porque no aparecieron errores: incluye intencionalmente casos de acciones financieras y comunicaciones externas para probar que el sistema se detiene o escala de manera segura.

En la última semana compara el resultado con el baseline y toma una decisión explícita: ampliar, corregir, mantener limitado o detener. Cada opción es válida si la evidencia la sostiene. El cierre del piloto debe dejar un owner, una cadencia, un backlog priorizado y una ruta de rollback.

Preguntas para un workshop de diseño

Preguntas sobre nivel 0: observar y explicar

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa acciones financieras? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular acciones por nivel— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Preguntas sobre nivel 1: recomendar con evidencia

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa comunicaciones externas? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular aprobaciones aceptadas y rechazadas— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Preguntas sobre nivel 2: ejecutar acciones reversibles

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa cambios de permisos? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular reversiones— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Preguntas sobre nivel 3: ejecutar dentro de políticas y umbrales

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa datos personales o regulados? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular violaciones de política bloqueadas— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Preguntas sobre nivel 4: autonomía supervisada con excepciones obligatorias

¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa acciones financieras? Responder con un caso reciente es más valioso que acordar una frase general.

¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular incidentes por autonomía— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.

Checklist: qué hacer mañana

  • Seleccionar diez casos reales relacionados con Cinco niveles de autonomía de agentes.
  • Nombrar un owner para nivel 0: observar y explicar.
  • Documentar una primera versión de matriz de autonomía por acción.
  • Definir evento, denominador y fuente para acciones por nivel.
  • Crear una cola explícita para acciones financieras.
  • Elegir un piloto pequeño con fecha de revisión y criterio de salida.
  • Registrar baseline antes de cambiar reglas o automatizaciones.
  • Acordar cómo detener y revertir el piloto si aparece un riesgo material.

Siguiente lectura: AI Strategy & Governance

Este artículo forma parte del cluster AI Strategy & Governance. Para continuar, conecta este modelo con las siguientes decisiones:

Cómo crear una política de uso de AI que el equipo realmente pueda aplicar

Cómo encontrar y priorizar los primeros casos de uso de AI en una empresa

AI en operaciones: qué delegar a un copiloto, qué automatizar y qué mantener bajo decisión humana