El problema: actividad visible, continuidad invisible
Imagina esta situación: un equipo propone microservicios, eventos y múltiples stores porque espera crecer, aunque hoy los incidentes provienen de queries lentas, ownership difuso y despliegues que nadie puede reproducir. Cada equipo puede demostrar que cumplió su parte y, aun así, el resultado de extremo a extremo es frágil. El problema aparece en las transiciones: una decisión cambia de dueño, un dato pierde contexto o una excepción queda sin responsable. Cuando eso ocurre, más actividad produce más ruido, no más control.
Las primeras señales suelen parecer pequeñas. Una reunión se dedica a reconstruir qué ocurrió; dos reportes muestran cifras diferentes; un responsable espera información que el anterior considera entregada; una fecha cambia sin registrar la condición que la movió. Estas señales importan porque revelan que la operación depende de memoria individual y coordinación informal. Arquitectura cloud: cuándo un sistema necesita escalar y cuándo solo necesita ser más simple empieza por convertir esas dependencias en un modelo observable.
La pregunta de diagnóstico no es “¿tenemos una herramienta para esto?”, sino “¿podemos explicar el estado actual, la evidencia que lo sostiene, quién decide el siguiente cambio y qué sucede si la condición no se cumple?”. Si la respuesta requiere preguntar a varias personas o revisar mensajes dispersos, todavía no existe un sistema operativo confiable.
| Señal | Pregunta de verificación | Evidencia esperada |
|---|---|---|
| Definir SLOs, carga y límites observados | ¿Existe una definición común y observable? | Mapa de límites |
| Medir cuellos de botella y costo de cambio | ¿Se conoce la fuente autoritativa? | Presupuesto de capacidad |
| Simplificar estado, interfaces y ownership | ¿Hay owner, plazo y criterio de salida? | Matriz simplicidad versus distribución |
| latencia por percentil | ¿Se calcula con el mismo denominador? | Definición y consulta reproducible |
Por qué el enfoque habitual falla
El primer error es empezar por configuración. Se crean campos, automatizaciones o tableros antes de acordar qué decisión representa cada cambio de estado. La interfaz queda terminada, pero los equipos continúan usando interpretaciones diferentes. Una automatización aplicada sobre una definición ambigua solo mueve la ambigüedad más rápido.
El segundo error es modelar el camino ideal e ignorar las excepciones. En este caso deben contemplarse, como mínimo, requisitos regulatorios de aislamiento, cargas impredecibles, procesamiento intensivo y equipos con dominios y cadencias realmente independientes. Si el diseño no define cómo detectar, asignar y cerrar esas situaciones, los usuarios crearán canales paralelos. La excepción no desaparece: deja de ser visible para el sistema.
El tercer error es medir resultados finales sin observar los mecanismos que los producen. latencia por percentil, saturación del recurso limitante y tasa de errores no pueden interpretarse correctamente si no se conservan estados, timestamps, owners y razones de cambio. Un indicador sin trazabilidad permite describir el pasado, pero rara vez ayuda a decidir la siguiente acción.
El cuarto error es confundir documentación con operación. Un diagrama aprobado en un workshop pierde valor cuando no se traduce a reglas, campos mínimos, permisos, alertas y cadencias. El diseño debe vivir donde ocurre el trabajo y debe producir evidencia por defecto; depender de que alguien recuerde documentar después es una forma silenciosa de deuda operativa.
- Comprar o configurar antes de acordar decisiones y definiciones.
- Automatizar el happy path sin una cola explícita de excepciones.
- Duplicar el mismo dato en varios sistemas sin source of truth.
- Usar porcentajes agregados sin cohorte, ventana ni denominador.
- Asignar responsabilidad a “el equipo” en lugar de a un rol concreto.
La tesis: Diagnóstico capacidad-complejidad
Escalar es remover un límite medido; si el límite no está identificado, la complejidad distribuida suele reducir la capacidad de entregar y operar.
Este modelo separa cuatro capas que suelen mezclarse. La capa de negocio define estados, decisiones y límites. La capa de información conserva identidad, contexto, versiones y evidencia. La capa de ejecución asigna owners, SLAs, automatizaciones y excepciones. La capa de aprendizaje compara lo esperado con lo ocurrido y modifica reglas. Saltarse una capa genera soluciones que funcionan en una demo, pero se degradan cuando aumenta el volumen o cambia el contexto.
La unidad de diseño no es la pantalla ni la integración: es la decisión verificable. Cada decisión necesita una entrada válida, una salida observable y una persona o política responsable. Esta perspectiva permite cambiar herramientas sin perder el modelo y evita que la arquitectura quede atada a nombres de campos o funciones particulares de un proveedor.
| Capa | Pregunta que debe responder | Resultado |
|---|---|---|
| Negocio | ¿Qué cambió y por qué importa? | Estado y criterio de decisión |
| Información | ¿Qué evidencia y versión lo sostienen? | Datos trazables y autorizados |
| Ejecución | ¿Quién actúa y dentro de qué límite? | Owner, SLA, automatización y excepción |
| Aprendizaje | ¿Cómo sabremos si la regla funciona? | Métrica, revisión y backlog |
Framework paso a paso
1. Definir SLOs, carga y límites observados
El objetivo de esta etapa es convertir “definir slos, carga y límites observados” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.
La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Mapa de límites para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.
Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para requisitos regulatorios de aislamiento. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.
Instrumenta latencia por percentil desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.
- Criterio de entrada: existe evidencia suficiente para iniciar “Definir SLOs, carga y límites observados”.
- Owner: un rol puede aceptar, rechazar o devolver el caso.
- Criterio de salida: el siguiente estado es verificable sin interpretación privada.
- Excepción: requisitos regulatorios de aislamiento entra a una cola con prioridad y fecha.
- Evidencia: Mapa de límites conserva decisión, versión y responsable.
2. Medir cuellos de botella y costo de cambio
El objetivo de esta etapa es convertir “medir cuellos de botella y costo de cambio” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.
La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Presupuesto de capacidad para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.
Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para cargas impredecibles. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.
Instrumenta saturación del recurso limitante desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.
- Criterio de entrada: existe evidencia suficiente para iniciar “Medir cuellos de botella y costo de cambio”.
- Owner: un rol puede aceptar, rechazar o devolver el caso.
- Criterio de salida: el siguiente estado es verificable sin interpretación privada.
- Excepción: cargas impredecibles entra a una cola con prioridad y fecha.
- Evidencia: Presupuesto de capacidad conserva decisión, versión y responsable.
3. Simplificar estado, interfaces y ownership
El objetivo de esta etapa es convertir “simplificar estado, interfaces y ownership” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.
La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Matriz simplicidad versus distribución para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.
Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para procesamiento intensivo. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.
Instrumenta tasa de errores desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.
- Criterio de entrada: existe evidencia suficiente para iniciar “Simplificar estado, interfaces y ownership”.
- Owner: un rol puede aceptar, rechazar o devolver el caso.
- Criterio de salida: el siguiente estado es verificable sin interpretación privada.
- Excepción: procesamiento intensivo entra a una cola con prioridad y fecha.
- Evidencia: Matriz simplicidad versus distribución conserva decisión, versión y responsable.
4. Seleccionar patrón de escalamiento mínimo
El objetivo de esta etapa es convertir “seleccionar patrón de escalamiento mínimo” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.
La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Plan de prueba de carga para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.
Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para equipos con dominios y cadencias realmente independientes. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.
Instrumenta frecuencia y lead time de cambios desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.
- Criterio de entrada: existe evidencia suficiente para iniciar “Seleccionar patrón de escalamiento mínimo”.
- Owner: un rol puede aceptar, rechazar o devolver el caso.
- Criterio de salida: el siguiente estado es verificable sin interpretación privada.
- Excepción: equipos con dominios y cadencias realmente independientes entra a una cola con prioridad y fecha.
- Evidencia: Plan de prueba de carga conserva decisión, versión y responsable.
5. Probar capacidad, degradación y rollback
El objetivo de esta etapa es convertir “probar capacidad, degradación y rollback” en una condición que dos personas puedan evaluar de la misma manera. Empieza con casos reales, no con categorías ideales. Identifica qué información estaba disponible, qué decisión se tomó, quién la tomó y qué evidencia habría permitido repetirla. El entregable no es una lista exhaustiva, sino una regla suficientemente precisa para operar y aprender.
La decisión clave consiste en elegir el nivel correcto de detalle. Un modelo demasiado amplio oculta diferencias importantes; uno demasiado granular aumenta captura manual y mantenimiento. Usa Runbook de degradación para probar el límite: cada elemento debe cambiar una acción, una autorización, un cálculo o una conversación. Si no cambia nada, probablemente sea decorativo.
Implementa primero el camino de mayor frecuencia y añade un mecanismo visible para requisitos regulatorios de aislamiento. La excepción debe tener condición de entrada, owner, fecha objetivo y forma de cierre. No la resuelvas con un comentario libre sin estructura. Cuando una excepción se repite, deja de ser extraordinaria y debe alimentar el siguiente cambio del modelo.
Instrumenta costo por unidad de carga desde el inicio. Define evento, numerador, denominador, ventana, segmentación y fuente. Registrar una métrica después del despliegue suele revelar que faltan timestamps o estados históricos. Diseñarla ahora obliga a conservar la evidencia que luego permitirá evaluar el resultado.
- Criterio de entrada: existe evidencia suficiente para iniciar “Probar capacidad, degradación y rollback”.
- Owner: un rol puede aceptar, rechazar o devolver el caso.
- Criterio de salida: el siguiente estado es verificable sin interpretación privada.
- Excepción: requisitos regulatorios de aislamiento entra a una cola con prioridad y fecha.
- Evidencia: Runbook de degradación conserva decisión, versión y responsable.
Ejemplo trabajado de principio a fin
Supongamos una organización ficticia llamada Andina Norte que enfrenta este escenario: un equipo propone microservicios, eventos y múltiples stores porque espera crecer, aunque hoy los incidentes provienen de queries lentas, ownership difuso y despliegues que nadie puede reproducir. El equipo selecciona veinte casos recientes, incluyendo cuatro excepciones, y reconstruye el recorrido con timestamps y decisiones. Descubre que el problema no está distribuido uniformemente: se concentra en dos transiciones donde cambia el owner y la evidencia llega en formatos distintos.
En lugar de rediseñar todo, Andina Norte define una primera versión de Diagnóstico capacidad-complejidad. Conserva un identificador estable, exige la evidencia mínima y crea una cola común para excepciones. El caso solo avanza cuando el owner receptor acepta el paquete; si falta información, vuelve al estado anterior con una razón estructurada. Esta regla evita que “transferido” signifique cosas diferentes para quien entrega y quien recibe.
| Momento | Decisión ilustrativa | Evidencia | Owner |
|---|---|---|---|
| Semana 1 | Definir SLOs, carga y límites observados | Mapa de límites | Owner del proceso |
| Semana 2 | Medir cuellos de botella y costo de cambio | Presupuesto de capacidad | Data owner |
| Semana 3 | Simplificar estado, interfaces y ownership | Matriz simplicidad versus distribución | Operations owner |
| Semana 4 | Seleccionar patrón de escalamiento mínimo | Plan de prueba de carga | Automation owner |
| Revisión | Probar capacidad, degradación y rollback | latencia por percentil + saturación del recurso limitante | Business owner |
Durante el piloto, el equipo no declara éxito por haber configurado el flujo. Compara una cohorte posterior con el baseline, revisa cada excepción y pregunta si el sistema produjo una mejor decisión. Si latencia por percentil mejora pero saturación del recurso limitante empeora, el diseño puede estar desplazando trabajo en lugar de eliminarlo. La revisión combina resultado, calidad y costo operativo.
El aprendizaje más útil no es una cifra aislada, sino la relación causal que puede defenderse. Por ejemplo: una definición más estricta reduce casos aceptados, pero aumenta la calidad de la transición; o una automatización ahorra tiempo en casos estándar, pero necesita un umbral diferente para requisitos regulatorios de aislamiento. Esa evidencia permite ajustar una regla concreta sin rehacer toda la solución.
Artefactos que convierten el modelo en operación
| Artefacto | Decisión que habilita | Owner sugerido | Cadencia |
|---|---|---|---|
| Mapa de límites | Validar definir slos, carga y límites observados | Business owner | Por cambio de modelo |
| Presupuesto de capacidad | Validar medir cuellos de botella y costo de cambio | Business owner | Semanal durante el piloto |
| Matriz simplicidad versus distribución | Validar simplificar estado, interfaces y ownership | Operations owner | Semanal durante el piloto |
| Plan de prueba de carga | Validar seleccionar patrón de escalamiento mínimo | Operations owner | Semanal durante el piloto |
| Runbook de degradación | Validar probar capacidad, degradación y rollback | Operations owner | Semanal durante el piloto |
Mapa de límites
Mapa de límites debe responder una pregunta concreta: ¿podemos ejecutar y revisar definir slos, carga y límites observados sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.
Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a requisitos regulatorios de aislamiento. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.
Presupuesto de capacidad
Presupuesto de capacidad debe responder una pregunta concreta: ¿podemos ejecutar y revisar medir cuellos de botella y costo de cambio sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.
Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a cargas impredecibles. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.
Matriz simplicidad versus distribución
Matriz simplicidad versus distribución debe responder una pregunta concreta: ¿podemos ejecutar y revisar simplificar estado, interfaces y ownership sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.
Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a procesamiento intensivo. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.
Plan de prueba de carga
Plan de prueba de carga debe responder una pregunta concreta: ¿podemos ejecutar y revisar seleccionar patrón de escalamiento mínimo sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.
Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a equipos con dominios y cadencias realmente independientes. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.
Runbook de degradación
Runbook de degradación debe responder una pregunta concreta: ¿podemos ejecutar y revisar probar capacidad, degradación y rollback sin depender de memoria privada? Incluye solo campos que sostengan una decisión, una regla o una métrica. Añade owner, versión y fecha de vigencia para que el artefacto no se convierta en una fotografía sin mantenimiento.
Prueba el artefacto con un caso normal, uno incompleto y uno correspondiente a requisitos regulatorios de aislamiento. Si los tres terminan en la misma salida sin explicar diferencias, faltan criterios. Si cada caso requiere una ruta especial, el modelo es demasiado rígido. El objetivo es una estructura común con excepciones explícitas, no uniformidad artificial.
Arquitectura y patrón técnico
El siguiente diagrama expresa el flujo lógico. No obliga a usar cinco servicios ni cinco pantallas: varias etapas pueden vivir en una misma aplicación. Lo importante es conservar las fronteras de decisión y la evidencia que cruza cada una. Una implementación monolítica con contratos claros suele ser preferible a una arquitectura distribuida sin ownership.
Ver código fuente
flowchart LR
S1[Definir SLOs, carga y límites observados]
S2[Medir cuellos de botella y costo de cambio]
S3[Simplificar estado, interfaces y ownership]
S4[Seleccionar patrón de escalamiento mínimo]
S5[Probar capacidad, degradación y rollback]
S1 --> S2
S2 --> S3
S3 --> S4
S4 --> S5El contrato técnico mínimo debe ser pequeño, versionable e idempotente cuando produce efectos. Registra identificadores de correlación y evita usar texto libre como única señal para una decisión material. El ejemplo siguiente muestra una estructura de referencia; debe adaptarse al dominio, controles de acceso y lifecycle real.
{
"model": "Diagnóstico capacidad-complejidad",
"owner": "owner-del-proceso",
"version": 1,
"entryCriteria": [
"Definir SLOs, carga y límites observados",
"Medir cuellos de botella y costo de cambio"
],
"evidence": [
"Mapa de límites",
"Presupuesto de capacidad",
"Matriz simplicidad versus distribución"
],
"reviewCadence": "weekly"
}Trade-offs, excepciones y límites
No existe una configuración universal para Diagnóstico capacidad-complejidad. Aumentar control puede reducir velocidad; reducir captura puede quitar evidencia; centralizar definiciones puede ralentizar cambios locales; distribuir ownership puede generar divergencia. La decisión correcta explicita qué riesgo acepta y durante cuánto tiempo, en vez de presentar toda simplificación como mejora gratuita.
| Condición | Qué cambia en el diseño | Control compensatorio |
|---|---|---|
| requisitos regulatorios de aislamiento | Ajustar definir slos, carga y límites observados | Revisión de mapa de límites |
| cargas impredecibles | Ajustar medir cuellos de botella y costo de cambio | Revisión de presupuesto de capacidad |
| procesamiento intensivo | Ajustar simplificar estado, interfaces y ownership | Revisión de matriz simplicidad versus distribución |
| equipos con dominios y cadencias realmente independientes | Ajustar seleccionar patrón de escalamiento mínimo | Revisión de plan de prueba de carga |
Usa excepciones con fecha de expiración. Una regla temporal sin revisión suele convertirse en arquitectura permanente. Registra motivo, aprobador, alcance, evidencia y fecha de reevaluación. Cuando el volumen de una excepción supera el umbral acordado, crea un cambio de modelo; no aumentes indefinidamente la capacidad de la cola manual.
- Anti-pattern: usar una métrica objetivo como sustituto de calidad o resultado.
- Anti-pattern: permitir cambios de estado sin evidencia o razón estructurada.
- Anti-pattern: crear una automatización sin owner ni procedimiento de corrección.
- Anti-pattern: duplicar reglas en varios sistemas sin versionado coordinado.
- Anti-pattern: declarar adopción por número de usuarios conectados.
- Anti-pattern: ocultar excepciones para que el dashboard parezca saludable.
Métricas y criterios de éxito
Un scorecard equilibrado combina resultado, flujo, calidad y riesgo. El resultado indica si el problema importa; el flujo muestra dónde se acumula trabajo; la calidad evita optimizar velocidad a costa de errores; el riesgo confirma que la automatización no excede sus límites. Cada métrica debe tener owner y una acción asociada cuando cruza un umbral.
| Métrica | Definición operativa | Owner | Cadencia |
|---|---|---|---|
| latencia por percentil | Medir latencia por percentil con cohorte, ventana y fuente documentadas | Business owner | Semanal |
| saturación del recurso limitante | Medir saturación del recurso limitante con cohorte, ventana y fuente documentadas | Business owner | Mensual |
| tasa de errores | Medir tasa de errores con cohorte, ventana y fuente documentadas | Operations / Data | Mensual |
| frecuencia y lead time de cambios | Medir frecuencia y lead time de cambios con cohorte, ventana y fuente documentadas | Operations / Data | Mensual |
| costo por unidad de carga | Medir costo por unidad de carga con cohorte, ventana y fuente documentadas | Operations / Data | Mensual |
Antes del piloto captura baseline con la misma definición que usarás después. Evita comparar una muestra limpia posterior con un histórico que incluía casos incompletos. Segmenta por las condiciones que cambian el proceso y conserva intervalos, no solo promedios. Una mejora agregada puede esconder deterioro en un grupo pequeño pero material.
Plan de implementación en 30 días
| Periodo | Trabajo principal | Evidencia de salida |
|---|---|---|
| Días 1–5 | Diagnosticar un equipo propone microservicios, eventos y múltiples stores porque espera crecer, aunque hoy los incidentes provienen de queries lentas, ownership difuso y despliegues que nadie puede reproducir | Baseline y muestra de casos |
| Días 6–10 | Definir Diagnóstico capacidad-complejidad | Mapa de límites |
| Días 11–20 | Pilotar Definir SLOs, carga y límites observados, Medir cuellos de botella y costo de cambio, Simplificar estado, interfaces y ownership | Matriz simplicidad versus distribución |
| Días 21–25 | Instrumentar métricas y excepciones | Runbook de degradación |
| Días 26–30 | Revisar evidencia y decidir siguiente alcance | Decisión documentada y backlog |
Durante los primeros cinco días evita diseñar desde opiniones agregadas. Selecciona casos concretos, reconstruye timestamps y entrevista a quienes entregan y reciben trabajo. La discrepancia entre sus versiones contiene información útil: muestra dónde el sistema necesita una definición, una transferencia o una evidencia adicional.
En la segunda semana trabaja con el menor grupo capaz de decidir. Valida vocabulario, estados y límites, y registra preguntas no resueltas. La aprobación del diseño no significa unanimidad; significa que existe un owner con autoridad para elegir y que los desacuerdos relevantes quedan visibles como riesgos o experimentos.
En la tercera semana ejecuta el flujo con volumen controlado. Observa trabajo manual, tiempos de espera y correcciones. No amplíes el piloto solo porque no aparecieron errores: incluye intencionalmente casos de requisitos regulatorios de aislamiento y cargas impredecibles para probar que el sistema se detiene o escala de manera segura.
En la última semana compara el resultado con el baseline y toma una decisión explícita: ampliar, corregir, mantener limitado o detener. Cada opción es válida si la evidencia la sostiene. El cierre del piloto debe dejar un owner, una cadencia, un backlog priorizado y una ruta de rollback.
Preguntas para un workshop de diseño
Preguntas sobre definir slos, carga y límites observados
¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa requisitos regulatorios de aislamiento? Responder con un caso reciente es más valioso que acordar una frase general.
¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular latencia por percentil— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.
Preguntas sobre medir cuellos de botella y costo de cambio
¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa cargas impredecibles? Responder con un caso reciente es más valioso que acordar una frase general.
¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular saturación del recurso limitante— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.
Preguntas sobre simplificar estado, interfaces y ownership
¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa procesamiento intensivo? Responder con un caso reciente es más valioso que acordar una frase general.
¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular tasa de errores— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.
Preguntas sobre seleccionar patrón de escalamiento mínimo
¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa equipos con dominios y cadencias realmente independientes? Responder con un caso reciente es más valioso que acordar una frase general.
¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular frecuencia y lead time de cambios— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.
Preguntas sobre probar capacidad, degradación y rollback
¿Qué hecho observable inicia esta etapa? ¿Qué información puede faltar sin impedir la decisión? ¿Qué dato debe bloquearla? ¿Quién acepta el resultado y en cuánto tiempo? ¿Cómo se representa requisitos regulatorios de aislamiento? Responder con un caso reciente es más valioso que acordar una frase general.
¿Qué parte puede automatizarse hoy sin perder control? ¿Qué evidencia debe conservarse antes y después? ¿Cómo se revierte una acción incorrecta? ¿Qué métrica —en particular costo por unidad de carga— revelaría que el diseño está creando un efecto no deseado? Estas preguntas conectan la conversación de negocio con el contrato técnico.
Checklist: qué hacer mañana
- Seleccionar diez casos reales relacionados con Diagnóstico capacidad-complejidad.
- Nombrar un owner para definir slos, carga y límites observados.
- Documentar una primera versión de mapa de límites.
- Definir evento, denominador y fuente para latencia por percentil.
- Crear una cola explícita para requisitos regulatorios de aislamiento.
- Elegir un piloto pequeño con fecha de revisión y criterio de salida.
- Registrar baseline antes de cambiar reglas o automatizaciones.
- Acordar cómo detener y revertir el piloto si aparece un riesgo material.
Siguiente lectura: Architecture & Transformation
Este artículo forma parte del cluster Architecture & Transformation. Para continuar, conecta este modelo con las siguientes decisiones:
• Zero Trust multicloud: identidad, políticas y evidencia sin crear tres modelos de seguridad
