Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Respuesta automática y sus riesgos

5 tareas · 38 min · Principiante

Responder a mano es lento y responder solo es peligroso. Existe una tercera vía: acciones automáticas pequeñas, reversibles y bien medidas, con las destructivas siempre detrás de una persona. En Chitagá Logística, una semana de respuesta automática dejó un postmortem: un despliegue de pagos se quedó con una sola réplica sana durante once minutos. Lees el catálogo de acciones, qué regla dispara cuál, el historial de la semana y el postmortem, y aprendes a medir el daño de una automatización antes de ampliarla. El formato del catálogo es propio de este laboratorio.

0 de 5 · 0%

Objetivo de la sala

Responder a mano es lento y responder solo es peligroso. Existe una tercera vía: acciones automáticas pequeñas, reversibles y bien medidas, con las destructivas siempre detrás de una persona. En Chitagá Logística, una semana de respuesta automática dejó un postmortem: un despliegue de pagos se quedó con una sola réplica sana durante once minutos. Lees el catálogo de acciones, qué regla dispara cuál, el historial de la semana y el postmortem, y aprendes a medir el daño de una automatización antes de ampliarla. El formato del catálogo es propio de este laboratorio.

Una respuesta automática ejecuta una acción en cuanto salta una regla, sin esperar a nadie. Gana tiempo, pero hereda cada falso positivo de la regla: si la regla se equivoca una vez por semana, la automatización se equivocará una vez por semana, y esta vez con efectos. Eliminar un pod parece inocuo porque el controlador lo recrea, pero si el pod nuevo vuelve a disparar la regla, se entra en un bucle que puede dejar un servicio sin réplicas sanas. Además, se pierde la evidencia local del pod que se borra.

Por eso la pregunta no es «¿automatizamos?», sino «¿qué tan reversible es esta acción y qué tan fiable es la regla que la dispara?».

Responde para continuar

¿Cuál es el riesgo principal de eliminar un pod automáticamente ante una alerta?

Ver pista de ayuda

Piensa en lo que pasa cuando la regla se equivoca.

Es común que las reglas más graves reciban las acciones más drásticas, con el razonamiento de que «si es crítico, hay que cortar ya». Es una trampa: la gravedad dice qué tanto daño podría haber, no qué tan seguro es que haya ocurrido. Una regla crítica con muchos falsos positivos es la peor candidata a una acción destructiva sin revisión.

Lee respuesta/asociaciones.txt y mira qué acción cuelga de la regla de prioridad CRITICAL. Resuelve su id en el catálogo.

Responde para continuar

Escribe el id de la acción asociada a la regla de prioridad CRITICAL.

Ver pista de ayuda

Con la terminal, `cat respuesta/asociaciones.txt`. El id está en la última columna.

Una automatización se evalúa como cualquier control: por sus aciertos y por sus errores. El historial guarda cada acción con su revisión posterior: si la alerta resultó verdadera o falsa. Contar los falsos positivos de una acción destructiva da el número que decide si se amplía, se acota o se retira.

Abre respuesta/historial-semana.log y cuenta las filas cuya revisión posterior concluyó que fue un falso positivo.

Responde para continuar

¿Cuántas acciones de la semana se revisaron como falso positivo?

Ver pista de ayuda

Cuenta solo las filas cuya revisión empieza por falso positivo; las demás son verdaderas o están sin revisar.

Un criterio sencillo para elegir qué automatizar es mirar dos columnas del catálogo: si la acción se puede deshacer y si interrumpe el servicio. Una acción que cumple las dos buenas condiciones, reversible y sin corte, puede asociarse a una regla con confianza media, porque equivocarse cuesta poco. Las que cortan servicio o no se pueden deshacer necesitan aprobación de una persona.

Abre respuesta/catalogo-acciones.txt y busca la única acción que es reversible y no interrumpe el servicio.

Responde para continuar

Escribe el id de la única acción reversible que no interrumpe el servicio.

Ver pista de ayuda

Hay otra reversible, pero con interrupción parcial.

Una política sana avanza por escalones. Primero la regla solo avisa. Después se le asocia una acción reversible y sin corte. Solo cuando el historial muestra pocos falsos positivos durante un tiempo, se plantea una acción con efecto, y aun así con aprobación humana y una lista de cargas que nunca se tocan (los despliegues críticos, los cierres de mes). Cada escalón se revisa con datos, como el del postmortem.

Responde para continuar

¿Cómo se debería ampliar la respuesta automática tras el postmortem?

Ver pista de ayuda

El postmortem enseña que la medida se prueba con datos antes de ampliarse.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad