Skip to main content
Esta sección documenta la plataforma de monitoreo de B Brands — la única capa que observa cada app e integración a través de development, certification y production, publica una página de estado pública por entorno, y está definida enteramente como código (Terraform) y operada a través de GitHub Actions.

Qué es esto

Cada entorno tiene su propio workspace de Better Stack con una página de estado pública. En lugar de que un humano decida si un componente está sano, el estado se deriva del tráfico real de producción que fluye a través de horizon-api: la API computa un veredicto de salud por componente, Better Stack lo consulta, y la página de estado refleja la realidad automáticamente. Se usan dos productos independientes de Better Stack:

Uptime

Páginas de estado, monitores HTTP y heartbeats de cron. Impulsa el estado verde / amarillo / rojo que ve cada visitante.

Telemetry

Fuentes de logs, métricas y alertas basadas en logs. Alimenta los gráficos de infraestructura y las alertas (opcionales) de tasa de error por servicio.

Los tres entornos

Cada entorno está totalmente aislado: su propia página de estado, sus propios monitores, su propio host de API y sus propios tokens. Nada se comparte entre entornos.

Qué significa cada color

La página de estado habla a dos audiencias a la vez — el negocio (¿es utilizable la plataforma?) y la ingeniería (¿qué está fallando exactamente?).

Operacional (verde)

El componente atiende el tráfico normalmente. La tasa de error está dentro de la banda saludable.

Degradado (amarillo)

El componente aún responde pero se detectó una tasa de error sostenida, una ruta que falla o un cron obsoleto. Los usuarios pueden notar lentitud o fallos parciales.

Caído (rojo)

Una caída real: la tasa de error de ventana corta cruzó el umbral de caída. El endpoint del componente devuelve 503.

Qué se monitorea

Cada entorno converge al mismo catálogo, cada uno apuntando a sus propios hosts.

30 monitores HTTP

10 apps frontend + 11 categorías de API + 9 integraciones. Better Stack consulta cada una cada 1-3 minutos.

3 heartbeats de cron

Health API, Health Integrations y Metrics Push. Confirman que el scheduler en sí sigue funcionando.

4 secciones de la página de estado

Plataformas, API, Integraciones e Infraestructura — cómo se agrupan los componentes para los visitantes.

Fuentes de telemetría

Una fuente de logs/métricas por entorno para los gráficos de infraestructura y las alertas de logs.

Cómo fluye la señal

La regla de oro: los monitores deciden el rojo, los Status Reports deciden el amarillo

Este es el concepto más importante de toda la plataforma. Las dos capas de salud son deliberadamente independientes para que un problema del scheduler nunca pueda fingir una caída.

Rojo (caído) — monitores HTTP

Un monitor consulta el endpoint del componente. Solo ve 503 cuando la tasa de error de ventana corta es una caída real. Esta ruta no depende del scheduler de crons, así que un tick perdido no puede producir un falso rojo.

Amarillo (degradado) — Status Reports

Los crons de salud comparan cada veredicto con el estado publicado y crean/resuelven Status Reports. Un tick perdido solo retrasa la transición al amarillo, lo cual es inofensivo.

Adónde ir después

Arquitectura de salud

Cómo se computa y publica el veredicto de tres estados.

Infraestructura como código

La definición Terraform de cada recurso de Better Stack, y plan vs apply.

CI/CD para el monitoreo

El workflow de GitHub Actions que valida y aplica los cambios de forma segura.

Runbook de operaciones

Tareas del día 2: sincronizar variables de entorno, agregar un monitor, rotar tokens, resolver drift.