Monitorizar correctamente una infraestructura cloud es fundamental para garantizar el rendimiento, la disponibilidad y la estabilidad de los servicios. En entornos desplegados sobre Oracle Cloud Infrastructure (OCI), disponer de métricas fiables permite detectar anomalías, identificar cuellos de botella y anticiparse a posibles incidencias antes de que afecten a los usuarios.

Oracle Cloud Monitoring es el servicio de OCI diseñado para recopilar y consultar métricas de los recursos cloud, establecer alarmas y analizar el comportamiento de la infraestructura. Estas métricas proporcionan información sobre el consumo de CPU, memoria, almacenamiento, red y otros componentes esenciales del entorno.

En este artículo analizamos las principales métricas de Oracle Cloud Infrastructure, qué información proporcionan y cuáles son especialmente relevantes para monitorizar el rendimiento de una infraestructura OCI.

¿Qué es Oracle Cloud Monitoring?

Oracle Cloud Monitoring es un servicio de Oracle Cloud Infrastructure que permite recopilar, consultar y visualizar métricas relacionadas con los recursos desplegados en OCI.

Imagen1-3

En el caso de Oracle Cloud Infrastructure (OCI) nos ofrece una serie de herramientas para poder llevar a cabo esto. En concreto, se puede monitorizar de forma pasiva o activa una serie de métricas de vital importancia para la actividad de negocio.

Las métricas permiten conocer el estado y comportamiento de diferentes recursos cloud prácticamente en tiempo real. A partir de estos datos, los equipos técnicos pueden establecer umbrales y configurar alarmas para recibir notificaciones cuando determinadas condiciones se cumplen.

Imagen2

La monitorización no consiste únicamente en observar si un recurso está activo. El análisis de métricas permite identificar tendencias y comportamientos anómalos, por ejemplo:

  • Incrementos sostenidos del consumo de CPU.
  • Falta de capacidad de almacenamiento.
  • Aumento de la latencia de red.
  • Incrementos inesperados en las operaciones de entrada y salida.
  • Saturación de determinados recursos.
  • Variaciones anómalas respecto al comportamiento habitual.

Por tanto, OCI Monitoring constituye una de las piezas fundamentales para mantener el control operativo de una infraestructura desplegada en Oracle Cloud.

De forma predeterminada, las métricas que suelen abarcar son, por mencionar las más importantes, la CPU, memoria, lectura/escritura en disco en las instancias de computación, envío de paquetes y estado de sesiones en las instancias de networking.

Oracle, por su parte, nos ofrece un servicio de notificación bastante completo en el caso de que las métricas sobrepasen un límite previamente definido.

Para sacar un mayor provecho, Oracle ofrece dentro de su CLI (command line interface) una serie de end-points que junto con la sintaxis de Monitoring Query Language (MQL) podremos integrar nuestra propia herramienta de monitorización dando un valor añadido, ya se que puede adaptar e integrar a las necesidades actuales para la monitorización diaria.

¿Qué métricas se pueden monitorizar en Oracle Cloud Infrastructure?

Las métricas disponibles dependen del servicio y del recurso de OCI que se esté utilizando. Entre las más relevantes se encuentran las relacionadas con Compute, almacenamiento, red y bases de datos.

Analizar estas métricas conjuntamente es especialmente importante, ya que un problema de rendimiento no siempre tiene su origen en el recurso que inicialmente presenta síntomas.

Métricas de Compute

Las instancias de Oracle Cloud Infrastructure Compute generan diferentes métricas relacionadas con el uso de sus recursos.

Una de las métricas más relevantes es CPU Utilization, que indica el porcentaje de capacidad de CPU utilizado por una instancia.

Un consumo elevado y sostenido puede indicar que una instancia necesita más capacidad de procesamiento o que existe algún proceso que está utilizando recursos de forma anómala.

Además de la CPU, es importante analizar otras métricas relacionadas con:

  • Utilización de memoria.
  • Tráfico de red.
  • Operaciones de disco.
  • Throughput.
  • Latencia.
  • Errores.

Por ejemplo, una utilización de CPU elevada acompañada de un incremento de las operaciones de disco puede apuntar a un problema diferente al que encontraríamos si el incremento de CPU estuviera provocado exclusivamente por procesos de aplicación.

Por este motivo, Oracle Cloud Monitoring debe utilizarse para analizar el comportamiento conjunto de diferentes métricas y no únicamente un indicador aislado.

Métricas de almacenamiento

El almacenamiento es otro de los componentes que debe monitorizarse de forma continua en una infraestructura OCI.

Entre las métricas que pueden resultar relevantes encontramos:

  • Capacidad utilizada.
  • Operaciones de lectura y escritura.
  • IOPS.
  • Throughput.
  • Latencia.
  • Errores de entrada y salida.

La capacidad permite detectar situaciones en las que un recurso se aproxima a sus límites de almacenamiento, mientras que IOPS, throughput y latencia ayudan a analizar su comportamiento desde el punto de vista del rendimiento.

Por ejemplo, un incremento de la latencia de almacenamiento puede terminar afectando al tiempo de respuesta de una aplicación aunque la utilización de CPU de la instancia permanezca dentro de los valores habituales.

Métricas de red en OCI

La conectividad es otro elemento crítico dentro de cualquier arquitectura cloud.

En Oracle Cloud Infrastructure pueden analizarse diferentes métricas relacionadas con el tráfico de red y el comportamiento de los recursos conectados.

Entre ellas destacan:

  • Tráfico de entrada y salida.
  • Paquetes enviados y recibidos.
  • Errores.
  • Throughput.
  • Latencia.
  • Utilización de interfaces de red.

Estas métricas permiten identificar problemas de conectividad, incrementos inesperados de tráfico o situaciones en las que determinados componentes de la infraestructura pueden estar alcanzando sus límites.

En arquitecturas complejas, el análisis de red resulta especialmente relevante cuando existen conexiones entre diferentes redes virtuales, servicios cloud, centros de datos corporativos o entornos híbridos.

Métricas de bases de datos

Las bases de datos constituyen otro de los componentes donde la monitorización adquiere especial importancia.

Dependiendo del servicio utilizado en OCI, pueden analizarse métricas relacionadas con:

  • Utilización de CPU.
  • Memoria.
  • Sesiones.
  • Operaciones de entrada y salida.
  • Storage.
  • Latencia.
  • Throughput.
  • Actividad de las conexiones.

El análisis conjunto de estas métricas permite determinar si una degradación del rendimiento está relacionada con la propia base de datos, con la infraestructura que la soporta o con otros componentes de la arquitectura.

En este punto es especialmente importante establecer valores de referencia para cada entorno. Una métrica que puede considerarse normal en una determinada carga de trabajo puede resultar problemática en otra.

¿Qué métricas de OCI deberías monitorizar?

No todas las métricas tienen la misma importancia para todas las arquitecturas.

Una estrategia adecuada de Oracle Cloud Monitoring debe comenzar identificando los recursos críticos y seleccionando aquellas métricas que permitan conocer su disponibilidad, capacidad y rendimiento.

De forma general, podemos establecer cuatro grandes grupos:

ÁreaMétricas prioritariasPara qué sirven
ComputeCPU, memoriaDetectar sobrecarga
StorageIOPS, capacidad, latenciaDetectar cuellos de botella
Networktráfico, errores, latenciaIdentificar problemas de conectividad
DatabaseCPU, sesiones, I/OControlar rendimiento

La clave no está en recopilar el mayor número posible de métricas, sino en seleccionar aquellas que permitan tomar decisiones operativas.

¿Cómo construir un comando para la monitorización de un parámetro?

Como ejemplo, vamos a mostrar cómo construir un comando para la monitorización de un parámetro sencillo, como el estado de una instancia Compute.

En la consola de OCI, dentro de la instancia que queremos monitorizar, accedemos al apartado Metrics y seleccionamos el Metric Namespace correspondiente. En este caso, oci_compute_infrastructure_health.

Una vez seleccionada la métrica, desde Options podemos seleccionar Copy Query (MQL). OCI generará la consulta correspondiente, que podremos utilizar posteriormente para realizar consultas sobre la métrica.

Imagen3

Esto nos habrá copiado un texto como el siguiente:

instance_status[5m]{resourceId = «ocid1.instance.oc1.eu-frankfurt-1..o7a»}.mean()

Dentro de la estructura del comando de OCI usamos el parámetro monitoring y metric-data summarize-metrics-data.

Imagen4-1

La construcción completa sería la siguiente:

oci monitoring metric-data summarize-metrics-data –compartment-id ocid1.compartment.oc1..uaq –namespace oci_compute_infrastructure_health –query-text=’instance_status[5m]{resourceId = «ocid1.instance.oc1.eu-frankfurt-1..o7a»}.mean()’

El resultado en una salida JSON parametrizada de tal forma que podemos sacar la información que nos interese:

Imagen5

En este caso, la variable “value” indica 0.0 que indica que la instancia está disponible.

Con esto se ve cómo podemos monitorizar el estado de una instancia de compute, pero las posibilidades son bastante amplias. De hecho, casi cualquier servicio en la nube de Oracle nos ofrece la posibilidad de ser monitorizado a través del CLI tales como balanceadores de carga, tuneles IPSEC, Fast Connect , Autonomus Database etc.

Oracle Cloud Monitoring y las alarmas

Una de las principales ventajas de la monitorización de OCI es que las métricas pueden utilizarse para establecer alarmas.

Una alarma permite definir una condición determinada sobre una métrica. Cuando se alcanza el umbral configurado, OCI puede generar una notificación para que el equipo responsable pueda analizar la situación.

Por ejemplo, puede configurarse una alarma para detectar una utilización de CPU superior a un determinado porcentaje durante un periodo de tiempo.

Sin embargo, establecer alarmas no consiste simplemente en definir umbrales arbitrarios.

Un valor demasiado bajo puede generar un número elevado de falsas alarmas, mientras que un valor demasiado alto puede provocar que una incidencia se detecte demasiado tarde.

Por ello, es recomendable establecer los umbrales a partir del comportamiento habitual de cada recurso y revisar periódicamente su configuración.

Integración con Zabbix/Grafana

OCI Monitoring puede formar parte de una estrategia de monitorización más amplia y que, dependiendo de las necesidades del equipo IT, los datos pueden integrarse o visualizarse mediante herramientas de terceros como Zabbix o Grafana.

HerramientaPrincipal utilidad
OCI MonitoringRecopilación y monitorización nativa de métricas
ZabbixMonitorización centralizada de infraestructuras heterogéneas
GrafanaVisualización y creación de dashboards

Así que, para que estos datos nos sean útiles, y puedan ser representados de una forma cómoda y poder monitorizarlos correctamente, podemos integrar estos datos en cualquier plataforma de monitorización, en nuestro ejemplo a continuación, utilizaremos Zabbix.

Imagen6

Zabbix de forma nativa puede procesar comandos y filtrar los resultados. En nuestro caso, nos interesa quedarnos solo con el estatus del balanceador si es OK o ERROR, para eso Zabbix nos ofrece una forma rápida de filtrar datos estructurados en archivos JSON tal como aparece abajo:

Imagen7

Una vez vinculado el estado del balanceador al dato y eligiendo un intervalo de consulta, tendremos incorporado el valor para poder crear desencadenadores de alertas para que nos avise en el caso de que la instancia del balanceador no esté disponible.

Este caso que hemos visto puede extenderse a todas las instancias que tengamos en el OCI de Oracle, creado una plataforma única, rápida y accesible para revisar el estado de nuestra infraestructura en OCI.

En el caso de que queramos aumentar nuestra experiencia visual, podemos beneficiarnos de Grafana, una herramienta de visualización de datos muy integrada hoy en día en este campo.

Existen Plugin de Grafana que nos permiten conectarnos directamente a las métricas de cualquier instancia OCI, y poder visualizar series temporales.

Imagen8

Gracias a las facilidades que proporciona Oracle a través de CLI y su integración con otras herramientas, podemos administrar las métricas de nuestra infraestructura de forma sencilla y fiable.

Los aplicativos y componentes físicos que corren en la capa del cliente son de vital importancia para la continuidad del negocio y con este tipo de herramientas se garantiza la disponibilidad, y predecir o evitar posibles escenarios que lleven a una indisponibilidad del servicio.

Monitorización frente a observabilidad en OCI

Aunque los conceptos están relacionados, monitorización y observabilidad no son exactamente lo mismo.

La monitorización permite conocer el estado de determinados recursos mediante métricas y alarmas.

La observabilidad proporciona una visión más amplia del comportamiento de los sistemas, combinando diferentes fuentes de información para comprender por qué se produce un determinado comportamiento.

En un entorno OCI, las métricas pueden complementarse con otros servicios y capacidades de observabilidad, como logs, eventos y trazas, para realizar un análisis más profundo.

Por ejemplo, una métrica puede mostrar que el tiempo de respuesta de un servicio ha aumentado. A partir de ese dato, los logs y otros elementos de observabilidad pueden ayudar a determinar cuál es la causa concreta.

Por tanto, Oracle Cloud Monitoring debe entenderse como una parte de una estrategia más amplia de observabilidad de Oracle Cloud Infrastructure.

Buenas prácticas para monitorizar Oracle Cloud Infrastructure

Una monitorización eficaz requiere algo más que activar métricas.

1. Identificar los recursos críticos

No todos los componentes de una arquitectura tienen el mismo impacto sobre el negocio. Conviene identificar primero aquellos recursos cuya indisponibilidad o degradación pueda afectar a aplicaciones y servicios críticos.

2. Definir una línea base

Antes de establecer alarmas es recomendable conocer cuál es el comportamiento habitual de cada recurso.

La línea base permite diferenciar una variación normal de un comportamiento realmente anómalo.

3. Configurar alarmas relevantes

Las alarmas deben estar vinculadas a situaciones que requieran una actuación. Configurar demasiadas alertas puede provocar fatiga de alertas y hacer que incidencias relevantes pasen desapercibidas.

4. Analizar tendencias

Una métrica aislada proporciona información limitada. Analizar su evolución a lo largo del tiempo permite detectar incrementos progresivos del consumo y anticiparse a problemas de capacidad.

5. Correlacionar diferentes métricas

Un incremento de CPU, por ejemplo, no debería analizarse de forma independiente.

Relacionarlo con métricas de memoria, disco, red o base de datos puede ayudar a identificar el origen real de una degradación.

6. Integrar la monitorización con la estrategia de operaciones

La monitorización debe formar parte de los procedimientos operativos de IT. Una alarma solo resulta útil si existe un proceso definido para analizarla y actuar sobre ella.

¿Por qué es importante monitorizar OCI?

Una infraestructura cloud puede funcionar correctamente durante largos periodos y, aun así, experimentar variaciones importantes en consumo y rendimiento.

La monitorización continua permite pasar de un modelo reactivo a uno más preventivo.

Entre sus principales beneficios se encuentran:

  • Mayor disponibilidad: permite detectar problemas antes de que provoquen una interrupción del servicio.
  • Mejor rendimiento: facilita la identificación de cuellos de botella.
  • Optimización de recursos: ayuda a detectar recursos sobredimensionados o infrautilizados.
  • Detección temprana de incidencias: las alarmas permiten actuar ante comportamientos anómalos.
  • Planificación de capacidad: el análisis histórico ayuda a anticipar necesidades futuras.
  • Mayor visibilidad: proporciona una visión centralizada del comportamiento de los recursos OCI.

Conclusión

La monitorización es un componente esencial para gestionar correctamente cualquier infraestructura desplegada en Oracle Cloud Infrastructure.

Oracle Cloud Monitoring permite recopilar y analizar métricas de los diferentes recursos de OCI, establecer alarmas y disponer de información que facilite la detección de problemas de rendimiento, capacidad y disponibilidad.

Sin embargo, una estrategia de monitorización eficaz no consiste en observar todas las métricas disponibles. El verdadero valor está en identificar los indicadores críticos, establecer líneas base, configurar alertas relevantes y correlacionar la información de diferentes componentes.

A medida que las arquitecturas cloud se vuelven más complejas, combinar métricas con logs, eventos y otras capacidades de observabilidad permite obtener una visión mucho más completa del entorno y mejorar la capacidad de los equipos IT para detectar y resolver incidencias.

En este contexto, contar con una estrategia adecuada de Oracle Cloud Infrastructure monitoring resulta clave para mantener entornos OCI estables, eficientes y preparados para crecer.