
Cómo DCENT supervisa cientos de servidores y petabytes de infraestructura en Europa con Bleemeo
«Llevamos varios años usando Bleemeo, supervisando entre 100 y 400 servidores según el momento. Lo que siempre me ha gustado más es su simplicidad: lo instalas y enseguida tienes una visión clara de lo que está haciendo realmente tu hardware, con alertas cuando algo va mal. Nuestra infraestructura ha crecido enormemente desde que empezamos con Bleemeo — de servidores sueltos a decenas de petabytes de almacenamiento, grandes clústeres GPU y nuestro propio backbone BGP europeo que transporta cientos de gigabits de tráfico. Bleemeo ha sido una herramienta muy útil a lo largo de todo ese crecimiento.»
Qué supervisa DCENT con Bleemeo
Monitoreo de servidores
Cada servidor físico: CPU, memoria, red, GPU NVIDIA y cada disco del chasis.
Saber másMonitoreo de disponibilidad
Una visión independiente, desde fuera de la infraestructura, de lo que sigue siendo alcanzable.
Saber másAlertas y notificaciones
Canales de Telegram y la app móvil, para que una alerta llegue a quien no está delante de una pantalla.
Saber másSobre DCENT
DCENT es un proveedor europeo de infraestructura especializado en almacenamiento a gran escala, cómputo GPU e infraestructura de red.
Desde su propio centro de datos en los Países Bajos y despliegues en las principales ubicaciones europeas, DCENT opera cientos de servidores físicos y decenas de petabytes de almacenamiento, junto a clústeres GPU de alta densidad y entornos bare metal dedicados.
Detrás de todo ello está su propia red europea, en rápido crecimiento. Bajo el número AS216456, DCENT opera su backbone BGP entre las principales ubicaciones europeas, con varias rutas redundantes de alta capacidad.
En lugar de comprar simplemente conectividad a Internet en cada ubicación, DCENT ha convertido la red en una pieza central de su infraestructura. Opera varios enlaces de 100G, controla directamente su enrutamiento y hace peering con cientos de redes en un número creciente de puntos neutros. La red transporta habitualmente cientos de gigabits por segundo en hora punta.
Su presencia de peering incluye AMS-IX, Speed-IX, ERA-IX, Piter-IX, 1-IX, GNM-IX y GigaNET-IXN, y el backbone sigue expandiéndose al ritmo de la infraestructura de cómputo y almacenamiento.
Esta combinación de almacenamiento, cómputo y red BGP propia significa que DCENT controla buena parte de la pila de infraestructura — desde discos, servidores y GPU hasta cómo se enruta el tráfico por Europa y llega a Internet.
Visitar dcent.ioEl desafío
A medida que DCENT pasó de un entorno de hosting relativamente pequeño a un proveedor europeo de infraestructura distribuida, el monitoreo fue ganando importancia.
Hoy su infraestructura son cientos de servidores físicos, decenas de petabytes de almacenamiento, sistemas GPU de alta densidad y su propia red BGP repartida por varias ubicaciones europeas.
Con miles de componentes de hardware individuales y cientos de gigabits de tráfico de red que mantener sanos, revisar los sistemas a mano sencillamente ya no es una opción.
Un problema puede ser desde un uso anómalo de CPU o memoria hasta un disco averiado, una GPU sobrecargada, una incidencia de red o un servicio entero que deja de ser alcanzable. DCENT necesita por tanto una vista centralizada de su infraestructura y, sobre todo, alertas fiables cuando algo empieza a comportarse de forma distinta a lo normal.
La solución
DCENT lleva varios años usando Bleemeo, con entre 100 y 400 servidores supervisados por la plataforma según el momento.
Una de las razones principales para seguir usándolo es su simplicidad. Los servidores nuevos se añaden rápido y dan de inmediato información útil sobre CPU, memoria, almacenamiento, red y estado general del sistema, sin exigir un tiempo de ingeniería significativo para construir y mantener la propia plataforma de monitoreo. El monitoreo de servidores cubre cada host del parque.
Lo mismo ocurre con su infraestructura de cómputo GPU, donde entender la utilización, la carga del sistema y el comportamiento del hardware es especialmente importante cuando se opera hardware caro y de alta densidad.
A medida que su propia red se ha extendido por Europa, el monitoreo de disponibilidad también ha ganado valor: aporta otra visión independiente de si los sistemas y servicios siguen siendo alcanzables.
Lo que DCENT cambió en Bleemeo
Hasta aquí el relato de DCENT. Esta parte es nuestra, porque algo de lo que usan no existía antes de que lo pidieran: su hardware es lo bastante inusual como para que soportarlo bien significara cambiar el producto.
Servidores con más de cien discos
Hicieron falta tres arreglos distintos. Un chasis con más de 100 discos dibujaba un gráfico convertido en una banda arcoíris continua —técnicamente correcto y completamente ilegible—, así que hicimos seleccionables las métricas mostradas. Glouton necesitó varias optimizaciones para seguir emitiendo un punto cada 10 segundos en un host de esa densidad. Y la salud de disco S.M.A.R.T. la leen programas externos cuyo tiempo de ejecución no sobrevivía a multiplicarse por cien, así que se rehízo esa lógica de recolección.
Métricas de GPU NVIDIA
DCENT fue el primer cliente de Bleemeo que las necesitó, y de ahí arranca el soporte de GPU: utilización, memoria, temperatura y consumo, leídos mediante nvidia-smi. Hoy forma parte del monitoreo de servidores para cualquier host con GPU.
TrueNAS Core y TrueNAS Scale
Ambos están en la lista de sistemas soportados porque DCENT tiene cabinas de almacenamiento sobre ellos: las cabinas formaban parte del parque, así que tenían que formar parte del monitoreo. Figuran en el catálogo de integraciones con los demás sistemas operativos soportados.
«DCENT nos puso en las manos un servidor con más discos de los que la mayoría de nuestros clientes tiene servidores — y de paso nos pidió métricas de GPU y TrueNAS. Nuestro bucle de recolección, nuestras sondas S.M.A.R.T. y nuestros gráficos daban todos por sentada, en silencio, una máquina con un puñado de discos, y los tres tuvieron que cambiar. No lo tratamos como un caso límite, porque no lo es: esa densidad es hacia donde va el almacenamiento. Los paneles de todo el mundo han mejorado por ello, y hizo falta un cliente con hardware inusual para enseñárnoslo.»Lionel Porcheron — CEO y cofundador, Bleemeo
Los resultados
Para DCENT, el mayor valor de Bleemeo siempre ha sido su simplicidad: hace que una cantidad enorme de infraestructura resulte sorprendentemente fácil de entender.
Con los años, Bleemeo les ha ayudado a supervisar cientos de servidores, detectar caídas rápidamente y entender mejor cómo se usa realmente su hardware. Esa visibilidad les ha permitido mejorar la utilización del hardware, diagnosticar más rápido y ver mucho mejor su infraestructura a medida que crecía.
Su infraestructura ha crecido enormemente desde que empezaron con Bleemeo. Algunos de sus entornos más grandes están migrando poco a poco a plataformas de monitoreo autoalojadas de mayor tamaño, simplemente por la escala alcanzada — y siguen siendo, en sus propias palabras, grandes admiradores de Bleemeo por su simplicidad, su utilidad y la rapidez con que da la información que de verdad importa.
Cientos de servidores entendidos desde una sola plataforma
Las caídas detectadas rápidamente
La utilización del hardware mejorada con datos de uso real
Beneficios clave
Simplicidad a escala
Un servidor nuevo reporta CPU, memoria, almacenamiento y red a los pocos minutos de instalar el agente.
La densidad, resuelta
Métricas por disco cada 10 segundos en máquinas con más de cien discos.
Los sistemas que realmente usan
Métricas de GPU NVIDIA y TrueNAS Core y Scale, junto al parque Linux habitual.
Europeo de principio a fin
Una empresa francesa y métricas almacenadas en la UE, en la región de París — coherente con lo que construye DCENT.
Preguntas frecuentes
¿Puede Bleemeo supervisar un servidor con más de 100 discos?
Sí, y DCENT es la razón de que pueda. Sus hosts de almacenamiento llevan más de cien discos cada uno, lo que exigió tres cambios de nuestro lado: métricas seleccionables, para que un gráfico con tantas series siga siendo legible en vez de convertirse en una banda de color; optimizaciones del agente para seguir produciendo un punto cada 10 segundos en un host tan denso; y una ruta de recolección S.M.A.R.T. rehecha, porque los programas externos que leen la salud de los discos eran demasiado lentos para ejecutarse cien veces por ciclo. Los hosts de almacenamiento denso son un caso soportado, no una excepción.
¿En cuánto tiempo queda supervisado un servidor nuevo?
Minutos. El agente se instala con un comando y descubre lo que corre en el host, así que una máquina nueva reporta CPU, memoria, almacenamiento, red y estado general sin que nadie configure paneles antes. A la escala de DCENT eso importa más que cualquier funcionalidad concreta: añadir un host es una línea en el script de aprovisionamiento en lugar de un proyecto de monitoreo.
¿Funciona el agente de Bleemeo en TrueNAS?
Sí, tanto en TrueNAS Core como en TrueNAS Scale. El soporte se añadió porque DCENT tiene cabinas de almacenamiento sobre ellos, y ambos figuran en el catálogo de integraciones junto a los demás sistemas operativos soportados.
¿Recoge Bleemeo métricas de GPU NVIDIA?
Sí: utilización, memoria usada y total, temperatura, velocidad del ventilador, consumo y uso de codificadores/decodificadores, leídos mediante la interfaz nvidia-smi. DCENT fue el primer cliente en pedirlo, de ahí viene la función; hoy forma parte del monitoreo de servidores para cualquier host con GPU.
¿Cómo recoge Bleemeo las métricas de aplicación?
De dos formas, ambas en uso en DCENT. Si la aplicación expone un endpoint Prometheus, el agente lo scrapea. Si no, un script puede producir las métricas y el agente las recoge. En ambos casos llegan junto a las métricas de sistema, a los mismos paneles y bajo las mismas reglas de alertas.
¿A dónde llegan las alertas de Bleemeo?
DCENT usa canales de Telegram y la app móvil de Bleemeo, que envía notificaciones push a quien esté de guardia. También están disponibles correo, Slack, webhooks, PagerDuty, Opsgenie e ilert — 15+ canales de notificación en total.
¿Es Bleemeo adecuado para hosters y proveedores de bare metal?
Está pensado para ese caso. Bleemeo se factura por host supervisado y no por funcionalidad, así que un parque de varios cientos de máquinas cuesta lo que es el parque. Y el monitoreo corre fuera de la infraestructura que vigila, que es lo que necesitas cuando esa infraestructura es lo que vendes. Bleemeo es una empresa francesa y almacena las métricas en la UE, en la región de París.
Monitoreo que no depende de tu propia infraestructura
Instala el agente en un host —aunque tenga cien discos— y mira lo que encuentra. El monitoreo de servidores arranca en minutos.
Sin tarjeta de créditoPrueba de 15 díasDatos alojados en la UE
