
Come DCENT monitora centinaia di server e petabyte di infrastruttura in Europa con Bleemeo
“Usiamo Bleemeo da diversi anni, monitorando da 100 a 400 server a seconda dei periodi. Quello che mi è sempre piaciuto di più è la semplicità: lo installi e in pochissimo tempo hai una visione chiara di ciò che sta davvero facendo il tuo hardware, con alert quando qualcosa non va. La nostra infrastruttura è cresciuta enormemente da quando abbiamo iniziato con Bleemeo — da singoli server a decine di petabyte di storage, grandi cluster GPU e il nostro backbone BGP europeo che trasporta centinaia di gigabit di traffico. Bleemeo è stato uno strumento molto utile lungo tutta questa crescita.”
Cosa monitora DCENT con Bleemeo
Monitoraggio dei server
Ogni server fisico: CPU, memoria, rete, GPU NVIDIA e ogni singolo disco dello chassis.
Scopri di piùMonitoraggio della disponibilità
Uno sguardo indipendente, dall'esterno dell'infrastruttura, su ciò che resta raggiungibile.
Scopri di piùAlerting e notifiche
Canali Telegram e app mobile, perché un alert raggiunga chi non è davanti a uno schermo.
Scopri di piùChi è DCENT
DCENT è un provider europeo di infrastruttura specializzato in storage su larga scala, calcolo GPU e infrastruttura di rete.
Dal proprio datacenter nei Paesi Bassi e da deployment nelle principali sedi europee, DCENT gestisce centinaia di server fisici e decine di petabyte di storage, accanto a cluster GPU ad alta densità e ambienti bare metal dedicati.
Dietro tutto questo c'è la propria rete europea, in rapida crescita. Con il numero AS216456, DCENT gestisce il proprio backbone BGP tra le principali sedi europee, con più rotte ridondanti ad alta capacità.
Invece di acquistare semplicemente connettività Internet sede per sede, DCENT ha reso la rete una componente centrale della propria infrastruttura. Gestisce più collegamenti da 100G, controlla direttamente il routing ed effettua peering con centinaia di reti su un numero crescente di Internet Exchange. La rete trasporta regolarmente centinaia di gigabit al secondo nei picchi.
La sua presenza di peering comprende AMS-IX, Speed-IX, ERA-IX, Piter-IX, 1-IX, GNM-IX e GigaNET-IXN, con il backbone che continua a estendersi insieme all'infrastruttura di calcolo e storage.
Questa combinazione di storage, calcolo e rete BGP propria significa che DCENT controlla gran parte dello stack infrastrutturale — dai dischi, dai server e dalle GPU fino a come il traffico viene instradato attraverso l'Europa e raggiunge Internet.
Visita dcent.ioLa sfida
Man mano che DCENT è passata da un ambiente di hosting relativamente piccolo a provider europeo di infrastruttura distribuita, il monitoraggio è diventato sempre più importante.
Oggi la sua infrastruttura è fatta di centinaia di server fisici, decine di petabyte di storage, sistemi GPU ad alta densità e una rete BGP propria distribuita su più sedi europee.
Con migliaia di singoli componenti hardware e centinaia di gigabit di traffico di rete da mantenere in salute, controllare i sistemi a mano semplicemente non è più un'opzione.
Un problema può essere qualsiasi cosa: un uso anomalo di CPU o memoria, un disco guasto, una GPU sovraccarica, un incidente di rete o un intero servizio che diventa irraggiungibile. DCENT ha quindi bisogno di una vista centralizzata della propria infrastruttura e, soprattutto, di alert affidabili quando qualcosa inizia a comportarsi diversamente dal normale.
La soluzione
DCENT usa Bleemeo da diversi anni, con tra 100 e 400 server monitorati dalla piattaforma a seconda dei periodi.
Una delle ragioni principali per cui hanno continuato a usarlo è la semplicità. I nuovi server si aggiungono rapidamente e forniscono subito informazioni utili su CPU, memoria, storage, rete e stato generale del sistema, senza richiedere un tempo di ingegneria significativo per costruire e mantenere la piattaforma di monitoraggio stessa. Il monitoraggio dei server copre ogni host del parco.
Lo stesso vale per la loro infrastruttura di calcolo GPU, dove capire utilizzo, carico di sistema e comportamento dell'hardware è particolarmente importante quando si gestisce hardware costoso e ad alta densità.
Man mano che la loro rete si è estesa in Europa, anche il monitoraggio della disponibilità è diventato più prezioso: offre un ulteriore sguardo indipendente su ciò che resta raggiungibile.
Cosa DCENT ha cambiato in Bleemeo
Fin qui il racconto di DCENT. Questa parte è la nostra, perché una parte di ciò che usano non esisteva prima che lo chiedessero: il loro hardware è abbastanza insolito da rendere necessario cambiare il prodotto per supportarlo davvero.
Server con più di cento dischi
Sono serviti tre interventi distinti. Uno chassis con oltre 100 dischi disegnava un grafico ridotto a una banda arcobaleno continua — tecnicamente corretto e del tutto illeggibile — così abbiamo reso selezionabili le metriche mostrate. Glouton ha richiesto diverse ottimizzazioni per continuare a produrre un punto ogni 10 secondi su un host di quella densità. E la salute dei dischi S.M.A.R.T. è letta da programmi esterni il cui tempo di esecuzione non sopravviveva a essere moltiplicato per cento: quella logica di raccolta è stata rifatta.
Le metriche GPU NVIDIA
DCENT è stato il primo cliente Bleemeo ad averne bisogno, ed è da lì che parte il supporto GPU: utilizzo, memoria, temperatura e consumo, letti tramite nvidia-smi. Oggi fa parte del monitoraggio dei server per qualsiasi host con GPU.
TrueNAS Core e TrueNAS Scale
Entrambi sono nell'elenco dei sistemi supportati perché DCENT ci fa girare le proprie storage appliance: le appliance facevano parte del parco, quindi dovevano far parte del monitoraggio. Si trovano nel catalogo delle integrazioni con gli altri sistemi operativi supportati.
“DCENT ci ha messo in mano un server con più dischi di quanti server abbiano la maggior parte dei nostri clienti — e già che c'erano ci hanno chiesto metriche GPU e TrueNAS. Il nostro ciclo di raccolta, le nostre sonde S.M.A.R.T. e i nostri grafici davano tutti silenziosamente per scontata una macchina con una manciata di dischi, e tutti e tre hanno dovuto cambiare. Non l'abbiamo trattato come un caso limite, perché non lo è: quella densità è la direzione dello storage. Le dashboard di tutti ne hanno guadagnato, ed è servito un cliente con hardware insolito per mostrarcelo.”Lionel Porcheron — CEO e cofondatore, Bleemeo
I risultati
Per DCENT il valore più grande di Bleemeo è sempre stato la semplicità: rende una quantità enorme di infrastruttura sorprendentemente facile da capire.
Negli anni Bleemeo li ha aiutati a monitorare centinaia di server, a rilevare rapidamente i disservizi e a capire meglio come viene davvero utilizzato il loro hardware. Questa visibilità ha permesso di migliorare l'utilizzo dell'hardware, diagnosticare più in fretta e vedere molto più chiaramente la propria infrastruttura man mano che cresceva.
La loro infrastruttura è cresciuta enormemente da quando hanno iniziato con Bleemeo. Alcuni dei loro ambienti più grandi stanno passando gradualmente a piattaforme di monitoraggio self-hosted di dimensioni maggiori, semplicemente per la scala raggiunta — e restano, parole loro, grandi sostenitori di Bleemeo per la semplicità, l'utilità e la rapidità con cui fornisce l'informazione che conta davvero.
Centinaia di server compresi da un'unica piattaforma
I disservizi rilevati rapidamente
L'utilizzo dell'hardware migliorato con dati d'uso reali
Vantaggi principali
Semplicità su larga scala
Un server nuovo riporta CPU, memoria, storage e rete pochi minuti dopo l'installazione dell'agente.
Densità gestita
Metriche per disco ogni 10 secondi su macchine con più di cento dischi.
I sistemi che usano davvero
Metriche GPU NVIDIA e TrueNAS Core e Scale, accanto al normale parco Linux.
Europeo da un capo all'altro
Un'azienda francese e metriche archiviate nell'UE, nella regione di Parigi — coerente con ciò che DCENT costruisce.
Domande frequenti
Bleemeo può monitorare un server con più di 100 dischi?
Sì, e DCENT è il motivo per cui può farlo. I loro host di storage portano più di cento dischi ciascuno, il che ha richiesto tre modifiche dalla nostra parte: metriche selezionabili, perché un grafico con così tante serie resti leggibile invece di ridursi a una banda colorata; ottimizzazioni dell'agente per continuare a produrre un punto ogni 10 secondi su un host così denso; e un percorso di raccolta S.M.A.R.T. rifatto, perché i programmi esterni che leggono la salute dei dischi erano troppo lenti per essere eseguiti cento volte per ciclo. Gli host di storage ad alta densità sono un caso supportato, non un'eccezione.
In quanto tempo un nuovo server viene monitorato?
Pochi minuti. L'agente si installa con un comando e scopre cosa gira sull'host, quindi una macchina nuova riporta CPU, memoria, storage, rete e stato generale senza che nessuno configuri prima delle dashboard. Alla scala di DCENT questo conta più di qualsiasi singola funzionalità: aggiungere un host è una riga nello script di provisioning invece che un progetto di monitoraggio.
L'agente Bleemeo funziona su TrueNAS?
Sì, sia su TrueNAS Core sia su TrueNAS Scale. Il supporto è stato aggiunto perché DCENT ci fa girare le proprie storage appliance, ed entrambi sono elencati nel catalogo delle integrazioni accanto agli altri sistemi operativi supportati.
Bleemeo raccoglie le metriche GPU NVIDIA?
Sì: utilizzo, memoria usata e totale, temperatura, velocità delle ventole, consumo e utilizzo di encoder/decoder, letti tramite l'interfaccia nvidia-smi. DCENT è stato il primo cliente a chiederlo, ed è da lì che nasce la funzionalità; oggi fa parte del monitoraggio dei server per qualsiasi host con GPU.
Come raccoglie Bleemeo le metriche applicative?
In due modi, entrambi in uso in DCENT. Se l'applicazione espone un endpoint Prometheus, l'agente lo interroga. Se non lo fa, uno script può produrre le metriche e l'agente le raccoglie. In entrambi i casi arrivano accanto alle metriche di sistema, sulle stesse dashboard e sotto le stesse regole di alerting.
Dove arrivano gli alert di Bleemeo?
DCENT usa canali Telegram e l'app mobile Bleemeo, che invia notifiche push a chi è di turno. Sono disponibili anche e-mail, Slack, webhook, PagerDuty, Opsgenie e ilert — 15+ canali di notifica in totale.
Bleemeo è adatto a hoster e provider bare metal?
È pensato per questo caso. Bleemeo si paga per host monitorato e non per funzionalità, quindi un parco di diverse centinaia di macchine costa quanto vale il parco. E il monitoraggio gira fuori dall'infrastruttura che sorveglia, che è ciò che serve quando quell'infrastruttura è ciò che vendete. Bleemeo è un'azienda francese e archivia le metriche nell'UE, nella regione di Parigi.
Un monitoraggio che non dipende dalla vostra infrastruttura
Installate l'agente su un host — anche uno con cento dischi — e guardate cosa trova. Il monitoraggio dei server parte in pochi minuti.
Senza carta di creditoProva di 15 giorniDati ospitati nell'UE
