Comment DCENT supervise des centaines de serveurs et des pétaoctets d'infrastructure en Europe avec Bleemeo

« Nous utilisons Bleemeo depuis plusieurs années, avec entre 100 et 400 serveurs supervisés selon les moments. Ce que j'ai toujours préféré, c'est sa simplicité : on l'installe, et très vite on a une vision claire de ce que fait réellement le matériel, avec des alertes quand quelque chose ne va pas. Notre infrastructure a énormément grandi depuis nos débuts avec Bleemeo — de serveurs isolés à des dizaines de pétaoctets de stockage, de grands clusters GPU et notre propre backbone BGP européen qui transporte des centaines de gigabits de trafic. Bleemeo a été un outil très utile tout au long de cette croissance. »
Hidde Hoogland, Fondateur & Ingénieur matériel chez DCENT
Hidde HooglandFondateur & Ingénieur matériel, DCENT

À propos de DCENT

DCENT est un fournisseur d'infrastructure européen spécialisé dans le stockage à grande échelle, le calcul GPU et l'infrastructure réseau.

Depuis son propre datacentre aux Pays-Bas et des déploiements dans les principaux sites européens, DCENT exploite des centaines de serveurs physiques et des dizaines de pétaoctets de stockage, aux côtés de clusters GPU à forte densité et d'environnements bare metal dédiés.

Derrière tout cela se trouve son propre réseau européen, en croissance rapide. Sous le numéro AS216456, DCENT opère son backbone BGP entre les principaux sites européens, avec plusieurs routes redondantes à haute capacité.

Plutôt que d'acheter simplement de la connectivité Internet site par site, DCENT a fait du réseau une brique centrale de son infrastructure. L'entreprise exploite plusieurs liens 100G, contrôle directement son routage et peere avec des centaines de réseaux sur un nombre croissant de points d'échange. Le réseau transporte régulièrement des centaines de gigabits par seconde en pointe.

Son empreinte de peering comprend AMS-IX, Speed-IX, ERA-IX, Piter-IX, 1-IX, GNM-IX et GigaNET-IXN, le backbone continuant de s'étendre au rythme de l'infrastructure de calcul et de stockage.

Cette combinaison de stockage, de calcul et de réseau BGP en propre signifie que DCENT maîtrise une grande partie de la pile d'infrastructure — des disques, serveurs et GPU jusqu'à la façon dont le trafic est routé à travers l'Europe et rejoint Internet.

Visiter dcent.io

Le défi

À mesure que DCENT est passé d'un environnement d'hébergement relativement modeste à un fournisseur d'infrastructure européen distribué, la supervision est devenue de plus en plus importante.

Aujourd'hui, son infrastructure compte des centaines de serveurs physiques, des dizaines de pétaoctets de stockage, des systèmes GPU à forte densité et son propre réseau BGP réparti sur plusieurs sites européens.

Avec des milliers de composants matériels individuels et des centaines de gigabits de trafic réseau à maintenir en bonne santé, vérifier les systèmes à la main n'est tout simplement plus envisageable.

Un problème, cela peut être aussi bien une consommation anormale de CPU ou de mémoire qu'un disque en panne, un GPU surchargé, un incident réseau ou un service entier devenu injoignable. DCENT a donc besoin d'une vue centralisée de son infrastructure et, surtout, d'alertes fiables quand quelque chose commence à se comporter différemment de la normale.

La solution

DCENT utilise Bleemeo depuis plusieurs années, avec entre 100 et 400 serveurs supervisés par la plateforme selon les périodes.

L'une des principales raisons de cette continuité est la simplicité. De nouveaux serveurs s'ajoutent rapidement et livrent immédiatement des informations utiles sur le CPU, la mémoire, le stockage, le réseau et l'état général du système, sans mobiliser un temps d'ingénierie significatif pour construire et maintenir la plateforme de supervision elle-même. La supervision de serveurs couvre chaque hôte du parc.

Il en va de même pour l'infrastructure de calcul GPU, où comprendre l'utilisation, la charge système et le comportement du matériel est particulièrement important quand on exploite du matériel coûteux et à forte densité.

À mesure que leur propre réseau s'est étendu en Europe, la supervision de disponibilité a elle aussi pris de la valeur : elle offre un regard indépendant supplémentaire sur ce qui reste joignable.

Ce que DCENT a changé dans Bleemeo

Voilà pour le récit de DCENT. Cette partie-ci est la nôtre, parce qu'une partie de ce qu'ils utilisent n'existait pas avant qu'ils le demandent : leur matériel est assez inhabituel pour que le supporter correctement ait voulu dire faire évoluer le produit.

Des serveurs à plus de cent disques

Il a fallu trois correctifs distincts. Un châssis à plus de 100 disques dessinait un graphe réduit à une bande arc-en-ciel continue — techniquement exact et totalement illisible — nous avons donc rendu les métriques affichées sélectionnables. Glouton a nécessité plusieurs optimisations pour continuer à produire un point toutes les 10 secondes sur un hôte de cette densité. Et la santé disque S.M.A.R.T. est lue par des programmes externes dont le temps d'exécution ne survivait pas à être multiplié par cent : cette logique de collecte a été reprise.

Les métriques GPU NVIDIA

DCENT a été le premier client Bleemeo à en avoir besoin : c'est de là que part le support GPU — utilisation, mémoire, température et consommation, lus via nvidia-smi. Il fait désormais partie de la supervision de serveurs pour n'importe quel hôte GPU.

TrueNAS Core et TrueNAS Scale

Les deux figurent sur la liste des systèmes supportés parce que DCENT y fait tourner des baies de stockage : ces baies faisaient partie du parc, elles devaient donc faire partie de la supervision. On les retrouve au catalogue d'intégrations avec les autres systèmes d'exploitation supportés.

« DCENT nous a mis entre les mains un serveur contenant plus de disques que la plupart de nos clients n'ont de serveurs — puis nous a demandé les métriques GPU et TrueNAS dans la foulée. Notre boucle de collecte, nos sondes S.M.A.R.T. et nos graphes supposaient tous discrètement une machine avec une poignée de disques, et les trois ont dû changer. Nous n'avons traité aucun de ces points comme un cas particulier, parce que ce n'en est pas un : cette densité, c'est la direction que prend le stockage. Les tableaux de bord de tout le monde s'en trouvent améliorés, et il aura fallu un client au matériel inhabituel pour nous le montrer. »Lionel Porcheron — CEO & co-fondateur, Bleemeo

Les résultats

Pour DCENT, la plus grande valeur de Bleemeo a toujours été sa simplicité : la plateforme rend une immense quantité d'infrastructure étonnamment facile à comprendre.

Au fil des années, Bleemeo les a aidés à superviser des centaines de serveurs, à détecter rapidement les interruptions et à mieux comprendre l'usage réel de leur matériel. Cette visibilité leur a permis d'améliorer le taux d'utilisation du matériel, de diagnostiquer plus vite et d'y voir bien plus clair dans leur infrastructure à mesure qu'elle grandissait.

Leur infrastructure a énormément grandi depuis leurs débuts avec Bleemeo. Certains de leurs plus grands environnements migrent progressivement vers des plateformes de supervision auto-hébergées de plus grande taille, simplement à cause de l'échelle atteinte — et ils restent, selon leurs propres mots, de grands amateurs de Bleemeo pour sa simplicité, son utilité et la vitesse à laquelle il donne l'information qui compte vraiment.

Des centaines de serveurs compris depuis une seule plateforme

Les interruptions détectées rapidement

Le taux d'utilisation amélioré grâce aux données d'usage réel

Bénéfices clés

La simplicité à l'échelle

Un nouveau serveur remonte CPU, mémoire, stockage et réseau quelques minutes après l'installation de l'agent.

La densité prise en charge

Des métriques par disque toutes les 10 secondes sur des machines à plus de cent disques.

Les systèmes qu'ils utilisent vraiment

Métriques GPU NVIDIA, TrueNAS Core et Scale, à côté du parc Linux ordinaire.

Européen de bout en bout

Une société française, des métriques stockées dans l'UE en région parisienne — cohérent avec ce que DCENT construit.

Questions fréquentes

Bleemeo peut-il superviser un serveur à plus de 100 disques ?

Oui, et DCENT en est la raison. Leurs hôtes de stockage embarquent plus de cent disques chacun, ce qui a demandé trois changements de notre côté : des métriques sélectionnables, pour qu'un graphe avec autant de séries reste lisible au lieu de se réduire à une bande colorée ; des optimisations de l'agent pour continuer à produire un point toutes les 10 secondes sur un hôte aussi dense ; et une logique de collecte S.M.A.R.T. reprise, parce que les programmes externes qui lisent la santé des disques étaient trop lents pour être exécutés cent fois par cycle. Les hôtes de stockage denses sont un cas supporté, pas une exception.

En combien de temps un nouveau serveur est-il supervisé ?

Quelques minutes. L'agent s'installe en une commande et découvre ce qui tourne sur l'hôte : une nouvelle machine remonte CPU, mémoire, stockage, réseau et état général sans que personne n'ait à configurer de tableau de bord au préalable. À l'échelle de DCENT, cela compte plus que n'importe quelle fonctionnalité prise isolément : ajouter un hôte devient une ligne dans le script de provisioning plutôt qu'un projet de supervision.

L'agent Bleemeo fonctionne-t-il sur TrueNAS ?

Oui, sur TrueNAS Core comme sur TrueNAS Scale. Le support a été ajouté parce que DCENT y fait tourner des baies de stockage, et les deux figurent au catalogue d'intégrations aux côtés des autres systèmes d'exploitation supportés.

Bleemeo collecte-t-il les métriques GPU NVIDIA ?

Oui — utilisation, mémoire utilisée et totale, température, vitesse des ventilateurs, consommation électrique et utilisation des encodeurs/décodeurs, lues via l'interface nvidia-smi. DCENT a été le premier client à le demander, c'est de là que vient la fonctionnalité ; elle fait aujourd'hui partie de la supervision de serveurs pour n'importe quel hôte GPU.

Comment Bleemeo collecte-t-il les métriques applicatives ?

De deux façons, toutes deux utilisées chez DCENT. Si l'application expose un endpoint Prometheus, l'agent le scrape. Sinon, un script peut produire les métriques et l'agent les récupère. Dans les deux cas elles arrivent à côté des métriques système, sur les mêmes tableaux de bord et sous les mêmes règles d'alerting.

Où partent les alertes Bleemeo ?

DCENT utilise des canaux Telegram et l'application mobile Bleemeo, qui envoie des notifications push à la personne d'astreinte. E-mail, Slack, webhooks, PagerDuty, Opsgenie et ilert sont également disponibles — 15+ canaux de notification au total.

Bleemeo convient-il aux hébergeurs et fournisseurs de bare metal ?

C'est taillé pour ce cas. Bleemeo est facturé par hôte supervisé plutôt que par fonctionnalité : un parc de plusieurs centaines de machines coûte ce que vaut le parc. Et la supervision tourne en dehors de l'infrastructure qu'elle surveille, ce qu'il faut quand cette infrastructure est ce que vous vendez. Bleemeo est une société française et stocke les métriques dans l'UE, en région parisienne.

Une supervision qui ne dépend pas de votre propre infrastructure

Installez l'agent sur un hôte — même un hôte à cent disques — et regardez ce qu'il trouve. La supervision de serveurs démarre en quelques minutes.

Sans carte bancaireEssai de 15 joursDonnées hébergées dans l'UE