Wie DCENT Hunderte Server und Petabyte an Infrastruktur in Europa mit Bleemeo überwacht

„Wir nutzen Bleemeo seit mehreren Jahren und überwachen damit je nach Zeitpunkt zwischen 100 und 400 Server. Was mir immer am besten gefallen hat, ist die Einfachheit: installieren — und sehr schnell hat man einen klaren Blick darauf, was die Hardware tatsächlich tut, samt Alarmen, wenn etwas schiefgeht. Unsere Infrastruktur ist seit unserem Start mit Bleemeo enorm gewachsen: von einzelnen Servern zu Dutzenden Petabyte Speicher, großen GPU-Clustern und unserem eigenen europäischen BGP-Backbone, das Hunderte Gigabit Traffic transportiert. Bleemeo war über dieses gesamte Wachstum hinweg ein sehr nützliches Werkzeug.“
Hidde Hoogland, Gründer & Hardware-Ingenieur bei DCENT
Hidde HooglandGründer & Hardware-Ingenieur, DCENT

Über DCENT

DCENT ist ein europäischer Infrastrukturanbieter, spezialisiert auf Speicher im großen Maßstab, GPU-Rechenleistung und Netzwerkinfrastruktur.

Aus dem eigenen Rechenzentrum in den Niederlanden und von Standorten an den wichtigsten europäischen Rechenzentrumsplätzen betreibt DCENT Hunderte physische Server und Dutzende Petabyte Speicher, dazu GPU-Cluster hoher Dichte und dedizierte Bare-Metal-Umgebungen.

Dahinter steht das eigene, schnell wachsende europäische Netz. Unter AS216456 betreibt DCENT ein eigenes BGP-Backbone zwischen den wichtigsten europäischen Standorten, mit mehreren redundanten Hochkapazitätsrouten.

Statt Internet-Konnektivität einfach an jedem Standort einzeln einzukaufen, hat DCENT das Netzwerk zu einem Kernbestandteil seiner Infrastruktur gemacht. Das Unternehmen betreibt mehrere 100G-Verbindungen, steuert sein Routing selbst und peert mit Hunderten Netzen an einer wachsenden Zahl von Internet-Knoten. Das Netz transportiert in Spitzen regelmäßig Hunderte Gigabit pro Sekunde.

Zum Peering-Footprint gehören AMS-IX, Speed-IX, ERA-IX, Piter-IX, 1-IX, GNM-IX und GigaNET-IXN, und das Backbone wächst mit der Rechen- und Speicherinfrastruktur weiter.

Diese Kombination aus Speicher, Rechenleistung und eigenem BGP-Netz bedeutet, dass DCENT einen großen Teil des Infrastruktur-Stacks selbst kontrolliert — von Laufwerken, Servern und GPUs bis dahin, wie der Traffic durch Europa geroutet wird und das Internet erreicht.

dcent.io besuchen

Die Herausforderung

Als DCENT von einer vergleichsweise kleinen Hosting-Umgebung zu einem verteilten europäischen Infrastrukturanbieter wuchs, wurde Monitoring immer wichtiger.

Heute besteht die Infrastruktur aus Hunderten physischen Servern, Dutzenden Petabyte Speicher, GPU-Systemen hoher Dichte und einem eigenen BGP-Netz über mehrere europäische Standorte hinweg.

Bei Tausenden einzelnen Hardwarekomponenten und Hunderten Gigabit Netzwerkverkehr, die gesund bleiben müssen, ist manuelles Prüfen der Systeme schlicht keine Option mehr.

Ein Problem kann alles sein: auffällige CPU- oder Speichernutzung, ein ausgefallenes Laufwerk, eine überlastete GPU, eine Netzstörung oder ein ganzer Dienst, der nicht mehr erreichbar ist. DCENT braucht deshalb einen zentralen Blick auf die eigene Infrastruktur und, wichtiger noch, verlässliche Alarme, sobald sich etwas anders verhält als gewohnt.

Die Lösung

DCENT nutzt Bleemeo seit mehreren Jahren, mit je nach Zeitpunkt zwischen 100 und 400 über die Plattform überwachten Servern.

Einer der Hauptgründe, warum sie dabei geblieben sind, ist die Einfachheit. Neue Server lassen sich schnell hinzufügen und liefern sofort brauchbare Einblicke in CPU, Arbeitsspeicher, Speicher, Netzwerk und den allgemeinen Systemzustand — ohne nennenswerte Entwicklungszeit für Aufbau und Pflege der Monitoring-Plattform selbst. Das Server-Monitoring deckt jeden Host des Bestands ab.

Dasselbe gilt für ihre GPU-Infrastruktur, wo das Verständnis von Auslastung, Systemlast und Hardwareverhalten besonders wichtig ist, wenn man teure Hardware hoher Dichte betreibt.

Mit der Ausdehnung des eigenen Netzes über Europa hat auch das Verfügbarkeits-Monitoring an Wert gewonnen: Es liefert einen weiteren, unabhängigen Blick darauf, ob Systeme und Dienste erreichbar bleiben.

Was DCENT an Bleemeo verändert hat

So weit die Darstellung von DCENT. Dieser Teil ist unserer, denn einiges von dem, was sie nutzen, existierte nicht, bevor sie danach gefragt haben: Ihre Hardware ist ungewöhnlich genug, dass sie ordentlich zu unterstützen hieß, das Produkt zu ändern.

Server mit mehr als hundert Laufwerken

Dafür brauchte es drei getrennte Korrekturen. Ein Gehäuse mit über 100 Platten erzeugte ein Diagramm, das zu einem durchgehenden Regenbogenband wurde — technisch korrekt und vollkommen unlesbar —, also haben wir die angezeigten Metriken auswählbar gemacht. Glouton benötigte mehrere Optimierungen, um auf einem so dichten Host weiterhin alle 10 Sekunden einen Punkt zu liefern. Und die S.M.A.R.T.-Laufwerksgesundheit wird von externen Programmen gelesen, deren Laufzeit es nicht überstand, mit hundert multipliziert zu werden — diese Erfassungslogik wurde überarbeitet.

NVIDIA-GPU-Metriken

DCENT war der erste Bleemeo-Kunde, der sie brauchte — dort beginnt die GPU-Unterstützung: Auslastung, Speicher, Temperatur und Leistungsaufnahme, ausgelesen über nvidia-smi. Heute gehört sie für jeden GPU-Host zum Server-Monitoring.

TrueNAS Core und TrueNAS Scale

Beide stehen auf der Liste der unterstützten Systeme, weil DCENT darauf Storage-Appliances betreibt: Die Appliances gehörten zum Bestand, also mussten sie zum Monitoring gehören. Sie stehen im Integrationskatalog neben den übrigen unterstützten Betriebssystemen.

„DCENT hat uns einen Server in die Hand gedrückt, in dem mehr Laufwerke stecken, als die meisten unserer Kunden Server haben — und hat bei der Gelegenheit gleich GPU-Metriken und TrueNAS mitbestellt. Unsere Erfassungsschleife, unsere S.M.A.R.T.-Abfragen und unsere Diagramme gingen alle stillschweigend von einer Maschine mit einer Handvoll Platten aus, und alle drei mussten sich ändern. Wir haben nichts davon als Sonderfall behandelt, denn das ist es nicht: Diese Dichte ist die Richtung, in die Speicher geht. Die Dashboards aller Kunden sind dadurch besser geworden, und es brauchte einen Kunden mit ungewöhnlicher Hardware, um es uns zu zeigen.“Lionel Porcheron — CEO & Mitgründer, Bleemeo

Die Ergebnisse

Für DCENT lag der größte Wert von Bleemeo immer in der Einfachheit: Die Plattform macht eine enorme Menge Infrastruktur überraschend leicht verständlich.

Über die Jahre hat Bleemeo geholfen, Hunderte Server zu überwachen, Ausfälle schnell zu erkennen und besser zu verstehen, wie die Hardware tatsächlich genutzt wird. Diese Sichtbarkeit hat die Hardwareauslastung verbessert, die Fehlersuche beschleunigt und mit dem Wachstum einen deutlich besseren Überblick über die eigene Infrastruktur verschafft.

Ihre Infrastruktur ist seit dem Start mit Bleemeo enorm gewachsen. Einige ihrer größten Umgebungen wechseln allein wegen der erreichten Größenordnung nach und nach zu umfangreicheren, selbst betriebenen Monitoring-Plattformen — und sie bleiben, in ihren eigenen Worten, große Anhänger von Bleemeo, wegen der Einfachheit, der Nützlichkeit und der Geschwindigkeit, mit der es genau die Information liefert, auf die es ankommt.

Hunderte Server über eine einzige Plattform verstanden

Ausfälle schnell erkannt

Hardwareauslastung mit echten Nutzungsdaten verbessert

Zentrale Vorteile

Einfachheit im großen Maßstab

Ein neuer Server meldet CPU, Arbeitsspeicher, Speicher und Netzwerk wenige Minuten nach der Installation des Agenten.

Dichte im Griff

Metriken pro Laufwerk alle 10 Sekunden auf Maschinen mit über hundert Platten.

Die Systeme, die sie wirklich betreiben

NVIDIA-GPU-Metriken sowie TrueNAS Core und Scale, neben dem gewöhnlichen Linux-Bestand.

Europäisch von Anfang bis Ende

Ein französisches Unternehmen, Metriken in der EU in der Region Paris — passend zu dem, was DCENT baut.

Häufige Fragen

Kann Bleemeo einen Server mit mehr als 100 Laufwerken überwachen?

Ja — und DCENT ist der Grund dafür. Ihre Storage-Hosts tragen jeweils über hundert Laufwerke, was drei Änderungen auf unserer Seite erforderte: auswählbare Metriken, damit ein Diagramm mit so vielen Reihen lesbar bleibt, statt zu einem Farbband zu verschmelzen; Optimierungen am Agenten, um auf einem so dichten Host weiterhin alle 10 Sekunden einen Punkt zu liefern; und einen überarbeiteten S.M.A.R.T.-Erfassungspfad, weil die externen Programme zum Auslesen der Laufwerksgesundheit zu langsam waren, um hundertmal pro Zyklus zu laufen. Dichte Storage-Hosts sind ein unterstützter Fall, keine Ausnahme.

Wie schnell wird ein neuer Server überwacht?

In Minuten. Der Agent installiert sich mit einem Befehl und erkennt, was auf dem Host läuft — eine neue Maschine meldet CPU, Arbeitsspeicher, Speicher, Netzwerk und Gesamtzustand, ohne dass vorher jemand Dashboards konfiguriert. In der Größenordnung von DCENT zählt das mehr als jede einzelne Funktion: Einen Host hinzuzufügen ist eine Zeile im Provisioning-Skript statt ein Monitoring-Projekt.

Läuft der Bleemeo-Agent auf TrueNAS?

Ja, sowohl auf TrueNAS Core als auch auf TrueNAS Scale. Die Unterstützung entstand, weil DCENT darauf Storage-Appliances betreibt; beide sind im Integrationskatalog neben den übrigen unterstützten Betriebssystemen aufgeführt.

Erfasst Bleemeo NVIDIA-GPU-Metriken?

Ja — Auslastung, belegter und gesamter Speicher, Temperatur, Lüfterdrehzahl, Leistungsaufnahme sowie Encoder-/Decoder-Auslastung, ausgelesen über die nvidia-smi-Schnittstelle. DCENT hat als erster Kunde danach gefragt, daher stammt die Funktion; heute gehört sie für jeden GPU-Host zum Server-Monitoring.

Wie erfasst Bleemeo Anwendungsmetriken?

Auf zwei Wegen, beide bei DCENT im Einsatz. Stellt die Anwendung einen Prometheus-Endpunkt bereit, liest der Agent ihn aus. Tut sie das nicht, kann ein Skript die Metriken erzeugen, die der Agent dann aufnimmt. In beiden Fällen landen sie neben den Systemmetriken, auf denselben Dashboards und unter denselben Alerting-Regeln.

Wohin gehen Bleemeo-Alarme?

DCENT nutzt Telegram-Kanäle und die mobile Bleemeo-App, die Push-Benachrichtigungen an die diensthabende Person zustellt. E-Mail, Slack, Webhooks, PagerDuty, Opsgenie und ilert stehen ebenfalls bereit — insgesamt 15+ Benachrichtigungskanäle.

Eignet sich Bleemeo für Hoster und Bare-Metal-Anbieter?

Es ist für diesen Fall gebaut. Bleemeo wird pro überwachtem Host abgerechnet, nicht pro Funktion — ein Bestand von mehreren Hundert Maschinen kostet also das, was der Bestand ist. Und das Monitoring läuft außerhalb der Infrastruktur, die es überwacht, genau das braucht man, wenn diese Infrastruktur das eigene Produkt ist. Bleemeo ist ein französisches Unternehmen und speichert Metriken in der EU, in der Region Paris.

Monitoring, das nicht von Ihrer eigenen Infrastruktur abhängt

Installieren Sie den Agenten auf einem Host — auch auf einem mit hundert Laufwerken — und sehen Sie, was er findet. Das Server-Monitoring startet in wenigen Minuten.

Keine Kreditkarte nötig15 Tage TestphaseDaten in der EU