door Marc THOLL
op 28 maart 2025
op 28 maart 2025
Ceph-opslag optimaliseren met geavanceerde netwerkoplossingen
Uitdagingen bij traditionele opslag
De afgelopen jaren heeft ons bedrijf zijn virtualisatiestack beheerd met een traditionele opslagaanpak, waarbij gebruik werd gemaakt van speciale opslagapparaten zoals Dell EMC-opslagmodules, die via iSCSI of Fibre Channel (FC) op onze servers waren aangesloten. Om redundantie te waarborgen, hebben we het aantal apparaten verdubbeld. Onze full-flash-opslagoplossingen werden geleverd door Huawei.
In het kader van ons voortdurende streven om onze klanten cloudbronnen, die volledig binnen de grenzen van Luxemburg wordt geproduceerd, waardoor gegevenssoevereiniteit wordt gewaarborgd en met onze een project ter bevordering van AI-onderzoek, is de behoefte aan een zeer schaalbare en betrouwbare oplossing voor gegevensopslag aanzienlijk toegenomen.
Eerste poging tot een oplossing
Om aan deze nieuwe vraag tegemoet te komen, hebben we er aanvankelijk voor gekozen onze aanpak aan te passen. We zijn overgestapt op een speciaal Storage Area Network (SAN). We zijn actief in twee datacenters en hebben we twee onafhankelijke SAN’s opgezet, waarbij elk SAN één switch per kant gebruikte, verbonden via twee geografisch gescheiden passieve golflengten. De opslagunits en servers waren elk aangesloten op beide SAN’s, waardoor we over vier opslagpaden beschikten. Deze opstelling maakte gebruik van multipath om redundantie te waarborgen over meerdere paden, die op zichzelf niet redundant waren. Elke server had twee netwerkkaarten, waarbij één poort per kaart was aangesloten op elk SAN, wat resulteerde in een totaal van vier paden. Deze configuratie zorgde ervoor dat we nooit meer dan twee paden zouden verliezen in het geval dat één enkel apparaat uitviel.
Ondanks deze maatregelen merkten we, toen alles eenmaal was geïnstalleerd, dat we niet de verwachte prestaties behaalden. Traditionele opslagsystemen brengen vaak uitdagingen met zich mee, zoals schaalbaarheidsproblemen, beheerlasten en afhankelijkheid van één leverancier, wat ons nog meer motiveerde om op zoek te gaan naar alternatieve oplossingen.
Gezien het huidige geopolitieke landschap en het gebrek aan in Europa geproduceerde opslaghardware hebben we gekozen voor een andere aanpak. Door ons niet langer aan bepaalde leveranciers te binden en terug te keren naar een kernaspect van onze identiteit – open-sourceoplossingen – willen we innovatie stimuleren en de flexibiliteit van onze infrastructuur behouden.
Ceph verkennen: een nieuwe benadering van opslag
Onze systeembeheerders, die altijd graag nieuwe technologieën verkennen, kwamen met het idee om Ceph in te zetten voor onze opslagbehoeften. Onze eerdere ervaringen met traditionele opslagsystemen waren niet bepaald bevredigend geweest, en we waren gemotiveerd om iets innovatiefs en mogelijk robuuster te verkennen.
Ceph is een open-source opslagplatform dat is ontworpen om uitstekende prestaties, betrouwbaarheid en schaalbaarheid te bieden. Het brengt object-, blok- en bestandsopslag samen in één cluster, waardoor het een veelzijdige oplossing is voor diverse opslagbehoeften.
Na een analyse, waaruit bleek dat Ceph aan onze eisen op het gebied van redundantie en schaalbaarheid voldoet, zijn we overgegaan tot het kiezen van de juiste hardware. De keuze viel op Supermicro-servers. De servers draaien op 2x AMD EPYC 7313 16-coreprocessoren en 128 GB RAM.
Voor de netwerkconfiguratie hebben we besloten gebruik te maken van de bestaande infrastructuur met de twee onafhankelijke SAN’s. Na enkele aanvankelijke hindernissen bij het vinden van de juiste configuraties en het wachten op de levering van de hardware, waren we klaar om met het testen te beginnen. Al snel stuitten we echter op een aanzienlijk obstakel.
In Ceph zijn er twee afzonderlijke netwerken:
- Clusternetwerk:
- Wordt door de servers gebruikt om gegevens onderling te synchroniseren.
- Openbaar netwerk:
- Verwerkt het verkeer voor clusterbeheer (MONITOR).
- Maakt Ceph-verbindingen mogelijk met gegevensgebruikers, zoals virtualisatiehosts.
De uitdaging waar we voor stonden, was dat het openbare netwerk in Ceph slechts met één enkel IP-netwerk kan worden geconfigureerd. Deze beperking had een aanzienlijke hindernis kunnen vormen voor onze eisen op het gebied van redundantie.
Om dit probleem aan te pakken, hebben we twee mogelijke oplossingen overwogen:
- Nieuwe chassis-schakelaars:
- Switches stapelen met LACP:
Een van de voorstellen betrof de aanschaf van nieuwe chassis-switches. Hoewel dit het probleem wellicht had opgelost, ging het gepaard met hoge kosten en bood het slechts beperkte extra voordelen.
Het tweede idee, dat ook veelvuldig op forums werd voorgesteld, hield in om de switches te stapelen en gebruik te maken van het Link Aggregation Control Protocol (LACP). Deze aanpak was echter in strijd met onze oorspronkelijke ontwerpfilosofie voor de twee SAN’s. We hadden stapelen bewust vermeden vanwege eerdere negatieve ervaringen, zoals het uiteenvallen van stacks tijdens het gebruik, wat leidde tot netwerkstoringen of het ontstaan van lussen die het gehele netwerk verstoorden.
Innovatieve routeringsoplossingen voor Ceph
Tijdens het brainstormen over mogelijke oplossingen kwam onze netwerkafdeling met een innovatief idee. Hoewel het openbare netwerk van Ceph slechts één IP-prefix kan verwerken, is het niet vereist dat alle IP-adressen binnen hetzelfde broadcastdomein vallen. Dit inzicht bracht ons ertoe om het routeren van verkeer als een haalbare oplossing te overwegen.
Eerste instellingen voor de routering
Onze oorspronkelijke routeringsoplossing hield in dat twee Ceph-knooppunten werden aangesloten op elke SAN Layer 3-switch. Op de switches draaide OSPF (Open Shortest Path First) en werden de netwerken van elk knooppunt bekendgemaakt. Elk knooppunt werd via al zijn vier interfaces aangesloten in één LACP-poortkanaal (Link Aggregation Control Protocol). Deze aanpak had verschillende voor- en nadelen:
Voordelen:
- Eenvoudige installatie: OSPF draait op slechts vier switches, wat het configuratieproces vereenvoudigt.
- Interface-redundantie: LACP zorgt voor redundantie op interfaceniveau, waardoor de betrouwbaarheid wordt vergroot.
Nadelen:
- Gevolgen van een switchstoring: het uitvallen van een switch leidt tot het verlies van twee volledige Ceph-knooppunten, waardoor de redundantie in het gedrang komt.
- Beperkte lastverdeling: De lastverdeling blijft beperkt tot de LACP-trunk, waardoor de beschikbare bandbreedte mogelijk niet volledig wordt benut.
Geoptimaliseerde routebepalingsoplossing
Omdat we niet tevreden waren met de beperkingen van de oorspronkelijke aanpak, hebben we een robuustere oplossing ontwikkeld: volledige routing. In deze configuratie draait op elk Ceph-knooppunt FRRouting (FRR) en OSPF onafhankelijk van elkaar. Deze opzet biedt een aantal belangrijke voordelen:
- Verbeterde redundantie: elk knooppunt is aangesloten op twee switches, waardoor het uitvallen van één switch niet leidt tot het verlies van het knooppunt. Om de betrouwbaarheid nog verder te versterken, wordt gebruikgemaakt van Bidirectional Forwarding Detection (BFD) voor storingsdetectie binnen een fractie van een seconde in het geval van één of meerdere linkstoringen. Daarnaast wordt gebruikgemaakt van Equal-Cost Multi-Path (ECMP)-routing om meerdere redundante routes te bieden, waardoor de algehele veerkracht van het netwerk wordt vergroot.
- Efficiënt gebruik van interfaces: Zowel het openbare netwerk als het clusternetwerk maken deel uit van hetzelfde gerouteerde netwerk, waardoor Ceph op basis van de actuele vraag de volledige bandbreedte van de server dynamisch voor beide netwerken kan benutten.
- Stabiliteit van de dienstverlening: Cluster- en openbare diensten draaien op loopback-IP-adressen, waardoor ze niet gebonden zijn aan specifieke interfaces die uitvallen kunnen.
- Verbeterde lastverdeling: De lastverdeling is verbeterd door het gebruik van Equal-Cost Multi-Path (ECMP)-routing, waardoor elke bestemming over acht afzonderlijke paden beschikt. Deze configuratie zorgt voor een effectieve verdeling van het verkeer over meerdere routes, waardoor het bandbreedtegebruik wordt geoptimaliseerd en een evenwichtige lastverdeling wordt gewaarborgd.
Resultaten en inzichten
Na de implementatie van de volledige routeringsoplossing voor ons Ceph-cluster hebben we een reeks tests uitgevoerd om de prestaties en redundantie ervan te evalueren. Het is belangrijk op te merken dat de Ceph-instantie nog niet volledig is geoptimaliseerd, maar de eerste resultaten zijn veelbelovend. We hebben willekeurige lees- en schrijfsnelheden van 3,6 GB/s behaald, wat een aanzienlijke verbetering ten opzichte van onze vorige opstelling laat zien. Deze tests zijn uitgevoerd met behulp van benchmarktools die aan de industrienormen voldoen, om de nauwkeurigheid en betrouwbaarheid te waarborgen.
Naast prestatietests hebben we ook de redundantie van het systeem beoordeeld. Uit onze tests bleek dat een knooppunt alle verbindingen behalve één kan verliezen zonder dat dit invloed heeft op de functionaliteit, afgezien van een vermindering van de beschikbare bandbreedte. Evenzo kunnen alle verbindingen tussen datacenters (Inter-DC) behalve één uitvallen zonder dat dit gevolgen heeft voor het systeem, hoewel dit ook leidt tot een verminderde beschikbare bandbreedte. Deze bevindingen bevestigen de robuustheid en betrouwbaarheid van onze gerouteerde Ceph-oplossing.
Toekomstplannen
Met het oog op de toekomst overwegen we verschillende verbeteringen om onze Ceph-infrastructuur verder te optimaliseren. Een van onze belangrijkste doelstellingen is het toevoegen van meer verbindingen tussen de datacenters (DC’s) en de SAN’s. Deze uitbreiding zal zorgen voor een nog betere lastverdeling tussen de datacenters, waardoor optimale prestaties en veerkracht worden gewaarborgd.
Door onze netwerkconfiguratie voortdurend te evalueren en te verfijnen, streven we naar een optimaal geoptimaliseerd Ceph-cluster dat voldoet aan onze eisen op het gebied van prestaties en redundantie, zodat onze kernactiviteiten uiteindelijk effectiever worden ondersteund.
Nieuwste artikelen
Galerijweergave
Duitsland: DIN VDE 0834-1:2026-08 – Nieuwe eisen voor verpleegoproepsystemen in de gezondheidszorg
11 september 2026
Gezondheidszorg
Duitsland
Mixvoip staat op nummer 1 in de Google-recensies in Luxemburg in 2026
25 augustus 2026
Cloud PBX
Telecom
Mixvoip lanceert samen met EuroDNS en Open-Xchange een soevereine oplossing voor e-mail, samenwerking en online kantoor
16 juni 2026
E-mail
Saint Nabor Services organiseert het IT-beheer met Microsoft 365 Managed
28 mei 2026
Cloudoplossingen
IT-diensten
Een jaar vol sterke partnerschappen: hoogtepunten van 2025
13 april 2026
Connectiviteit
Voxbi
Getuigenis van de Koninklijke Automobielclub van België (RACB)
14 maart 2026
Telefonie
VoIP
Mixvoip verlengt samenwerking met MeluXina om AI-initiatief verder te ontwikkelen
22 februari 2026
Over Mixvoip
AI
Mixvoip versterkt zijn aanwezigheid in België door de overname van de klantenportefeuille van Nomado
19 februari 2026
België
Over Mixvoip
Mixvoip sluit zich aan bij de Odoo Community Association als goudsponsor
19 februari 2026
Over Mixvoip
Getuigenis van LGL Transport
5 februari 2026
Telefonie
VoIP
Meer laden