Das IBM Storage Scale Parallel File System unterstützt das verteilte KV-Cache-Management in Verbindung mit NVIDIA Dynamo und bedient groß angelegte KI-Inferenzszenarien mit massiven Kontext-Workloads.
IBM hat ein offizielles Redbook mit dem TitelKontext ohne Grenzen: Eine leistungsstarke KV-Cache-Plattform für groß angelegte KI-InferenzDer integrierte Stack kombiniert Supermicro Petascale Storage Servers, NVIDIA Spectrum-X Ethernet-Netzwerke,und IBM Storage Scale Erasure Coding Edition (ECE), um eine leistungsstarke gemeinsame Speicherebene für KI-Inferenz zu erstellenAls maßgebliche technische Dokumente, die von der IBM ITSO (International Technical Support Organization) veröffentlicht werden, bieten die IBM Redbooks praktische, praktische und praktische Informationen.detaillierte Leitlinien für die Bereitstellung von IBM-Infrastrukturprodukten für Unternehmen.
Das Redbook, das von Ingenieursteams von IBM, Supermicro und NVIDIA gemeinsam verfasst wurde, befasst sich mit einem Kernproblem bei langfristigen KI-Workloads.RAG-Abrufanwendungen und autonome Agentenpipelines erzeugen massive KV-Cache-Daten innerhalb der GPU HBM. Sobald zwischengespeicherte Daten aus den begrenzten HBM-Ressourcen entfernt wurden, wird durch wiederholte Neuberechnung eine starke Verzögerungserhöhung ausgelöst, wodurch eine dauerhafte Cross-Request-KV-Cache-Speicherung unerlässlich wird.
Die Lösung verwendet eine fünfstufige hierarchische KV-Cache-Architektur, die unterschiedliche Latenz- und Kapazitätsanforderungen abdeckt:
-
G1-Schicht: GPU-Knoten lokal HBM
-
G2-Schicht: CPU-Knoten-System-DRAM
-
G3-Schicht: Direkt angeschlossene lokale SSD
-
G3.5 Schicht: Pod-Level-Flash-Storage, mit NVIDIA BlueField-DPUs mit direkter Verbindung zu GPU-Server-DPUs
-
G4-Schicht: externer Cross-Ethernet-Gemeinsamer Speicherpool, der mit allen GPU-Computerservern verbunden ist
Dieses mehrstufige Setup bietet eine kontinuierliche Latenz und Kapazitätsgradienten.automatische Räumung und dynamisches Daten-Wiederladen über den gesamten Speicherstapel, die sich flexibel an unterschiedliche Arbeitsbelastungs-Zugriffsmuster und Gesamtinfrastrukturkostenbudgets anpassen.
Auf Supermicro Petascale Storage Servers eingesetzt, dient Storage Scale ECE als G4-Cold-Cache-Ebene.einschließlich inaktiver mehrfach drehbarer Gesprächszustände, geteilte Agentenkontextdaten und historische Abfrageaufzeichnungen, die keine sofortige Antwort erfordern.
Nach den im Redbook aufgezeichneten Testergebnissen beschleunigt diese produktionsfähige Referenzarchitektur effektiv die generativen KI- und agentenartigen KI-Inferenzdienste.Bei TTFT-Tests (Time To First Token) mit einer einzigen Anfrage im Vergleich zu eigenständigen GPU-Servern ohne externen Storage Scale KV-Cache, das integrierte System eine stabile TTFT unabhängig von schnellen Längenänderungen aufrechterhält.56x BeschleunigungUnter 130k-Token-Eingabe-Sequenzen und beseitigt vollständig Schlussfolgerung Latenzschwankungen durch verlängerte Aufforderung Längen verursacht.
Unter gleichzeitigem Mehrbenutzer-Inferenzdruck erzielt die Lösung eine dramatische Leistungssteigerung: der Anforderungsdurchsatz steigt von 0,19 RPS auf 4,26 RPS, was eine22x DurchsatzsteigerungInzwischen sinkt die Gesamtverarbeitungszeit für 200 Schlussanfragen um 95%, was die GPU-Effizienz und die allgemeine Skalierbarkeit des Schlussclusters erheblich erhöht.
Der Stack hält auch robuste Leistung unter harten lauten Nachbar-Stresstests aufrecht.Das integrierte System läuft immer noch stabil bei 3.6 RPS, beendet alle 200 Rückschlüsse innerhalb von 55,56 Sekunden.18 mal höherDas ist eine sehr schwierige Aufgabe, da die Datenverarbeitung nicht nur durch die Datenverarbeitung erfolgt, sondern auch durch die Datenverarbeitung.
Das Forschungsteam kam in dem Redbook zu dem Schluss: "Für Unternehmen, die einen maximalen ROI bei teuren GPU-Hardwareinvestitionen anstreben, bietet diese verifizierte integrierte Architektur eine einfache,Produktionsbereiter Ansatz zur Steigerung des Rückschlussdurchsatzes, die End-to-End-Latenz reduziert, eine höhere Service-Konkurrenz unterstützt und eine kostengünstigere groß angelegte KI-Inferenz-Infrastruktur aufgebaut wird.
Schlüsselwörter: SUPERMICRO, IBM Storage Scale, NVIDIA Dynamo
Beibei Qianxing Jietong Technology Co., Ltd.
Sandy Yang, Leiterin der globalen Strategie
WhatsApp / WeChat: +86 13426366826
E-Mail: yangyd@qianxingdata.com
Website: www.qianxingdata.com/www.storagesserver.com Die Daten werden auf der Website der chinesischen Regierung gespeichert.
Geschäftsfokus:
Vertrieb von IKT-Produkten/Systemintegration und Dienstleistungen/Infrastrukturlösungen
Mit mehr als 20 Jahren Erfahrung im IT-Vertrieb arbeiten wir mit führenden globalen Marken zusammen, um zuverlässige Produkte und professionelle Dienstleistungen zu liefern.
¢Technologie nutzen, um eine intelligente Welt aufzubauen¡Ihr vertrauenswürdiger Dienstleister für IKT-Produkte!