logo
Startseite Rechtssachen

VAST Data und AMD behaupten 9x schnellere Time-to-First-Token mit KV-Cache-Offload auf Instinct

Bescheinigung
China Beijing Qianxing Jietong Technology Co., Ltd. zertifizierungen
China Beijing Qianxing Jietong Technology Co., Ltd. zertifizierungen
Kunden-Berichte
Das Verkaufspersonal von Beijing Qianxing Jietong Technology Co.,Ltd ist sehr Berufs- und geduldig. Sie können Zitate schnell zur Verfügung stellen. Die Qualität und das Verpacken der Produkte ist auch sehr gut. Unsere Zusammenarbeit ist sehr glatt.

—— 》 《Festfing DV LLC

Als ich Intel CPU und nach Toshiba SSD dringend suchte, gab Sandy von Beijing Qianxing Jietong Technology Co., Ltd mir viel Hilfe und erhielt mir die Produkte, die ich schnell benötigte. Ich schätze sie wirklich.

—— Kitty Yen

Sandy von Beijing Qianxing Jietong Technology Co.,Ltd ist ein sehr vorsichtiger Verkäufer, der mich an Konfigurationsfehler in der Zeit erinnern kann, als ich einen Server kaufe. Die Ingenieure sind auch sehr Berufs und können den Prüfungsprozeß schnell abschließen.

—— Strelkin Mikhail Vladimirovich

Wir sind sehr zufrieden mit unserer Erfahrung in der Zusammenarbeit mit Beijing Qianxing Jietong. Die Produktqualität ist ausgezeichnet und die Lieferung erfolgt immer pünktlich. Ihr Verkaufsteam ist professionell, geduldig und sehr hilfreich bei all unseren Fragen. Wir schätzen ihre Unterstützung sehr und freuen uns auf eine langfristige Partnerschaft. Sehr empfehlenswert!

—— Ahmad Navid

Qualität: “Große Erfahrung mit meinem Lieferanten. Der MikroTik RB3011 war bereits benutzt, aber er war in sehr gutem Zustand und alles funktioniert perfekt.Und alle meine Sorgen wurden schnell gelöst.Ein sehr zuverlässiger Lieferant wird empfohlen.

—— Geran Colesio

Ich bin online Chat Jetzt

VAST Data und AMD behaupten 9x schnellere Time-to-First-Token mit KV-Cache-Offload auf Instinct

July 28, 2026
VAST Data hat seine Partnerschaft mit AMD ausgebaut, um die KI-Infrastruktur für Cloud- und Unternehmensplattformen zu verbessern, die Modelltraining, Inferenz, Retrieval-Augmented Generation (RAG) und agentenbasierte KI-Workloads ausführen. Der integrierte Stack vereint das VAST AI Operating System mit AMD EPYC-Prozessoren der 6. Generation, AMD Instinct GPUs, AMD-Netzwerkhardware und ROCm-Software.

Diese Zusammenarbeit steht im Einklang mit einem wichtigen Branchenwandel: Die KI-Infrastruktur entwickelt sich über reine Trainingscluster hinaus, um persistente Kontexte, Inferenz mit hoher Nebenläufigkeit und Multi-Turn-Agenten-Workflows zu unterstützen. Moderne KI-Implementierungen priorisieren effiziente Datenbewegungen, optimiertes KV-Cache-Management, höhere GPU-Auslastung und latenzarmen Zugriff auf große Modelle und kontextbezogene Datensätze.

Die Disaggregated Shared Everything (DASE)-Architektur von VAST dient als einheitliche, gemeinsam genutzte Datenebene für diese modernen KI-Umgebungen. Sie konsolidiert Datei- und Objektspeicher, Datenbanken, Event-Streaming und Kern-Datendienste unter einem einzigen globalen Namespace und bietet gleichzeitig Multi-Tenancy und Workload-Isolation für KI-Clouds, die diverse gleichzeitige Kunden- und Anwendungsaufgaben ausführen.

AMD EPYC 9006 treibt die nächste Generation der VAST-Hardware an

VAST übernimmt Prozessoren der AMD EPYC 9006-Serie (Venice) der 6. Generation für seine bevorstehenden CBox-Systeme der 6. Generation und EBox-Systeme der 3. Generation, die das Hardware-Fundament des VAST AI Operating Systems bilden. Die EPYC 9006-Plattform führt PCIe Gen6-Konnektivität in die Hardware-Reihe von VAST ein und verdoppelt die I/O-Bandbreite pro Generation.

aktueller Firmenfall über VAST Data und AMD behaupten 9x schnellere Time-to-First-Token mit KV-Cache-Offload auf Instinct  0

Das Upgrade steigert den Durchsatz von Datei- und Objektspeichern und senkt die Latenz für Datenbank-, Data-Warehouse- und Event-Streaming-Workloads, die von VAST DataBase und DataEngine unterstützt werden. Für die KI-Infrastruktur erleichtert die verbesserte I/O-Bandbreite Engpässe bei Compute-, Netzwerk- und NVMe-Speichern, was sich positiv auf Modell-Ladevorgänge, Abruf-Pipelines, Checkpoint-Zugriff und externe KV-Cache-Workflows auswirkt, die den nativen GPU-Speicher übersteigen.

Tri-Player Referenzarchitektur mit AMD und DriveNets

VAST, AMD und DriveNets entwickeln gemeinsam eine einheitliche Referenzarchitektur für KI-Infrastruktur, die AMDs Rack-Scale Helios KI-Infrastruktur, VAST AI OS und DriveNets AI Fabric Networking kombiniert. Das Framework liefert standardisierte Bereitstellungsanleitungen für KI-Training, Inferenz, Reinforcement Learning und KV-Cache-Workloads und bietet Best Practices für Dimensionierung und Verfügbarkeit für Unternehmen, die KI-Fabriken mit gemeinsam genutzter Dateninfrastruktur und Hochleistungsnetzwerken aufbauen.

VAST hat auch seine Ökosystem-Verbindungen zu den Inferenz-Anbietern TensorMesh und EmbeddedLLM erweitert und konzentriert sich auf produktionsreife Inferenzarchitekturen für agentenbasierte KI-Anwendungsfälle, wobei spezifische Integrations- und Startdetails noch bekannt gegeben werden.

Optimiertes KV-Cache-Offloading für Inferenz mit hoher Nebenläufigkeit

Ein zentraler Bestandteil der aktualisierten Zusammenarbeit ist das verbesserte KV-Cache-Offloading, das AMD Instinct GPUs, AMD Infinity Context, ROCm-Software und das VAST AI OS nutzt. KV-Cache speichert Inferenz-generierte Aufmerksamkeitszustandsdaten, um Multi-Turn-Interaktionen und KI-Workloads mit langem Kontext zu beschleunigen, doch große Cache-Größen verbrauchen schnell begrenzten GPU-Speicher.

aktueller Firmenfall über VAST Data und AMD behaupten 9x schnellere Time-to-First-Token mit KV-Cache-Offload auf Instinct  1

Das Auslagern oder Tiering von KV-Cache auf Hochleistungs-Shared-Storage gibt GPU-Speicher für aktive Aufgaben frei und bewahrt gleichzeitig Kontextdaten für nachfolgende Inferenzanfragen. Frühe Tests auf AMD Instinct MI355X GPUs lieferten eine 9-mal schnellere Zeit bis zum ersten Token und einen 9,7-mal höheren Token-Durchsatz für agentenbasierte KI-Workloads mit hoher Nebenläufigkeit über VAST-gestütztes KV-Cache-Offloading, wobei die Leistung je nach Hardware-Basis, Workload und Speicher-Konfiguration variiert.

Darüber hinaus gelten die automatisierten Lifecycle-Richtlinien von VAST für KV-Cache-Daten, die eine geplante Ablauf- und Löschung von gecachten Inhalten ermöglichen – eine kritische Funktion für die Verarbeitung sensibler, persönlicher oder regulierter Inferenzdaten.

Hochgeschwindigkeits-GPU-Speicher-Interconnect über Pensando Pollara 400

Die Architektur setzt AMD Pensando Pollara 400 AI NICs ein, um AMD Instinct GPUs mit VAST-Speicherclustern zu verbinden. Die NIC unterstützt NFS über TCP und RDMA und ermöglicht effiziente GPU-zu-Speicher-Datentransfers, wodurch ein latenzarmer Zugriff auf NVMe-basierten VAST-Speicher für KV-Cache und allgemeine Inferenz-Workloads ermöglicht wird.

Dieses Design entkoppelt die Skalierung des Kontextmanagements von den physischen GPU-Speicherlimits. Anstatt Speicher als passive Persistenz zu behandeln, positioniert VAST seine Plattform als eine einheitliche Daten- und Ausführungsebene für verteiltes Modellmanagement, Datenbanken, Streaming, Datei-Assets und KI-Kontext. Für KI-Cloud-Anbieter hebt die Architektur die GPU-Auslastung und die betriebliche Effizienz hervor und unterstützt den Branchenübergang von Batch-Training und GPU-Vermietung zu persistenter Inferenz und agentenbasierten KI-Diensten.

Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Global Strategy Director
WhatsApp / WeChat: +86 13426366826
E-Mail: yangyd@qianxingdata.com
Website: www.qianxingdata.com/www.storagesserver.com
Geschäftsschwerpunkt:
ICT-Produktvertrieb/Systemintegration & Dienstleistungen/Infrastrukturlösungen
Mit über 20 Jahren Erfahrung im IT-Vertrieb arbeiten wir mit führenden globalen Marken zusammen, um zuverlässige Produkte und professionelle Dienstleistungen zu liefern.
„Technologie nutzen, um eine intelligente Welt zu bauen“ Ihr vertrauenswürdiger ICT-Produkt-Dienstleister!
Kontaktdaten
Beijing Qianxing Jietong Technology Co., Ltd.

Ansprechpartner: Ms. Sandy Yang

Telefon: 13426366826

Senden Sie Ihre Anfrage direkt an uns (0 / 3000)