Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Verwalteter mehrstufiger KV-Cache und Routing
Bei großen Sprachmodellen wird der Key-Value-Cache (KV) für bereits verarbeitete Tokens mit Rechenleistung neu aufgebaut. HyperPod fügt Ray Serve einen verwalteten zweistufigen KV-Cache und präfixfähiges Routing hinzu, wodurch redundante Neuberechnungen vermieden und die Zeit bis zum ersten Token bei Workloads mit langem Kontext und mehreren Turns verkürzt wird.
So funktioniert der mehrstufige Cache
Der Cache hat zwei Ebenen:
-
Eine lokale Ebene im Speicher des Knotens, der die Anfrage bedient, für die schnellste Wiederverwendung.
-
Eine clusterweite Ebene auf HyperPod Tiered Storage, einer gepoolten Speicherebene, die sich über Clusterknoten erstreckt. Ein Replikat liest ein Präfix, das von einem anderen Replikat berechnet wurde, anstatt es erneut zu berechnen.
Wenn eine Anforderung ein Token-Präfix mit einer früheren Arbeit gemeinsam hat, liest die Bereitstellung den gecachten KV-Status von der lokalen Ebene und dann von der clusterweiten Ebene, bevor irgendetwas neu berechnet wird.
Prefix-aware Routing
Prefix-aware Routing sendet eine Anfrage an ein Replikat, das bereits den KV-Cache für sein Präfix enthält. Multi-turn Konversationen und gemeinsam genutzte Systemaufforderungen werden an dasselbe Replikat weitergeleitet, sodass die Cache-Trefferquote hoch bleibt und die Zeit bis zum ersten Token sinkt.
Voraussetzung
Die clusterweite Ebene wird auf HyperPod Tiered Storage ausgeführt. Richten Sie Tiered Storage auf dem Cluster ein, bevor Sie den clusterweiten Cache einschalten. Weitere Informationen finden Sie unter Tiered KV-Cache einrichten.