View a markdown version of this page

Cache e routing KV gestiti su più livelli - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Cache e routing KV gestiti su più livelli

Large Language Model Serving impiega il calcolo a ricostruire la cache chiave-valore (KV) per i token che ha già elaborato. HyperPod aggiunge a Ray Serve una cache KV gestita a due livelli e un routing basato sui prefissi, riducendo così il ricalcolo ridondante e il tempo necessario per passare al primo token per carichi di lavoro a lungo termine e a più turni.

Come funziona la cache a più livelli

La cache è suddivisa in due livelli:

  • Un livello locale nella memoria del nodo che serve la richiesta, per il riutilizzo più rapido.

  • Un livello a livello di cluster su HyperPod Tiered Storage, un livello di memoria in pool che comprende i nodi del cluster. Una replica legge un prefisso calcolato da un'altra replica invece di ricalcolarlo.

Quando una richiesta condivide il prefisso di un token con un lavoro precedente, la distribuzione legge lo stato KV memorizzato nella cache dal livello locale, quindi dal livello a livello di cluster, prima di ricalcolare qualsiasi cosa.

Prefix-aware routing

Prefix-aware il routing invia una richiesta a una replica che contiene già la cache KV per il suo prefisso. Multi-turn le conversazioni e il sistema condiviso richiedono l'indirizzamento alla stessa replica, quindi la percentuale di visite alla cache rimane elevata e il tempo necessario per il primo token diminuisce.

Prerequisito

Il livello a livello di cluster viene eseguito su HyperPod tiered Storage, quindi configura lo storage a più livelli sul cluster prima di attivare la cache a livello di cluster. Per ulteriori informazioni, consulta Configurazione della cache KV su più livelli.