Cele mai recente
Rutare cache KV: Reduceți munca redundantă de preumplere LLM
Rutarea cache-ului KV trimite prefixe de prompt repetate către replici care pot reutiliza starea de atenție stocată, ajutând echipele să reducă munca redundantă de preumplere LLM.