Derniers
Routage du cache KV : Réduire le travail redondant de pré-remplissage des LLM
Le routage du cache KV envoie des préfixes de requêtes répétés aux réplicas pouvant réutiliser l'état d'attention mis en cache, aidant les équipes à réduire le travail redondant de pré-remplissage des LLM.