Compresión de tokens para LLMs: Reduce el costo del contexto antes de enrutar

Compresión de tokens para LLMs es la práctica de reducir los prompts, el contexto recuperado, las salidas de herramientas, el historial de chat y los registros antes de que lleguen a un modelo. No reemplaza el enrutamiento, la evaluación ni la conmutación por error. Hace que esos sistemas funcionen con entradas más limpias.
Eso importa porque la mayoría de los problemas de costo y latencia de la IA comienzan antes de que la solicitud salga de tu aplicación. Un bot de soporte puede enviar todo un hilo de tickets cuando solo importan tres hechos. Un agente puede pegar una respuesta completa de herramienta cuando solo necesita un estado, cantidad y próxima acción. Un flujo de trabajo RAG puede recuperar cinco fragmentos cuando una respuesta compacta sería suficiente.
OpenAI explica que el uso de la API se mide en tokens, y esos tokens provienen tanto del texto de entrada como del de salida. Un contexto largo no es un contexto gratuito. El objetivo no es privar al modelo. El objetivo es enviar el contexto más pequeño que aún preserve la decisión, la evidencia y las restricciones que el modelo necesita.
Por qué la compresión de tokens importa antes del enrutamiento
Muchos equipos piensan en la optimización de costos como un problema de selección de modelos: enviar trabajos fáciles a un modelo más económico, reservar modelos premium para trabajos más difíciles y usar conmutación por error cuando una ruta de proveedor se degrada. Eso es útil, pero pasa por alto un punto básico: el enrutador solo ve la solicitud que le das.
Si la solicitud está inflada, cada decisión posterior se vuelve más difícil. Un modelo económico puede fallar porque recibe demasiado ruido. Un modelo avanzado puede parecer necesario porque el prompt está desordenado. La observabilidad puede mostrar un gasto alto, pero no el contexto evitable que lo causó.
La compresión agrega un paso antes del acceso al modelo: reducir la carga, preservar la intención y luego enrutar. Con el mercado de modelos de ShareAI, esa solicitud más limpia puede luego ser evaluada en función de la elección del modelo, el precio, la latencia, la disponibilidad y las necesidades de enrutamiento a través de una API.
¿Qué debería comprimirse?
No todos los tokens merecen el mismo tratamiento. Algunos textos son críticos para las instrucciones. Algunos textos son evidencia. Algunos textos son solo residuos de pasos anteriores.
| Área de entrada | Enfoque de compresión | Qué preservar |
|---|---|---|
| Historial de chat | Resumir turnos anteriores en estado, decisiones, restricciones y preguntas abiertas. | Intención del usuario, compromisos, nombres, preferencias y tareas pendientes. |
| Fragmentos RAG | Recuperar de manera precisa, deduplicar y extraer los pasajes que responden a la pregunta actual. | Citas, hechos exactos, evidencia contradictoria y señales de actualidad. |
| Resultados de herramientas | Convertir respuestas extensas en campos estructurados compactos. | Estado, identificadores, cantidades, errores, marcas de tiempo y próximas acciones. |
| Registros y trazas | Agrupar eventos repetidos y conservar solo la anomalía, el conteo y la muestra relevante. | Patrón de error, frecuencia, servicio afectado y línea de tiempo. |
| Instrucciones del sistema | Eliminar texto de políticas duplicado y separar instrucciones estables del contexto específico de la tarea. | Reglas de seguridad, contrato de salida, restricciones de rol y permisos de herramientas. |
Cinco métodos prácticos de compresión
1. Resumir el estado, no la prosa
Un resumen débil reescribe una conversación larga en un párrafo más corto. Un resumen útil mantiene el estado operativo: lo que el usuario quiere, lo que ya se ha intentado, lo que falló, qué restricciones quedan y cuál es la próxima decisión.
Para los agentes, los resúmenes de estado deben actualizarse en límites conocidos: después de una llamada a una herramienta, después de una decisión del usuario, después de un paso del flujo de trabajo o antes de cambiar de modelo. No comprimas identificadores, requisitos o restricciones negativas.
2. Extraer campos de las salidas de herramientas
Muchas llamadas a herramientas devuelven mucho más texto del que necesita el siguiente paso del modelo. En lugar de pasar toda la respuesta, extrae los campos que importan. Una consulta de pago podría convertirse en ID de cliente, estado de factura, saldo, fecha de vencimiento y banderas de riesgo. Un resultado de búsqueda podría convertirse en título, URL canónica, fecha y la única oración que respalda la afirmación.
3. Filtrar la recuperación antes de la generación
Los sistemas RAG a menudo desperdician tokens enviando fragmentos similares, fragmentos antiguos o fragmentos que coinciden con palabras clave pero no con la intención. Una capa de compresión puede deduplicar pasajes superpuestos, eliminar contexto obsoleto y mantener solo evidencia que responda a la consulta actual.
Esto es especialmente importante cuando la respuesta final necesita citas. Comprime el contexto, pero conserva suficiente detalle de la fuente para verificar la respuesta más tarde.
4. Usar salidas intermedias estructuradas
El texto intermedio libre crece rápidamente. Las salidas estructuradas permanecen más pequeñas y son más fáciles de auditar. En lugar de pedir a un modelo que explique cada acción candidata, pídele que devuelva una lista compacta de opciones con campos como acción, confianza, razón, problema bloqueante y entrada requerida.
5. Tratar el almacenamiento en caché de prompts como una palanca separada
El almacenamiento en caché de prompts puede reducir el costo o la latencia de prefijos repetidos en sistemas compatibles, pero no es lo mismo que la compresión de tokens. El texto almacenado en caché aún puede consumir espacio en la ventana de contexto y aún puede dificultar la inspección de las solicitudes. Anthropic’s ventana de contexto and almacenamiento en caché de indicaciones La documentación es un recordatorio útil de que el diseño de caché y contexto resuelve problemas relacionados pero diferentes.
Dónde encaja la compresión en un flujo de trabajo de ShareAI
ShareAI es un mercado de IA y API, no un lugar donde se construye la aplicación en sí. Tu aplicación se encarga de la experiencia del usuario, la lógica del flujo de trabajo, la selección de contexto y el paso de compresión. ShareAI ayuda con el acceso al modelo: una API para más de 150 modelos, visibilidad en el mercado, enrutamiento, conmutación por error y seguimiento de uso.
- Recopila la solicitud del usuario en bruto y el contexto de la aplicación.
- Elimina duplicados, contextos obsoletos y resultados de recuperación irrelevantes.
- Comprime el estado de conversación más antiguo y las salidas detalladas de herramientas.
- Envía la solicitud limpiada a través del API de ShareAI.
- Enruta según el ajuste del modelo, precio, latencia, disponibilidad y necesidades de respaldo.
- Mide la calidad, el costo y los patrones de fallos después de la respuesta.
Para los Creadores, la compresión también puede hacer que la monetización sea más clara. Si una aplicación existente enruta tráfico de inferencia de IA a través de ShareAI, el Creador puede configurar un recargo o margen y recibir pagos mensuales basados en el uso generado. Un contexto más limpio ayuda a que ese uso enrutado sea más fácil de explicar a los clientes porque los usuarios intensivos pagan por el tráfico de IA que realmente generan.
Cómo medir si la compresión está funcionando
La compresión solo es útil si la calidad se mantiene. Supervísala como un cambio de producción, no como un truco ingenioso de indicaciones.
- Tokens de entrada por solicitud: deberían disminuir para flujos de trabajo específicos.
- Calidad de salida: debería permanecer estable en tareas representativas.
- Tasa de retroceso: no debería aumentar porque rutas más baratas están recibiendo un contexto más débil.
- Latencia: debería mejorar, o al menos justificar cualquier paso de preprocesamiento.
- Tasa de escalada: debería revelar cuando el contexto comprimido obliga a los usuarios o agentes a preguntar de nuevo.
- Costo por tarea exitosa: debería disminuir, no solo el costo por solicitud.
Un buen conjunto de pruebas incluye indicaciones cortas, indicaciones largas, tareas de agentes con muchas herramientas, preguntas RAG y casos límite donde la falta de contexto causaría una respuesta incorrecta. Compare ejecuciones comprimidas y no comprimidas antes de hacer que la compresión sea el valor predeterminado.
Cuándo no comprimir agresivamente
La compresión tiene compensaciones. Puede eliminar matices, ocultar incertidumbre o aplanar evidencia que el modelo necesita. Use una compresión más ligera cuando las palabras exactas sean importantes, cuando el modelo deba razonar sobre contratos o políticas, cuando se deban preservar citas o cuando el usuario solicite explícitamente material fuente exhaustivo.
El patrón más seguro es la compresión progresiva. Mantenga material fuente de alta fidelidad disponible en su aplicación, pase contexto compacto al modelo y recupere la evidencia original nuevamente cuando la tarea requiera verificación.
Preguntas frecuentes: Compresión de tokens para LLMs
¿Qué es la compresión de tokens para LLMs?
La compresión de tokens para LLMs significa reducir texto de entrada innecesario antes de una llamada al modelo mientras se preservan los hechos, instrucciones y restricciones necesarias para una buena respuesta.
¿La compresión de tokens es lo mismo que usar un modelo más pequeño?
No. La compresión reduce la solicitud. La selección del modelo elige a dónde va esa solicitud. La configuración más sólida a menudo hace ambas cosas: comprimir el contexto primero y luego dirigirlo al modelo correcto.
¿ShareAI comprime automáticamente los prompts?
La compresión suele ser una elección de diseño del lado de la aplicación. ShareAI proporciona el mercado de IA y la capa API para acceso a modelos, enrutamiento, conmutación por error y visibilidad de uso después de que tu aplicación prepara la solicitud.
¿Cómo ayuda la compresión a reducir los costos de LLM?
La mayoría de las API de IA fijan precios según los tokens de entrada y salida. Si reduces de manera segura los tokens de entrada mientras mantienes la calidad estable, el costo por tarea exitosa puede disminuir.
¿La compresión de tokens puede afectar la calidad de la respuesta?
Sí. La sobrecompresión puede eliminar evidencia, matices o restricciones. Prueba los prompts comprimidos en tareas reales y monitorea la calidad de las respuestas, la tasa de fallos y las correcciones de los usuarios.
¿Qué deben saber los desarrolladores sobre la compresión?
Los desarrolladores que enrutan el uso de IA desde una aplicación existente a través de ShareAI pueden usar la compresión para mantener el tráfico enrutado más limpio. Aún pueden establecer un recargo o margen y recibir pagos mensuales por el uso generado.
¿Es útil la compresión de tokens para RAG?
Sí. Los sistemas RAG a menudo envían fragmentos redundantes o débilmente relevantes. La compresión puede deduplicar, filtrar y extraer los pasajes que responden a la pregunta actual.
¿El almacenamiento en caché de prompts reemplaza la compresión?
No. El almacenamiento en caché de prompts puede ayudar con prefijos repetidos en sistemas compatibles, pero la compresión sigue siendo importante cuando el contexto es ruidoso, obsoleto, duplicado o demasiado grande para la tarea.
¿Qué equipos se benefician más de la compresión de tokens?
Los equipos con historial de chat extenso, agentes con muchas herramientas, flujos de trabajo de documentos, automatización de soporte, asistentes de investigación y sistemas RAG suelen ver la necesidad más clara de compresión.
¿Cómo debería empezar a probar la compresión?
Elige un flujo de trabajo costoso, captura solicitudes representativas, crea versiones comprimidas y compara el uso de tokens, la calidad de las respuestas, la latencia y el costo por tarea exitosa.
¿Cómo funciona la compresión con el enrutamiento de IA?
La compresión prepara una solicitud más limpia. El enrutamiento decide el mejor modelo o ruta del proveedor para esa solicitud según el precio, la latencia, la disponibilidad, la fiabilidad y las necesidades de calidad.
Próximo paso
Comienza con un flujo de trabajo donde el exceso de contexto sea visible. Comprime las partes ruidosas, conserva la evidencia que importa, luego usa ShareAI para comparar rutas de modelos a través de una API. El objetivo práctico es simple: menos tokens desperdiciados, menos escalaciones evitables y datos de uso más claros.