Ordenar proveedores y controlar la alternativa
Comprende el precio, la latencia y el ranking de rendimiento de ShareAI, proveedores ordenados, mediciones no disponibles y límites de respaldo seguros.
En esta página
Precio#
El ranking de precios compara la tarifa aplicable del nivel de entrada más la tarifa base de salida. No es una predicción del costo total de la solicitud. Revisa los precios de entrada, salida y caché para el proveedor seleccionado y tu carga de trabajo esperada.
Latencia y rendimiento#
La latencia utiliza el tiempo transcurrido observado de solicitudes completadas, no el tiempo hasta el primer token. El rendimiento utiliza tokens de salida observados por segundo transcurrido. Las observaciones recientes cubren una ventana de cinco minutos. Estas mediciones guían el enrutamiento; no garantizan un tiempo de respuesta o capacidad.
Los proveedores sin las observaciones requeridas de precio o rendimiento se clasifican después de los proveedores medidos en cualquier dirección. Los identificadores estables resuelven empates.
Ordenar antes de clasificar#
Un orden explícito de proveedores tiene prioridad sobre la clasificación. Dentro de las opciones elegibles restantes, el orden seleccionado determina el ranking. Los proveedores ignorados, solo externos, operaciones no compatibles y proveedores excluidos por permisos clave permanecen inelegibles.
| Política | Opciones elegibles |
|---|---|
allow_fallbacks: true | Otros proveedores elegibles pueden ser considerados, dentro de cada restricción estricta. |
allow_fallbacks: false con order | Solo los proveedores listados explícitamente en orden. |
allow_fallbacks: false sin order | Solo el proveedor clasificado en primer lugar. |
El respaldo mantiene el mismo modelo#
El respaldo del proveedor cambia la infraestructura elegible para el modelo solicitado exacto. No cambia a otra etiqueta de modelo. Cualquier elección de proveedor upstream realizada dentro del proveedor de ShareAI es independiente de la identidad pública del creador y de la política del proveedor de ejecución.
Gestionar solicitudes interrumpidas#
El enrutamiento no reintenta automáticamente después de un despacho exitoso, una respuesta incierta o una salida parcial. Esto evita trabajo y cargos duplicados. Conserva la salida parcial y deja que la aplicación decida si iniciar una nueva solicitud. Evita bucles de reintento ilimitados.
Ejemplos#
JSON
{
"provider": {
"sort": {
"by": "latency",
"direction": "asc"
},
"allow_fallbacks": true
}
}
Para preferir el mayor rendimiento, usa {"by":"throughput","direction":"desc"}. Invierte cualquier dirección solo cuando ese orden coincida con tu prueba o carga de trabajo prevista.
Última actualización 16 de septiembre de 2026