ShareAI Platform Docs

Urutkan penyedia dan kontrol fallback

Pahami peringkat harga, latensi, dan throughput ShareAI, penyedia yang diurutkan, pengukuran yang tidak tersedia, dan batas fallback yang aman.

Lihat sebagai Markdown
Di halaman ini

Harga#

Peringkat harga membandingkan tarif input-tier yang berlaku ditambah tarif output dasar. Ini bukan prediksi total tagihan permintaan. Tinjau harga input, output, dan cache untuk penyedia yang dipilih dan beban kerja yang Anda harapkan.

Latensi dan throughput#

Latensi menggunakan waktu berlalu permintaan selesai yang diamati, bukan waktu hingga token pertama. Throughput menggunakan token output yang diamati per detik berlalu. Pengamatan terbaru mencakup jendela lima menit. Pengukuran ini memandu routing; mereka tidak menjamin waktu respons atau kapasitas.

Penyedia tanpa pengamatan harga atau kinerja yang diperlukan berada di peringkat setelah penyedia yang diukur di kedua arah. Pengidentifikasi stabil memecahkan seri.

Urutkan sebelum menyortir#

Urutan penyedia eksplisit memiliki prioritas atas penyortiran. Dalam pilihan yang memenuhi syarat yang tersisa, penyortiran yang dipilih menentukan peringkat. Penyedia yang diabaikan, penyedia di luar saja, operasi yang tidak didukung, dan penyedia yang dikecualikan oleh izin kunci tetap tidak memenuhi syarat.

KebijakanPilihan yang memenuhi syarat
allow_fallbacks: truePenyedia lain yang memenuhi syarat dapat dipertimbangkan, dalam setiap batasan keras.
allow_fallbacks: false dengan orderHanya penyedia yang secara eksplisit terdaftar dalam urutan.
allow_fallbacks: false tanpa orderHanya penyedia yang berada di peringkat pertama.

Fallback mempertahankan model yang sama#

Fallback penyedia mengubah infrastruktur yang memenuhi syarat untuk model yang diminta secara tepat. Ini tidak beralih ke tag model lain. Pilihan vendor upstream yang dibuat di dalam penyedia ShareAI terpisah dari identitas pembuat publik dan kebijakan penyedia eksekusi.

Tangani permintaan yang terputus#

Routing tidak secara otomatis mencoba ulang setelah pengiriman berhasil, respons yang tidak pasti, atau output parsial. Ini menghindari pekerjaan dan biaya duplikat. Pertahankan output parsial dan biarkan aplikasi memutuskan apakah akan memulai permintaan baru. Hindari loop coba ulang tanpa batas.

Contoh#

JSON

{
  "provider": {
    "sort": {
      "by": "latency",
      "direction": "asc"
    },
    "allow_fallbacks": true
  }
}

Untuk memprioritaskan throughput tertinggi, gunakan {"by":"throughput","direction":"desc"}. Balikkan arah hanya jika urutan tersebut sesuai dengan pengujian atau beban kerja yang Anda maksudkan.

Terakhir diperbarui 16 September 2026

Dokumentasi Platform ShareAI
Semua dokumentasi

Cari berdasarkan judul atau konten.

Tanyakan tentang halaman ini

Pilih asisten untuk menjelajahi halaman ini. Anda juga dapat menyalin halaman dan menempelkannya ke dalam percakapan Anda.

Ask ChatGPTAsk ClaudeAsk GrokAsk ShareAI