Playbook

Cara Melakukan Tinjauan Biaya Sebelum Meningkatkan Inferensi

Sebelum menambah kapasitas atau beralih ke model lain, lakukan tinjauan terhadap permintaan sekali dan hitung biaya setiap tahap. Kebanyakan tinjauan biaya menemukan biaya yang signifikan dalam ukuran konteks, retry, dan caching, bukan dalam pilihan model.

Urutan Melakukannya

Tinjauan biaya biasanya dimulai dengan katalog model, karena itulah tempat harga yang terlihat. Mulailah satu langkah sebelumnya: ikuti satu permintaan perwakilan dari antarmuka pengguna ke respons dan tulis setiap tahap yang mengonsumsi sumber daya berbayar. Model adalah satu baris di antara beberapa baris, dan jarang merupakan yang terbesar yang dapat dikontrol.

Tahap demi Tahap

  • Pengambilan. Mengintegrasikan kueri, mencari indeks, dan setiap proses pengurutan ulang. Pengurutan ulang himpunan kandidat besar dengan cross-encoder seringkali lebih mahal daripada generasi yang ditingkatkan, dan perdagangan tersebut jarang diukur.
  • Pengumpulan Konteks. Potongan yang diperoleh, riwayat percakapan, prompt sistem, definisi alat, dan instruksi format. Semua hal di sini dikenakan biaya pada setiap putaran, terlepas dari apakah telah berubah sejak putaran sebelumnya.
  • Generasi. Token input dan output, dengan token output biasanya diberi harga lebih tinggi dan dihasilkan lebih lambat. Kelonggaran adalah keputusan biaya, bukan hanya preferensi gaya.
  • Percobaan Ulang dan Waktu Tunggu. Pekerjaan ganda yang tidak muncul dalam grafik penggunaan apa pun dan meningkat dengan ekor distribusi keterlambatan.
  • Evaluasi dan Pemantauan. Run skoring terus menerus, lalu lintas sintetis, dan model hakim, yang seringkali sama besar dengan model produksi.

Empat Tuas yang Menggerakkan Angka

Disiplin Konteks. Dalam sebagian besar sistem pengambilan, ini adalah biaya yang dapat dikontrol terbesar. Deduplikasi potongan, batasi jumlah pasase, hapus riwayat yang tidak lagi direferensikan, dan letakkan bagian stabil prompt terlebih dahulu sehingga cache dapat digunakan kembali. Ukur ukuran konteks rata-rata per permintaan dan letakkan di dashboard; itu mengalir ke atas tanpa ada yang memutuskan untuk meningkatkannya.

Routing. Kirim pertanyaan yang tidak memerlukan model besar ke model kecil. Keputusan routing itu sendiri harus murah dan dapat diukur, dan fallback — ketika model kecil tidak percaya diri — harus didefinisikan sebelumnya daripada ditemukan di produksi.

Penyimpanan Cache. Pertanyaan yang identik dan hampir identik jauh lebih umum daripada yang diharapkan tim produk, terutama dalam alat internal dengan populasi pengguna kecil. Cache pada tingkat jawaban, dengan aturan invalidasi eksplisit yang terkait dengan korpus.

Panjang Keluaran. Mintalah panjang yang diinginkan. Model yang diberitahu untuk menyeluruh akan menyeluruh pada setiap permintaan, dan keluarannya dikenakan biaya pada tarif yang lebih tinggi.

Menulis Model

Rekam input, bukan hanya hasil: permintaan per periode, token input dan output rata-rata per permintaan, rasio percobaan ulang, tingkat cache, dan harga satuan yang digunakan. Model biaya tanpa input adalah tebakan yang mengenakan spreadsheet, dan tidak dapat diperiksa kembali ketika salah satu asumsi berubah — yang tepat ketika keputusan perlu dikunjungi kembali.

Kemudian atributkan biaya ke unit yang peduli bisnis. Biaya per pengguna aktif dan biaya per tugas selesai menjelaskan tagihan; biaya per token tidak, karena tidak ada yang memutuskan untuk membeli token.

Kapan Membeli Kapasitas Sebagai Gantinya

Setelah tuas di atas, jika beban kerja benar-benar besar dan stabil, kapasitas self-hosted mungkin menang. Keputusan ini bergantung pada utiliasi: perangkat keras yang dipesan murah per jam dan mahal per jam yang tidak digunakan. Tulis utiliasi yang diharapkan, utiliasi yang dapat diukur, dan ambang batas di mana perbandingan berubah. Tanpa angka utiliasi, perbandingan ini adalah argumen, bukan perhitungan.

Yang bisa Anda lakukan sekarang

  • Harga seluruh jalur permintaan, bukan hanya item biaya model
  • Ukuran konteks adalah biaya terkendali terbesar di sebagian besar sistem RAG
  • Tuliskan asumsi-asumsi — model biaya tanpa input adalah tebakan