Studi Kasus

Enam minggu penurunan relevansi diam-diam

Perubahan pengambilan data merusak kualitas jawaban tanpa mengganggu satu pun tes, karena tidak ada yang membandingkan peringkat hari ini dengan peringkat kemarin. Pengguna menyerap kerugian itu dengan diam-diam.

Bentuk dari insiden

Perubahan rutin terjadi: indeks dibangun ulang dengan analiser yang sedikit berbeda, atau daftar sinonim ditambahkan, atau corpus diimpor ulang setelah upgrade parser. Setiap tes berhasil, karena setiap tes menyatakan bahwa endpoint merespons dan bahwa jawaban mengandung sesuatu yang masuk akal. Enam minggu kemudian, seseorang membaca antrian dukungan secara berurutan dan menyadari bahwa keluhan yang sama muncul, difrasakan dengan tiga cara berbeda, setiap minggu.

Tidak ada kesalahan untuk ditemukan. Tidak pernah ada kesalahan. Peringkat berubah, dan peringkat bukanlah sesuatu yang gagal dalam tes.

Mengapa tes ujung-ke-ujung tidak dapat melihatnya

Asersi tingkat jawaban adalah instrumen yang kasar. Jika asersi adalah bahwa respon menyebutkan topik, maka akan berhasil pada paragraf yang menyebutkan topik dan menjawab pertanyaan yang salah. Jika asersi adalah skor kualitas yang dinilai oleh manusia, penilai biasanya menilai jawaban secara isolasi, tidak melawan jawaban sebelumnya untuk pertanyaan yang sama — sehingga perubahan yang membuat setiap jawaban sedikit kurang relevan menghasilkan skor yang sedikit lebih rendah pada skala di mana sedikit lebih rendah tidak dapat dibedakan dari noise.

Pengukuran yang akan menangkapnya adalah komparatif dan mekanis: untuk set kueri tetap, simpan hasil teratas, dan diff mereka setiap kali konfigurasi pengambilan berubah. Bagian yang dulunya berada di posisi pertama dan sekarang tidak ada di hasil teratas adalah sinyal, dan tidak memerlukan hakim untuk menafsirkannya.

Membuat perubahan peringkat dapat dibedakan

  • Simpan set kueri emas — beberapa ratus kueri nyata sudah cukup — dan simpan pengidentifikasi hasil peringkat untuk setiap kueri sebagai baseline yang dikomit.
  • Setiap kali ada perubahan pada indeks, analiser, model embedding, atau chunker, regenerasi snapshot peringkat dan diff. Laporkan berapa banyak kueri yang mengubah hasil teratas, tidak hanya apakah rata-rata membaik.
  • Pisahkan dua arah. Perubahan dalam satu arah seringkali dimaksudkan; perubahan dalam kedua arah, terkonsentrasi dalam keluarga dokumen, biasanya merupakan kesalahan parsing atau analiser.
  • Lampirkan alasan untuk setiap pembaruan baseline yang disengaja. Baseline yang diperbarui tanpa penjelasan adalah regressi yang telah diklasifikasikan sebagai normal.
  • Perhatikan kueri yang berubah dari jawaban yang benar ke jawaban yang salah, bukan kueri yang berubah dari salah ke salah. Skor agregat menyembunyikan kerusakan arah.

Kebiasaan yang mencegah terjadinya kejadian kedua

Perlakukan konfigurasi pengambilan sebagai artefak yang diberi versi dengan catatan rilisnya sendiri: apa yang berubah, kueri mana yang berpindah, dan keluarga dokumen mana yang terkena. Satu paragraf itu adalah yang mengubah regresi diam selama enam minggu menjadi percakapan pada hari yang sama, karena orang yang membuat perubahan memiliki konteks dan masih tersedia untuk membuatnya lebih baik.

Ini juga menyelesaikan sengketa yang lebih umum sebelum dimulai. Ketika seseorang mengklaim bahwa relevansi telah memburuk, diff menunjukkannya atau tidak, dan percakapan berpindah dari kesan ke daftar kueri spesifik.

Yang bisa Anda lakukan sekarang

  • Tes jawaban ujung-ke-ujung tidak dapat melihat perubahan peringkat yang masih mengembalikan paragraf yang masuk akal
  • Ambil snapshot hasil teratas per kueri sehingga perubahan peringkat menjadi dapat dibandingkan
  • Regresi kualitas yang tidak menimbulkan kesalahan akan ditemukan oleh pengguna, bukan oleh CI