1. Tulis pertanyaannya sebelum menyiapkan varian
Perbandingan yang berguna menjawab keputusan yang spesifik: apakah menambah panjang maksimum mencegah jawaban terpotong? Apakah tingkat detail mempertahankan kontur yang diperlukan? Apakah grup yang lebih besar selesai tanpa kesalahan? Pilih satu pertanyaan dan satu parameter saja. "Menemukan pengaturan terbaik" terlalu luas untuk sesi pertama.
Sebut A sebagai referensi dan B sebagai varian. Catat nilai persis yang diubah. Mengubah sekaligus model, dimensi, dan jumlah pass dapat menghasilkan hasil yang berbeda, tanpa mengungkap perubahan mana yang menyebabkannya. Simpan uji coba tersebut untuk perbandingan terpisah.
2. Tetapkan korpus kecil dan aturan penilaian
Kumpulkan masukan yang sama untuk A dan B. Sekitar selusin kasus bisa cukup untuk keputusan pertama yang terbatas jika mencakup kesulitan proyek: teks halus dalam gambar, dokumen panjang, data yang hilang, atau format yang tidak biasa. Jumlah ini adalah pilihan praktis, bukan jaminan statistik. Hindari hanya memasukkan contoh yang sudah berhasil.
Untuk setiap masukan, tuliskan kondisi keberhasilan sebelum pengujian. Bedakan preferensi penyajian dari cacat yang menghambat. Dalam asisten dokumen, jawaban yang lebih menyenangkan bisa tetap ditolak jika mengarang aturan. Untuk visual produk, warna yang memikat tidak mengimbangi hilangnya elemen penting.
Tetapkan juga jumlah minimal kasus yang diterima, cacat yang dilarang, dan waktu maksimal pemeriksaan. Ambang batas khusus proyek ini harus tetap sama saat Anda memeriksa hasil.
| Yang harus ditetapkan | Contoh catatan | Mengapa ini penting |
|---|---|---|
| Masukan | kasus-01 hingga kasus-12, file dan rumusan yang sama | Bandingkan kesulitan yang sama |
| Kriteria kualitas | Jawaban yang dapat diverifikasi dalam dokumen dan tanpa mengarang | Cegah keluaran yang lancar menyamarkan kesalahan |
| Kegagalan kritis | Aturan yang tidak ada disajikan sebagai pasti | Tolak cacat meskipun totalnya tampak lebih baik |
| Variabel | A: 128; B: maksimal 256 token baru | Kaitkan perbedaan dengan perubahan yang teridentifikasi |
3. Pertahankan sesi dan dependensi yang sama
Pertahankan model, versinya, ekstensi, mesin komputasi, dan parameter lainnya. Gunakan lingkungan dan GPU yang sama, tanpa menjalankan pemrosesan lain di antara kedua varian. Catat hal-hal yang tidak dapat Anda kendalikan: aktivitas bersamaan yang terlihat, perubahan versi yang dipaksakan, atau pemuatan yang berbeda. Perbandingan yang terpengaruh oleh perubahan-perubahan ini memerlukan kehati-hatian lebih.
Jika alat menggunakan seed acak dan memungkinkan untuk menetapkannya, pertahankan nilainya untuk setiap pasangan proses. Ini memudahkan perbandingan, tetapi tidak menjamin keluaran yang identik di semua tempat. PyTorch menyatakan bahwa reproduktibilitas penuh tidak dijamin antar versi atau platform, bahkan dengan seed yang sama.
Buat dua folder, A dan B, dengan daftar identitas yang sama. Simpan keluaran mentah sebelum koreksi manual apa pun. Penyuntingan setelahnya harus tampil sebagai operasi tambahan, beserta waktu kerjanya, dan bukan diatribusikan pada pengaturan yang menghasilkan berkas awal.
4. Lakukan proses kontrol, lalu bandingkan pasangannya
Periksa terlebih dahulu bahwa masukan sederhana berjalan sampai berkas atau respons yang diambil. Proses ini mengontrol metodenya. Tandai secara terpisah pemuatan pertama atau persiapan khusus: jangan membandingkan proses awal A secara lengkap dengan proses B yang semua elemennya sudah dimuat.
Jalankan kasus yang sama untuk A dan B. Bergantian urutannya jika alat memungkinkan, lalu ulangi beberapa pasangan yang menentukan dalam urutan terbalik. Pastikan bahwa hasil yang terisolasi atau keunggulan urutan tidak mengendalikan seluruh kesimpulan.
Catat juga kesalahan dan keluaran yang ditolak. Jika B gagal pada masukan besar, jangan menghapusnya dari tabel untuk meningkatkan rata-ratanya. Perbaiki penyebabnya jika memungkinkan dalam uji coba B2 yang terpisah. Dengan begitu Anda mempertahankan perbandingan yang mudah dibaca alih-alih folder tempat varian berubah seiring kesulitan.
5. Pisahkan hasil yang diterima dan waktu yang diamati
Periksa terlebih dahulu kualitas pada ukuran atau di alat yang digunakan. Jika memungkinkan, sembunyikan sementara nama A dan B saat penilaian. Seseorang dapat cukup meninjau keluaran dalam urutan yang diacak, lalu mengembalikan kecocokannya. Pertahankan kriteria yang diumumkan dan alasan singkat untuk setiap penolakan.
Untuk waktu, pilih definisi tunggal: misalnya dari peluncuran hingga keluaran lengkap yang tersimpan. Selanjutnya pisahkan kontrol manusia dan koreksi. Stopwatch di sekitar panggilan GPU tidak selalu mengukur komputasi yang selesai: dengan PyTorch/CUDA, operasi dapat bersifat asinkron. Gunakan metode pengukuran yang didokumentasikan oleh alat jika Anda ingin mengisolasi komputasi.
Jika pengulangan saling tumpang tindih atau pengukuran waktu tetap kasar, catat «perbedaan durasi tidak konklusif». Selisih kecil pada satu kali eksekusi tidak membenarkan persentase keuntungan yang disajikan sebagai pasti.
Contoh: 128 atau 256 token baru untuk asisten dokumenter
Sebuah tim kecil menginginkan jawaban lengkap atas dua belas pertanyaan tetap. Mereka mempertahankan model, dokumen, instruksi, dan GPU yang sama. Hanya batas jawaban yang berubah: A mengizinkan 128 token baru, B mengizinkan 256. Dalam Transformers, max_new_tokens membatasi generasi tanpa menghitung token dari teks masukan. Satu token bukan satu kata: batas tersebut tidak menentukan jumlah kalimat yang pasti.
Sebelum uji coba, tim menetapkan aturan ilustratif: setidaknya sepuluh jawaban yang diterima dari dua belas, dan tidak ada aturan yang dikarang. Tabel di bawah ini adalah skenario fiktif pembacaan hasil. Ini tidak menggambarkan asisten yang diukur dan tidak memprediksi efek nilai-nilai ini pada model Anda.
A mencapai minimum, B memperoleh lebih banyak jawaban yang diterima tetapi masih memiliki cacat kritis. Keputusannya adalah mempertahankan A untuk cakupan ini, dengan meninjau ulang jawaban, dan menyelidiki penyebab cacat B sebelum perbandingan lain. Panjang yang lebih besar bukan bukti kualitas maupun penyebab pasti dari hal yang dikarang.
Tim mengulang pertanyaan yang membedakan A dan B serta dua pertanyaan yang sudah berhasil. Jika cacat muncul juga dengan A, tim menangguhkan putusan: korpus awal tidak cukup untuk menetapkan kestabilan. Tim menyimpan jejak kedua proses alih-alih hanya menyimpan yang paling menguntungkan.
| Kriteria skenario | A: maksimum 128 token | B: maksimum 256 token |
|---|---|---|
| Respons yang diterima | 10 dari 12 | 11 dari 12 |
| Cacat kritis | 0 | 1 aturan yang dibuat-buat |
| Durasi | Perlu dicatat dalam sesi sebenarnya | Perlu dicatat dengan metode yang sama |
| Kepatuhan pada aturan yang diumumkan | Ya, dalam skenario terbatas ini | Tidak, meskipun totalnya paling baik |
Hindari kesimpulan yang tidak dapat dibuktikan oleh tes Anda
Jangan pilih B hanya karena salah satu outputnya spektakuler sementara yang lain menurun. Jangan ubah korpus di tengah jalan, jangan hitung dua pengulangan sebagai dua entri berbeda, dan jangan hapus kegagalan dari penyebut. Dua belas entri yang disajikan tetap dua belas kasus yang harus dijelaskan, meskipun sebagian tidak menghasilkan file apa pun.
Setelan yang dipilih berlaku untuk entri, versi, dan kriteria yang diuji. Setelan itu mungkin tidak lagi cocok untuk dokumen sepuluh kali lebih panjang atau untuk gambar yang berbeda. Tambahkan kasus representatif secara bertahap. Perkembangan ini memperluas cakupan pengujian; namun tidak mengubah tes kecil menjadi sertifikasi sistem.
Simpan keputusan singkat dan verifikasi berikutnya
Berkas akhir Anda berisi korpus, dua konfigurasi, output, putusan per identitas, dan beberapa baris kesimpulan. Sebutkan setelan yang dipilih, alasannya, dan batasnya : « A dipertahankan pada dua belas pertanyaan ini; dua jawaban masih perlu ditinjau; dokumen panjang tambahan tidak tercakup ». Orang lain harus dapat memahami pilihan tersebut tanpa menghadiri sesi.
Simpan A sebagai acuan untuk diagnosis berikutnya. Jika tidak ada varian yang memenuhi kriteria, jangan pilih satu pun untuk pengiriman; rumuskan hipotesis baru. Sisihkan waktu untuk penyalinan dan pemeriksaan sebelum memulai lanjutan ini. Uji coba yang selesai dengan batas yang jelas sudah menghasilkan keputusan; tidak harus dilanjutkan sampai menemukan pemenang.