Deni The Setiawan
AI,  Tutorials

Trik Ubah GLM-5.3-Flash Jadi Model Keputusan Kilat Ala Jev

Author

Deni Setiawan

Date Published

Bikin LLM Biasa Jadi "Otak Cepat" buat Keputusan Instan

Tim Privatemode baru merilis tulisan teknis soal cara mengubah GLM-5.3-Flash — model open-weight biasa — jadi model keputusan super cepat yang setara dengan model khusus seperti Jev (TypeSafe), lengkap dengan confidence score, tanpa perlu fine-tuning tambahan.

Beberapa poin kuncinya:

  • Trik utamanya ada di cara membaca output model. Prompt dibuat dalam format JSON dengan opsi-opsi yang dinomori, lalu jawaban di-"prefill" sampai token choice_index: — jadi token berikutnya yang harus diprediksi model pasti berupa indeks pilihan.
  • Dari posisi token itu, sistem langsung mengambil distribusi probabilitas (logit) di semua opsi yang mungkin — bukan menunggu model men-generate jawaban token demi token seperti biasa.
  • Hasilnya latensi turun drastis, sekitar 180-300ms per keputusan, karena nggak butuh multi-token output atau reasoning chain panjang.
  • Akurasinya setara model decision khusus: cuma beda 0,7 poin persen dari Jev di 28 dataset benchmark yang diuji.
  • Teknik ini bisa langsung jalan di endpoint vLLM apa pun tanpa fine-tuning, dan mendukung input multimodal (gambar plus teks) — sesuatu yang belum dimiliki model decision konvensional.
  • Setiap keputusan juga dapat confidence score per opsi, jadi enak dipakai buat logika fallback di pipeline production.

Sumber: