AI di perangkat · 8 menit baca

Bagaimana model bahasa bisa muat di ponsel

Aplikasi AI lokal meminta ruang penyimpanan yang mengejutkan banyaknya, dan alasannya bukan pemborosan. Memahami ke mana gigabyte itu pergi juga menjelaskan mengapa model terasa cepat di ponsel baru dan lambat di ponsel lama — dan apa yang sebenarnya diberitahukan oleh nama file Q3_K_S kepada Anda.

Model adalah tumpukan angka yang sangat besar

Model bahasa adalah kumpulan parameter yang dipelajari — bobot. Masing-masing adalah sebuah angka, dan jumlahnya miliaran. "2B" dalam nama model berarti kira-kira dua miliar parameter.

Disimpan dengan presisi penuh, setiap bobot memakan 4 byte. Dua miliar bobot, masing-masing 4 byte, berarti sekitar 8 GB — dan itu untuk model yang tergolong kecil di kelasnya. Itulah masalahnya dalam satu baris: file-nya besar karena angkanya sangat banyak dan setiap angka di antaranya disimpan dengan presisi tinggi.

Kuantisasi: lebih sedikit bit per angka

Kuantisasi menyimpan setiap bobot dengan bit yang lebih sedikit. Alih-alih 32 bit per bobot, Anda memakai 8, atau 4, atau 3 — dengan faktor skala untuk tiap blok bobot agar hasil pendekatannya tetap dekat dengan aslinya.

Pengurangan ukurannya kira-kira linear:

Ini kompresi lossy, seperti JPEG. Dorong cukup jauh dan artefaknya mulai terlihat — pada model bahasa, artefak itu muncul sebagai jawaban yang lebih kabur, pengulangan, atau melenceng dari pertanyaan.

Kuantisasi tidak membuat model menjadi bodoh secara merata. Ia membuat model kurang presisi, dan ketidakpresisian muncul lebih dulu pada masukan tersulit.

Membaca nama file

Nama seperti Q4_K_M atau Q3_K_S adalah resep, bukan nomor versi:

Jadi Q3_K_S adalah k-quant 3-bit ukuran kecil: dikompresi secara agresif, dipilih ketika muat di perangkat lebih penting daripada beberapa persen terakhir dari kualitas.

GGUF: wadahnya

GGUF adalah format file yang menampung bobot terkuantisasi beserta metadata yang dibutuhkan runtime — tokeniser, arsitektur, templat prompt. Satu file, tanpa direktori konfigurasi yang menyertai.

Ini penting bagi ponsel karena GGUF dirancang untuk bisa dipetakan ke memori. Alih-alih membaca 1,7 GB ke dalam RAM, runtime memetakan file itu ke ruang alamatnya dan sistem operasi memuat bagian yang benar-benar dipakai. Karena itu model yang lebih besar daripada RAM bebas sebuah ponsel tetap bisa berjalan, dan karena itu pula jawaban pertama setelah aplikasi dibuka lebih lambat daripada berikutnya — halamannya masih diambil.

Mengapa ponsel menjadi hangat

Menghasilkan satu kata — satu token — berarti menjalankan masukan melewati miliaran parameter itu. Lalu mengulanginya lagi untuk token berikutnya. Jawaban seratus kata berarti seratus kali lintasan.

Itu aritmetika terus-menerus pada CPU atau akselerator neural, dan justru itulah beban yang paling buruk ditangani ponsel secara termal. Perangkat menurunkan kecepatan saat panas, jadi proses panjang tanpa jeda makin lama makin lambat. Aplikasi lokal yang dibuat dengan baik mengatur ritme kerjanya — memberi jarak antartugas agar chip bisa mendingin — bukan mengantrekan semuanya rapat-rapat.

Mengapa ponsel lama kesulitan

Tiga kendala, dan ketiganya keras:

Karena itu aplikasi AI lokal menyebutkan perangkat minimum alih-alih mencoba mendukung semuanya. Di bawah titik tertentu, pengalamannya bukan sekadar menurun, melainkan tidak bisa dipakai.

Pertukaran yang Anda lakukan

Model terkuantisasi seukuran ponsel tidak akan menandingi model cloud besar dalam penalaran yang berat. Untuk tugas yang terbatas — apa arti kata ini dalam kalimat ini, terjemahkan frasa ini — model itu lebih dari cukup, dan ia punya tiga sifat yang tidak bisa ditawarkan model cloud: bekerja tanpa koneksi, tidak memungut biaya per penggunaan, dan teksnya tidak pernah meninggalkan perangkat.

Itulah keseluruhan tawar-menawar AI di perangkat. Anda melepaskan model terbesar yang mungkin, dan Anda mendapat privasi, kemampuan offline, dan bebas kuota.

Bagaimana ClickBook melakukannya

ClickBook menyertakan model GGUF terkuantisasi dan menjalankannya lewat llama.cpp di perangkat Anda. Di iOS, model ikut di dalam aplikasi, jadi tidak ada yang perlu diunduh. Baca lebih lanjut tentang pembaca e-book dengan AI lokal, atau lihat cara kerja ClickBook.