Penggunaan AI penting yang seterusnya mungkin tidak berjalan dalam kelompok awan gergasi. Sebaliknya, ia mungkin berjalan di dalam kamera, robot kilang, kenderaan, peranti perubatan atau terminal runcit, yang mengutamakan lebar jalur, kuasa, kependaman, privasi dan kos operasi berbanding memiliki model terbesar yang mungkin.
Peralihan itu mewujudkan jenis kerja AI yang berbeza. Pasukan masih memerlukan pembina model, tetapi mereka juga memerlukan orang yang boleh menyesuaikan model dengan perkakasan sebenar, mengukur kualiti di bawah kekangan, menyepadukan masa jalan inferens asli dan menentukan bila model yang lebih kecil sudah memadai untuk sesuatu tugas.
Inilah separuh perlumbaan model yang kurang menarik: bukan sekadar meningkatkan kecerdasan, tetapi menjadikan kecerdasan boleh digunakan.
Mengapa model yang lebih kecil mengubah persoalan penggunaan
Model awan selalunya boleh menggunakan lebih banyak pengkomputeran untuk menjawab sesuatu permintaan. Sistem terbenam tidak boleh mengandaikan sambungan rangkaian yang boleh dipercayai, bateri tanpa had atau bajet setiap panggilan yang besar. Robot yang menunggu beberapa ratus milisaat untuk setiap keputusan persepsi atau kawalan mungkin tidak selamat atau tidak berkesan. Produk yang menghantar setiap imej atau sampel audio kepada API mungkin menimbulkan kos privasi dan pemindahan data yang tidak boleh diterima.
Kekangan tersebut mengubah objektif kejuruteraan. Persoalannya menjadi: apakah model paling kecil yang memenuhi sasaran ketepatan, kependaman, memori, tenaga dan kebolehpercayaan yang diperlukan pada peranti sebenar?
Persoalan itu terpakai jauh melampaui alat pengguna. Ia penting bagi pengilang yang memeriksa komponen di barisan pengeluaran, syarikat logistik yang menjejaki peralatan, hospital yang memproses isyarat sensitif dan vendor perisian yang cuba menawarkan ciri AI tanpa menjadikan bil inferens sebagai kos berubah terbesar mereka.
Tiga teknik di sebalik peralihan ini
Pengkuantuman mewakili pemberat model, dan kadangkala pengaktifan, dengan nombor berketepatan lebih rendah. Peralihan daripada format seperti BF16 atau FP16 kepada perwakilan 8-bit atau 4-bit boleh mengurangkan keperluan memori dan mungkin meningkatkan daya pemprosesan, bergantung pada perkakasan dan pelaksanaannya. Pertukarannya ialah ketepatan lebih rendah boleh mengurangkan kualiti atau menimbulkan masalah berangka, jadi perkara ini mesti diuji dan bukannya diandaikan tidak berbahaya.
Penyulingan melatih model pelajar yang lebih kecil untuk meniru tingkah laku berguna daripada model guru yang lebih besar. Pelajar itu boleh belajar daripada output guru, isyarat perantaraan atau contoh khusus tugas. Ia tidak perlu mencipta semula setiap keupayaan model yang lebih besar; ia hanya perlu melaksanakan tugas sasaran dengan cukup baik.
Inferens dioptimumkan menyesuaikan pelaksanaan dengan masa jalan dan pemproses tertentu. Ini boleh merangkumi pemilihan kernel, penyusunan graf, pengumpulan kelompok, perancangan memori, pencachingan dan pecutan khusus perkakasan. TensorRT Model Connect daripada NVIDIA, yang diumumkan dalam pratonton awam, ialah salah satu contoh alat yang bertujuan menukar checkpoint Hugging Face atau tempatan yang disokong kepada inferens TensorRT hujung ke hujung tanpa eksport ONNX perantaraan. Sasaran yang dinyatakannya termasuk beban kerja robotik, peranti dan platform.
Teknik-teknik ini saling mengukuhkan. Penyulingan boleh menghasilkan model padat; pengkuantuman boleh mengurangkan lagi jejaknya; masa jalan yang dioptimumkan boleh menentukan sama ada model yang terhasil benar-benar pantas pada cip yang dimaksudkan.
Hasil yang berguna tidak sama dengan fail yang lebih kecil
Pemampatan model harus dianggap sebagai usaha produk dan sistem, bukannya helah papan pendahulu. Model yang 40 peratus lebih kecil tetapi gagal mengesan objek penting dalam pencahayaan yang buruk mungkin lebih teruk untuk robot gudang. Model bahasa yang murah bagi setiap token tetapi menghasilkan output berstruktur yang cacat mungkin menambah kerja pembaikan hiliran. Model yang berprestasi baik dalam penanda aras mungkin gagal apabila pendikitan terma, hingar kamera, ketersambungan yang tidak menentu atau input pengguna yang luar biasa muncul.
Laporan Liquid AI tentang penyulingan yang menyedari pengkuantuman untuk model kecil LFM2.5 miliknya ialah gambaran berguna tentang matlamat tersebut. Syarikat itu melaporkan bahawa 96.5% hingga 97.4% prestasi BF16 dikekalkan sambil mengekalkan penggunaan memori dan daya pemprosesan Q4_0. Angka tersebut dilaporkan oleh syarikat dan khusus kepada model; angka itu tidak sepatutnya digeneralisasikan kepada setiap seni bina. Namun, angka tersebut menunjukkan jenis perbandingan yang patut dicari oleh pengamal: pengekalan kualiti diukur bersama memori dan kelajuan, bukannya nisbah pemampatan semata-mata.
Bagi sesuatu penggunaan, ujian penerimaan hendaklah merangkumi sekurang-kurangnya:
- kualiti tugas pada contoh yang mewakili dan sukar;
- keperluan memori puncak dan storan;
- kependaman respons pertama dan keadaan mantap;
- daya pemprosesan di bawah keserentakan yang realistik;
- penggunaan tenaga atau tingkah laku terma apabila berkaitan;
- tingkah laku kegagalan apabila input tiada, bising atau di luar taburan;
- kos dan beban operasi untuk mengemas kini model.
Metrik tepat berbeza mengikut produk. Kamera mungkin mengambil berat tentang bingkai sesaat dan negatif palsu. Antara muka suara mungkin mengambil berat tentang masa respons hujung ke hujung. Robot mungkin mengambil berat tentang tarikh akhir gelung kawalan dan tingkah laku sandaran yang selamat. Intinya adalah menghubungkan penilaian model dengan akibat fizikal atau kewangan daripada kegagalan.
Tempat kerja baharu muncul
Peluang yang semakin berkembang ini tidak terhad kepada mereka yang mencipta seni bina. Ia merangkumi beberapa peranan praktikal:
- Jurutera inferens membuat profil model pada pemecut sasaran, memilih masa jalan, mengoptimumkan graf, serta mendiagnosis kesesakan latensi atau memori.
- Jurutera pemampatan model mereka bentuk saluran paip pengkuantitian dan penyulingan, memilih data penentukuran, serta mengukur kehilangan kualiti mengikut tugas dan segmen.
- Jurutera ML pinggir membungkus model untuk persekitaran mudah alih, terbenam, perindustrian atau automotif, serta mengurus kemas kini dalam keadaan ketersambungan terhad.
- Jurutera perisian robotik menghubungkan model persepsi kepada penderia, sistem perancangan dan kekangan keselamatan apabila pemasaan amat penting.
- Jurutera produk sedar perkakasan menentukan sama ada beban kerja patut dijalankan pada peranti, di pinggir atau dalam awan—serta mereka bentuk penyerahan yang lancar antara ketiga-tiganya.
- Pakar penggunaan dan pengesahan membina suite ujian yang merangkumi keadaan terma, kuasa, rangkaian dan persekitaran dunia sebenar.
Terdapat juga kerja untuk pembangun aplikasi. Pasukan produk mungkin tidak melatih model, tetapi mereka tetap perlu memilih format model, menyepadukan pustaka inferens, mengendalikan operator yang tidak disokong, mendedahkan tingkah laku keyakinan atau penolakan, serta memastikan peningkatan boleh dikembalikan.
Pembahagian awan-pinggir menjadi kemahiran reka bentuk
Model kecil tidak menghapuskan model awan. Sebaliknya, model kecil menjadikan sistem hibrid lebih menarik. Peranti mungkin menggunakan model padat untuk pengesanan segera, kemudian menghantar peristiwa terpilih kepada model yang lebih besar untuk penjelasan atau analisis yang lebih mendalam. Robot mungkin mengekalkan persepsi kritikal keselamatan secara setempat sambil menggunakan awan untuk pembelajaran peringkat armada. Produk sokongan pelanggan mungkin menghalakan pengelasan rutin kepada model kecil dan meningkatkan kes yang kabur kepada model yang lebih berkeupayaan.
Seni bina ini boleh mengurangkan lebar jalur dan latensi, tetapi memperkenalkan keputusan yang memerlukan pemilikan yang jelas. Apakah maklumat yang dihantar keluar dari peranti? Apakah yang berlaku tanpa ketersambungan? Versi model manakah yang menghasilkan sesuatu tindakan? Bolehkah peranti berundur dengan selamat? Bagaimanakah prestasi dipantau apabila setiap konfigurasi perkakasan berkelakuan secara berbeza?
Ini ialah soalan penggunaan, bukan semata-mata soalan model. Ia memberi ganjaran kepada golongan profesional yang memahami antara muka antara pembelajaran mesin, sistem terbenam, rangkaian, keperluan produk dan operasi.
Laluan pembelajaran praktikal
Jika anda mahu bergerak ke arah kerja ini, bina satu penggunaan yang kecil tetapi boleh diukur dan bukannya hanya mengumpulkan sijil model. Mulakan dengan tugas yang mempunyai sasaran jelas, seperti pengelasan imej, pengecaman kata kunci, pengkategorian dokumen atau pembantu setempat yang padat.
- Tetapkan garis dasar. Catat kualiti, saiz model, penggunaan memori, latensi dan daya pemprosesan menggunakan set ujian yang boleh dihasilkan semula.
- Kuantumkan model itu. Bandingkan sekurang-kurangnya satu versi berketepatan lebih rendah dengan garis dasar. Dokumentasikan contoh yang berubah dan sama ada ralat tertumpu dalam kategori penting.
- Cuba penyulingan atau penalaan halus khusus tugas. Ukur sama ada model yang lebih kecil dapat mengekalkan tingkah laku yang sebenarnya diperlukan oleh produk.
- Jalankannya pada perkakasan sasaran. Penanda aras desktop bukan bukti tentang telefon, mikrokomputer, GPU, pemecut atau komputer robot.
- Bungkus penggunaan itu. Sertakan prapemprosesan, pascapemprosesan, metadata versi, pemeriksaan kesihatan dan laluan sandaran.
- Tulis laporan pertukaran. Jelaskan sebab model yang dipilih mengatasi pilihan lain dari segi kualiti, latensi, memori, tenaga, privasi dan kos—bukan sekadar sebab model itu mempunyai skor terbaik.
Alat yang berguna bergantung pada timbunan sasaran, tetapi kemahiran yang boleh dipindahkan adalah konsisten: pemprofilan, penaakulan berangka, pemilihan data, reka bentuk ujian, penyahpepijatan dan komunikasi pertukaran yang jelas. Belajarlah membaca graf model, memeriksa sokongan operator, mengenal pasti pergerakan memori sebagai kesesakan, serta membezakan pengiraan teori daripada latensi hujung ke hujung yang diukur.
Isyarat kerjaya
Peralihan kerjaya yang penting ialah daripada bertanya, "Model manakah yang paling pintar?" kepada bertanya, "Sistem manakah yang memberikan hasil yang diperlukan di bawah kekangan sebenar?" Model besar akan kekal bernilai, terutamanya untuk penaakulan terbuka dan penjanaan kompleks. Namun, banyak tugas komersial dan dunia fizikal cukup khusus sehingga model yang padat, pantas dan peribadi boleh menjadi produk yang lebih baik.
Hal ini membuka ruang untuk pengamal yang boleh merapatkan jurang antara penyelidikan dan penggunaan. Pemenang tidak semestinya pasukan yang mempunyai model terbesar. Mereka mungkin pasukan yang memahami beban kerja, memampatkan model secara bijak, menjalankan penanda aras dengan jujur dan menghantar sistem yang boleh dipercayai pada perkakasan yang tersedia.
Untuk kerjaya dalam AI, itu ialah pengajaran yang berkekalan: kecerdasan hanyalah satu bahagian daripada hasil yang disampaikan. Bahagian yang satu lagi ialah memastikan ia sesuai.