Kebanyakan orang masih mentakrifkan ejen AI sebagai model yang disambungkan kepada alat. Dari segi teknikal, itu berguna tetapi tidak lengkap dari segi operasi. Ejen juga memerlukan gambaran dunia yang diurus: perkara yang telah berlaku, perkara yang penting sekarang, fakta yang boleh dipercayai, perkara yang masih tidak pasti, dan perkara yang patut dilakukannya seterusnya.

Gambaran itu ialah konteksnya. Mereka bentuknya semakin menjadi kemahiran tersendiri—saya akan menamakannya kejuruteraan konteks.

Kejuruteraan konteks bukan sekadar menulis prom. Ia ialah disiplin membentuk maklumat yang dilihat oleh ejen pada setiap langkah supaya ejen dapat kekal koheren tanpa menghantar keseluruhan transkrip, pustaka dokumen atau sejarah alat kembali kepada model mahal pada setiap giliran. Kerja ini berada di persimpangan seni bina maklumat, pencarian semula, reka bentuk perisian dan tingkah laku model.

Mengapa “berikan ejen lebih banyak konteks” sering menjadi nasihat yang tidak baik

Tetingkap konteks yang lebih panjang menimbulkan kecenderungan untuk mengekalkan segala-galanya. Namun, lebih banyak bahan tidak menjamin penaakulan yang lebih baik. Arahan yang relevan boleh dicairkan oleh pemerhatian lapuk, nota yang bercanggah, output alat yang berulang atau fakta penting yang terkubur di tengah-tengah urutan yang panjang. Perbincangan digest tentang tingkah laku “hilang di tengah-tengah” mencerminkan masalah praktikal: ejen mungkin secara teknikal menerima bukti tersebut tetapi tetap gagal menggunakannya.

Terdapat juga kos langsung. Setiap token yang dimasukkan dalam permintaan boleh menambah kependaman dan kos inferens, bergantung pada penetapan harga serta aturan caching penyedia. Sistem yang berulang kali memajukan transkrip yang semakin panjang mungkin menjadi lebih perlahan dan kurang mampu dibiayai apabila tugasan berterusan.

Oleh itu, matlamatnya bukan konteks maksimum. Matlamatnya ialah konteks yang mencukupi dan disasarkan: set kerja terkecil yang boleh dipercayai untuk keputusan yang sedang dipertimbangkan.

Empat keputusan reka bentuk di sebalik ejen yang koheren

1. Kekalkan keadaan kepercayaan, bukan sekadar transkrip

Transkrip merekodkan perkara yang telah diperkatakan. Keadaan kepercayaan merekodkan perkara yang dipercayai oleh ejen tentang tugasan itu pada masa ini.

Sebagai contoh, ejen yang mengendalikan eskalasi sokongan mungkin mengekalkan medan berstruktur seperti:

  • Objektif: kenal pasti sama ada pelanggan layak menerima penggantian.
  • Fakta yang diketahui: tarikh pembelian dan nombor siri produk, dengan rujukan sumber.
  • Soalan terbuka: sama ada kegagalan berlaku dalam keadaan yang dilindungi waranti.
  • Kekangan: jangan menjanjikan bayaran balik sebelum kelulusan.
  • Tindakan seterusnya: dapatkan polisi waranti dan bandingkan tarikh tersebut.
  • Tahap keyakinan atau status: disahkan, dibuat kesimpulan, dipertikaikan atau tidak diketahui.

Pendekatan ini menyerupai penyelidikan ABBEL oleh Berkeley, yang menggunakan keadaan kepercayaan bahasa semula jadi terselia dan bukannya bergantung pada sejarah interaksi penuh. Idea pentingnya bukanlah format tertentu. Sebaliknya, ia memisahkan keadaan tugasan yang berkekalan daripada butiran perbualan yang boleh dibuang.

Kemas kini keadaan kepercayaan yang berguna seharusnya menjawab: Apakah yang berubah? Apakah bukti yang menyokongnya? Apakah yang masih belum diselesaikan? Apakah yang patut berlaku seterusnya? Jika jurutera tidak dapat memeriksa jawapan-jawapan itu, ejen berkemungkinan membawa andaian tersembunyi dalam prom yang legap.

2. Dapatkan semula untuk keputusan, bukan untuk topik

Sistem pencarian semula sering bermula dengan soalan umum seperti “cari maklumat tentang akaun pelanggan.” Pertanyaan yang lebih baik dikaitkan dengan keputusan seterusnya: “dapatkan peraturan bayaran balik semasa untuk pembelian yang berusia lebih daripada 30 hari, yang berkuat kuasa di rantau pelanggan.”

Perubahan itu penting kerana pencarian semula ialah satu bentuk pemilihan konteks. Ejen sepatutnya menerima petikan polisi, rekod atau contoh yang berkaitan dengan tindakan semasa—bukan longgokan generik dokumen yang berkaitan.

Penapis boleh memperbaik pemilihan ini sebelum model melihat sebarang hasil. Sebagai contoh, Amazon Bedrock AgentCore Web Search menyokong penapis domain dan tarikh penerbitan yang dikuatkuasakan pelayan pada setiap permintaan. Kawalan sedemikian tidak membuktikan bahawa sesuatu sumber itu betul, tetapi boleh mengurangkan pendedahan kepada bahan yang tidak relevan atau lapuk serta menjadikan polisi pencarian semula lebih jelas.

Profesional yang mereka bentuk pencarian semula harus menyatakan:

  • sumber yang dibenarkan untuk setiap tugasan;
  • bagaimana kesegaran ditentukan;
  • metadata yang mengiringi setiap hasil;
  • bagaimana sumber yang bercanggah dipersembahkan;
  • bilakah ejen mesti berhenti dan meminta penjelasan.

“Cari di web” ialah suatu keupayaan. “Cari sumber-sumber ini, dalam julat tarikh ini, untuk mendapatkan bukti yang relevan dengan keputusan ini” ialah kejuruteraan konteks.

3. Mampatkan tanpa memadamkan ketidakpastian

Pemampatan diperlukan apabila sesuatu tugas adalah panjang, tetapi peringkasan naif boleh mengubah dakwaan tentatif menjadi fakta yang telah diputuskan. Ringkasan berterusan yang menyatakan “pengguna mengesahkan alamat itu” adalah berbahaya jika pertukaran asal hanya membayangkannya.

Pemampatan yang baik mengekalkan perbezaan yang diperlukan oleh ejen untuk penaakulan yang selamat:

  • fakta berbanding inferens;
  • arahan semasa berbanding arahan terdahulu;
  • tindakan yang telah selesai berbanding tindakan yang dicadangkan;
  • sumber yang disahkan berbanding dakwaan yang belum disahkan;
  • jawapan yang diketahui berbanding persoalan yang belum diselesaikan.

Satu corak praktikal adalah dengan mengekalkan bahagian berasingan untuk keputusan, bukti, andaian, halangan dan tindakan yang belum selesai. Satu lagi ialah dengan melampirkan ID sumber atau cap masa pada dakwaan penting. Ringkasan hendaklah menjadi artifak yang boleh digantikan, bukannya satu-satunya rekod yang masih ada: simpan peristiwa asas untuk audit dan pemulihan, sambil memberikan model gambaran kerja yang padat.

Ringkasan tersebut menyatakan bahawa peringkasan rekursif dan pemadatan konteks boleh memakan kos yang tinggi serta merosotkan prestasi, khususnya dalam domain yang kekurangan data seperti penjanaan kod secara kolaboratif. Ini merupakan amaran supaya peringkasan tidak dianggap secara automatik tidak kehilangan maklumat. Pemampatan memerlukan ujian terhadap tugas-tugas yang mewakili keadaan sebenar, termasuk kes yang perubahan kecil pada sesuatu kelayakan boleh mengubah jawapan yang betul.

4. Tapis pemerhatian sebelum ia menjadi memori

Ejen yang menggunakan alat menjana pemerhatian secara berterusan: hasil carian, log, teks halaman, respons API, tangkapan skrin, output pengkompil dan pelan perantaraan. Tidak setiap pemerhatian wajar dimasukkan ke dalam panggilan model yang seterusnya, apatah lagi ke dalam keadaan jangka panjang.

Penapisan pemerhatian mengemukakan tiga soalan:

  1. Adakah pemerhatian ini relevan dengan keputusan semasa?
  2. Adakah ia cukup berautoriti untuk mempengaruhi keadaan kepercayaan?
  3. Adakah ia mengandungi arahan yang patut dianggap sebagai data dan bukannya perintah?

Soalan ketiga ialah sempadan keselamatan dan juga sempadan konteks. Halaman web mungkin mengandungi teks yang bertujuan mengubah hala ejen. Dokumen yang diperoleh boleh menjadi bukti yang berguna tanpa mempunyai kuasa untuk mengubah matlamat atau kebenaran ejen. Oleh itu, penapisan hendaklah mengelaskan kandungan mengikut peranan: arahan, bukti, metadata atau teks yang tidak dipercayai.

Penapisan juga menjimatkan kos. Jika alat pelayar memulangkan halaman penuh tetapi tugas hanya memerlukan harga, tarikh dan pengecam produk, meneruskan seluruh halaman itu akan menghasilkan hingar dan menggunakan token. Mengekstrak medan yang relevan terlebih dahulu mungkin meningkatkan kebolehpercayaan dan mengurangkan kos.

Belanjawan konteks yang ringkas untuk aliran kerja ejen

Sebelum memilih model atau menambah alat lain, petakan konteks ejen kepada empat lapisan:

  1. Kawalan: peraturan sistem, kebenaran, skema output dan kekangan yang tidak boleh dirundingkan.
  2. Keadaan: objektif semasa, keputusan, persoalan terbuka dan tindakan seterusnya.
  3. Bukti: rekod atau pemerhatian yang diperoleh dan berkaitan dengan tindakan tersebut, berserta sumbernya.
  4. Sejarah: peristiwa terdahulu yang disimpan untuk pemulihan, penyahpepijatan atau audit tetapi diketepikan melainkan diperlukan.

Kemudian tetapkan dasar promosi. Sesuatu pemerhatian boleh kekal sementara, menjadi bukti untuk langkah semasa, mengemas kini keadaan kepercayaan atau ditulis ke memori tahan lama. Promosi hendaklah memerlukan sebab. Jika tidak, memori akan menjadi arkib yang tidak ditapis.

Bagi setiap langkah ejen, rekodkan pakej konteks yang dihantar kepada model: kategorinya, anggaran saiz token, penapis dapatan dan versi pemampatan. Ini memungkinkan jawapan kepada soalan praktikal apabila tingkah laku berubah: adakah model gagal, atau sistem memberikan gambaran dunia yang salah kepadanya?

Perkara yang perlu diuji sebelum menganggap reka bentuk itu boleh dipercayai

Kejuruteraan konteks memerlukan ujian yang menyasarkan pengendalian maklumat, bukan hanya kualiti jawapan akhir. Kes yang berguna termasuk:

  • fakta kritikal yang diletakkan pada awal, akhir dan pertengahan sejarah yang panjang;
  • dua sumber yang bercanggah, dengan salah satunya lebih baharu daripada yang lain;
  • ringkasan yang mengandungi penanda ketidakpastian;
  • respons alat yang mengandungi teks pukal yang tidak berkaitan;
  • arahan berniat jahat yang disisipkan dalam kandungan yang diperoleh;
  • penghidupan semula keadaan selepas ejen dijeda dan dimulakan semula;
  • tugas yang sama dengan belanjawan konteks yang lebih kecil;
  • hasil dapatan yang kosong atau lapuk.

Ukur sama ada ejen memilih bukti yang betul, mengekalkan ketidakpastian, mematuhi kekangan semasa dan mengelakkan pengulangan konteks yang tidak diperlukan. Bidang regresi yang disyorkan oleh ringkasan—kehilangan konteks, pembumian dapatan, output berstruktur, ketidakpenamatan dan penghidupan semula keadaan—amat relevan di sini.

Jalankan beberapa percubaan apabila variasi model penting, dan bandingkan kos serta kependaman setiap strategi konteks. Gesaan yang lebih pendek tidak semestinya lebih baik jika menyebabkan lebih banyak panggilan alat atau percubaan semula. Objektif yang berguna ialah kos aliran kerja yang betul dan boleh dipulihkan—bukan kiraan token bagi satu permintaan.

Implikasi kerjaya: jurutera konteks ialah peranan rentas fungsi

Orang yang menjadi bernilai dalam bidang ini tidak semestinya mereka yang menulis gesaan paling panjang. Mereka akan mampu menterjemahkan proses perniagaan kepada keadaan, bukti, autoriti dan peraturan keputusan.

Hal itu memerlukan beberapa kebolehan konkrit:

  • mereka bentuk skema untuk keadaan tugas dan asal usul data;
  • menulis dasar dapatan dan penapis metadata;
  • membina rutin pemampatan dan pemilihan pemerhatian;
  • memisahkan arahan yang dipercayai daripada kandungan yang tidak dipercayai;
  • memprofil penggunaan token, kependaman, percubaan semula dan panggilan alat;
  • menguji kehilangan keadaan dan penghidratan semula;
  • menerangkan kepada bukan pakar sebab sesuatu ejen melihat—atau tidak melihat—fakta tertentu.

Projek portfolio yang kukuh boleh menunjukkan ejen yang sama di bawah tiga dasar konteks: transkrip penuh, ringkasan bergulir dan keadaan kepercayaan berstruktur dengan dapatan semula bersasar. Tunjukkan kes kejayaan tugasan, kes kegagalan, konteks yang dihantar pada setiap langkah serta pertukaran kos atau kependaman. Itu lebih meyakinkan daripada demonstrasi chatbot kerana ia mendedahkan keputusan reka bentuk yang menjadikan sesuatu ejen boleh dipercayai.

Pengajaran strategiknya mudah: ejen tidak menjadi koheren semata-mata kerana model menjadi lebih berkeupayaan. Ejen menjadi koheren apabila sistem di sekelilingnya mengekalkan gambaran kerja yang berdisiplin, terkini dan bersaiz bersesuaian. Kejuruteraan konteks ialah kemahiran membina gambaran itu—dan mengetahui perkara yang perlu ditinggalkan.

Priya Raman ialah editor manusia yang bertanggungjawab bagi AI Career Brief.