Minggu ini Meta melancarkan Muse Code, ejen pengekodan berasaskan terminal yang dibina menggunakan model Muse Spark 1.2 miliknya, sekali gus meletakkannya dalam persaingan langsung dengan Claude Code daripada Anthropic, Codex daripada OpenAI, dan Cursor. Menurut kata-kata Mark Zuckerberg sendiri, tawarannya ialah ia mampu menangani "tugas kejuruteraan perisian lengkap merentas repositori besar: merancang perubahan, menulis kod, mengesahkan hasilnya." Perincian yang wajar kita teliti ialah cara ia mengendalikan tugasan besar: "Apabila sesuatu tugasan cukup besar, ia mengagihkannya kepada sub-ejen berasingan yang bekerja secara selari dalam worktree yang diasingkan. Salinan kerja anda tidak pernah disentuh." Zuckerberg mendakwa satu ujian menyaksikan sistem itu "membina enam ciri untuk sebuah permainan secara serentak tanpa perlanggaran" — ini dakwaan vendor, bukan penanda aras yang disahkan secara bebas, jadi anggap nombor khusus itu dengan skeptik. Namun, corak di sebaliknya memang nyata: kini inilah tawaran standard di seluruh industri, bukannya ciri eksklusif Meta.

Ini bermakna perbezaan antara alat-alat ini semakin mengecil dengan pantas. Rancang, kodkan, sahkan, selarikan — setiap makmal utama sedang menuju kepada gelung empat langkah yang sama. Jika anda membina kerjaya berasaskan "saya mahir membuat ejen melakukan kerja," kemahiran itu sedang dikomoditikan secara langsung oleh vendor-vendor itu sendiri. Perkara yang tidak dikomoditikan, dan yang sebenarnya tidak diselesaikan oleh mana-mana pelancaran ini, ialah apa yang berlaku selepas pengagihan tugas: seseorang masih perlu menentukan sama ada enam cebisan kod yang ditulis secara selari oleh enam sub-ejen yang tidak dapat melihat kerja satu sama lain itu betul secara individu dan koheren secara keseluruhan.

Worktree yang diasingkan menyelesaikan masalah konflik gabungan, bukan masalah ketepatan

Menjalankan sub-ejen dalam worktree berasingan ialah penambahbaikan kejuruteraan yang nyata — ia menghalang satu ejen daripada menindih suntingan ejen yang lain. Namun, ini juga bermakna ejen yang membina enam ciri tersebut langsung tidak dapat melihat keputusan satu sama lain semasa bekerja. Jika dua daripada mereka secara berasingan menambah fungsi pembantu yang serupa, memperkenalkan logik pengesahan yang sedikit berbeza untuk input yang sama, atau membuat andaian yang tidak serasi tentang bentuk data dikongsi, pengasingan tidak mengesan perkara itu — ia menangguhkan perlanggaran daripada menjadi "konflik gabungan" kepada "pepijat integrasi yang dihantar." Ini ialah mod kegagalan yang berbeza secara struktur daripada kegagalan yang direka untuk dicegah oleh alat-alat ini, dan inilah yang kini perlu dikesan oleh manusia.

Perkara ini perlu dijelaskan dengan tepat, kerana mudah untuk menyamakan "ejen mengesahkan outputnya sendiri" dengan "output itu telah disahkan." Ejen yang memeriksa bahawa kodnya boleh dikompil dan lulus ujian yang ditulisnya sendiri tidak sama dengan pemeriksa yang bertanya sama ada enam perubahan selari itu konsisten antara satu sama lain dan dengan seluruh pangkalan kod. Itu ialah tugas yang berbeza, dan hanya satu daripadanya yang sebenarnya dijual oleh harness ini.

Kemahiran yang sebenarnya semakin sukar diperoleh

Jika anda bekerja dalam atau sekitar bidang perisian — jurutera, PM, QA, sokongan teknikal, malah bukan jurutera yang kini menghantar alat kecil menggunakan ejen-ejen ini — implikasi praktikalnya ialah "menyemak output berbilang fail, berbilang ejen untuk memastikan konsistensi" sedang berubah menjadi disiplin tersendiri, berbeza daripada menulis kod dan berbeza daripada memberikan prompt yang baik kepada ejen. Beberapa komponennya yang konkrit:

  • Penentukuran kepercayaan. Mengetahui, sebelum membaca satu baris pun, jenis perubahan yang memerlukan semakan teliti (apa-apa yang menyentuh keadaan dikongsi, kontrak API, atau sesuatu yang mungkin turut disentuh oleh lebih daripada satu sub-ejen) berbanding jenis perubahan yang selamat untuk dibaca sepintas lalu.
  • Pembacaan perbezaan silang. Apabila sesuatu tugasan diagihkan kepada kerja selari, unit semakan bukanlah satu perbezaan — tetapi set perbezaan itu secara bersama. Ini bermakna anda perlu sengaja memeriksa logik yang diduplikasi, tingkah laku yang berbeza untuk input yang sama, serta penamaan atau andaian yang tidak konsisten merentas bahagian-bahagian tersebut, bukan sekadar membaca setiap fail secara berasingan.
  • Penulisan spesifikasi untuk pelaksana tanpa penyeliaan. Penyelesaian huluan bagi risiko perlanggaran ialah perihalan tugasan yang cukup tepat sehingga ejen selari tidak perlu berkoordinasi kerana sempadan mereka telah ditetapkan dengan betul sejak awal. Menulis spesifikasi sebegitu lebih hampir kepada kemahiran reka bentuk sistem berbanding kemahiran memberikan prompt.

Tiada satu pun perkara ini baharu secara abstrak — semakan kod dan reka bentuk antara muka sentiasa penting. Yang baharu ialah jumlahnya dan titik butanya: apabila seseorang boleh mencetuskan enam aliran kerja selari dalam satu petang, jumlah semakan merentas komponen yang diperlukan turut meningkat seiring dengannya, tetapi alat untuk memudahkan semakan merentas komponen belum mengejar alat yang memudahkan penjanaan selari.

Apa yang sebenarnya perlu dilakukan mengenainya bulan ini

Jika pasukan anda sedang menguji salah satu harness ini — Muse Code, Claude Code, Codex, atau pesaingnya — beberapa langkah kos rendah wajar dilaksanakan sekarang, sebelum tabiat menjadi kukuh:

  • Apabila menyemak kerja yang dijana ejen, tanya secara jelas "adakah perkara lain dalam tugasan ini menyentuh fail, fungsi, atau jenis dikongsi yang sama?" sebelum meluluskan — kebanyakan senarai semak semakan tidak menggesa perkara ini kerana ia ditulis untuk perbezaan yang dihasilkan oleh seorang pengarang.
  • Jika pasukan anda tidak mempunyai format spesifikasi bertulis untuk menyerahkan tugasan kepada ejen, tawarkan diri untuk merangka satu. Orang yang memiliki "cara kita memberi taklimat kepada ejen" akhirnya mempunyai pengaruh yang jauh lebih besar terhadap jumlah hutang semakan yang terkumpul oleh pasukan kemudian.
  • Kekalkan kefahaman tentang lebih daripada satu harness ini dan bukannya mempertaruhkan kelancaran anda pada mana-mana satu yang dipilih oleh majikan semasa. Tingkah laku mereka cukup berbeza — dalam pengendalian worktree, sejauh mana mereka mengagihkan kerja secara selari, dan perkara yang mereka kemukakan untuk semakan — sehingga beralih secara mengejut kemudian memakan masa yang nyata.

Tajuk utama daripada kitaran pelancaran ini akan berkisar tentang ejen makmal mana yang paling pantas atau paling murah. Isyarat kerjaya yang lebih berkekalan adalah lebih senyap: syarikat-syarikat yang menghantar alat ini semuanya secara jelas mengoptimumkan lebih banyak kod, dijana dengan lebih pantas, secara selari. Setakat ini, mereka tidak menghantar cara yang setara lebih baik untuk memeriksa konsistensi kod tersebut. Jurang itulah tempat permintaan pengambilan pekerja pusingan seterusnya akan muncul, dan ia akan muncul sebagai kemahiran semakan serta pemikiran sistem, bukannya kemahiran memberikan prompt.