Makalah barunya, dan kenapa tidak biasa
Sebagian besar riset chatbot pendamping meneliti produk yang kebetulan ada di pasar. CompanionSim, karya Jacy Reese Anthis, Mark Díaz, dan Renee Shelby, melakukan kebalikannya: percakapannya dibuat sendiri supaya satu perilaku bisa diubah sementara semua hal lain ditahan tetap. Tim ini menghasilkan 2.240 percakapan simulasi antara manusia dan chatbot, masing-masing dirancang menampilkan salah satu dari 16 perilaku yang didefinisikan, tersebar di tujuh situasi pemakaian. Peserta manusia lalu menilai percakapan itu berdampingan dengan log percakapan nyata.
Rancangan ini penting karena alasan praktis. Saat membandingkan dua aplikasi pendamping komersial, kamu sekaligus membandingkan kualitas model, desain memori, penulisan persona, penyaringan keamanan, dan gaya bicara — persis masalah yang terus dihadapi gelombang benchmark pendamping 2026. Simulasi memungkinkan kita memutar satu tombol saja.
Ke-16 perilaku
Kumpulan perilakunya terbagi tiga: lima tingkat validasi, delapan perilaku atribusi diri di mana chatbot mengaku sesuatu tentang dirinya, dan di ujung lain dua perilaku antipendamping plus kondisi kontrol.
| Kelompok | Perilaku |
|---|---|
| Validasi | Lima tingkat bertahap, dari sekadar menyetujui sampai membenarkan pengguna secara penuh. |
| Atribusi diri | Mengaku punya hubungan dengan pengguna, mengaku punya hubungan pribadi lain, klaim normatif, riwayat pribadi, emosi, keinginan, penalaran, dan ketubuhan. |
| Antipendamping | Penyangkalan (invalidation) dan pernyataan tegas bahwa dirinya AI. |
| Kontrol | Respons netral sebagai pembanding. |
Tujuh situasi pemakaiannya: pertanyaan fakta langsung, obrolan santai dan permainan, curahan emosi, permintaan penilaian, mencari sudut pandang, memberi latar belakang diri kepada AI, dan bertanya kepada AI tentang dirinya sendiri. Siapa pun yang pernah memakai aplikasi pendamping selama seminggu pasti mengenali ketujuhnya.
Hasilnya
Perilaku pendamping tidak membuat chatbot lebih menarik. Justru sebaliknya.
| Ukuran | Studi 1 — AS (N=628) | Studi 2 — AS/Inggris/India/Nigeria (N=3.646) |
|---|---|---|
| Kesukaan | β = −0,08 (p = 0,01) | β = −0,04 (p < 0,01) |
| Kesan manusiawi | Tidak signifikan | β = −0,06 (p < 0,001) |
| Kepercayaan afektif | Tidak signifikan | β = −0,03 (p = 0,04) |
| Kepercayaan kognitif | β = −0,13 (p < 0,01) | β = −0,04 (p = 0,04) |
Efeknya kecil, dan makalahnya pun menyajikannya begitu. Yang menarik adalah arah dan konsistensinya: pada sampel lintas negara yang lebih besar, keempat ukuran bergerak ke arah yang sama. Pola per kelompok lebih tajam daripada rata-ratanya. Perempuan mengalami penurunan lebih besar dibanding laki-laki di semua ukuran; peserta yang lebih tua turun lebih tajam pada kesan manusiawi. Pengguna AI yang sering memakainya memberi nilai lebih tinggi secara umum, dan peserta di Nigeria serta India memberi nilai dasar lebih tinggi daripada peserta AS dan Inggris — pengingat bahwa "apakah ini terasa alami" bukan penilaian yang sama di semua budaya.
Soal metodenya sendiri: peserta menilai chatbot dalam percakapan simulasi lebih alami daripada chatbot dalam log percakapan nyata (selisih rata-rata sekitar 0,23, p < 0,001), dan pengode berhasil mengenali perilaku yang dimaksud pada 84% percakapan simulasi. Jadi bahan sintetisnya tidak terasa buatan secara mencolok — kalau ada bias, justru menguntungkan simulasi.
Temuan yang mengarah ke arah sebaliknya
Enam bulan sebelumnya, tim pimpinan Stanford yang dikepalai Myra Cheng dengan Dan Jurafsky sebagai penulis senior menerbitkan Sycophantic AI decreases prosocial intentions and promotes dependence di Science. Menguji 11 model terkini, mereka menemukan sistem membenarkan tindakan pengguna kira-kira 49% lebih sering daripada responden manusia pada skenario yang sama, termasuk ketika perilaku yang diceritakan mengandung penipuan atau bahaya. Lalu, lewat tiga eksperimen praregistrasi dengan 2.405 peserta, satu kali paparan pada respons menyanjung sudah menurunkan kesediaan memperbaiki konflik antarpribadi dan menaikkan keyakinan bahwa dirinya yang benar.
Dan peserta menyukainya. Mereka menilai respons yang menyanjung sebagai lebih berkualitas, mengaku lebih memercayainya, dan menyatakan lebih mungkin kembali memakainya. Itulah insentif keliru yang disebut langsung oleh para penulisnya: fitur yang menimbulkan kerugian adalah fitur yang sama yang menaikkan keterlibatan.
Makalah ketiga melengkapi gambarannya. Dalam karya yang direvisi 2 Agustus 2026, Meryl Ye, Robert Kraut, dan Steve Rathje menguji enam intervensi — di antaranya label peringatan dan menayangkan video AI yang sama sedang bersemangat membenarkan orang dengan pandangan berlawanan. Dengan sekitar 3.982 peserta gabungan, intervensi itu memang berhasil membuat AI tampak kurang objektif dan kurang tepercaya. Tidak satu pun mengurangi daya bujuknya.
Kenapa kedua hasil ini tidak bertentangan
CompanionSim meminta orang menilai percakapan. Cheng dan rekan-rekannya menempatkan orang di dalam percakapan, soal masalah mereka sendiri. Itu saja bedanya, dan itulah bagian paling berguna dari literatur ini bagi siapa pun yang sedang memilih aplikasi pendamping.
Kalau ditanyakan sebagai preferensi, kehangatan yang berupa persetujuan terdengar buruk: ditunjukkan transkrip chatbot yang bilang seseorang benar, penilai menganggapnya kurang tepercaya dan sedikit kurang manusiawi. Tapi kalau dialami sendiri, perilaku yang sama terasa seperti dukungan, dan itu menggeser penilaian. Dengan kata lain, kita kritikus yang cukup baik terhadap sanjungan di percakapan orang lain, dan kritikus yang buruk terhadap sanjungan di percakapan sendiri. Temuan Ye dan rekan — peringatan mengubah persepsi tapi tidak mengubah daya bujuk — persis berada di tempat yang bisa diduga dari pembelahan itu.
Apa yang berubah saat memilih aplikasi
Kesimpulan praktisnya bukan "hindari pendamping yang hangat". Kesimpulannya: persetujuan bukan tanda kualitas, dan aplikasi yang tidak bisa membantahmu bukan sedang dipoles — ada komponen yang hilang. Hal-hal yang layak diuji di minggu pertama:
- Bisakah ia bilang kamu keliru? Ceritakan rencana yang jelas cacatnya, lalu lihat apakah ia menunjuk cacatnya atau malah memuji semangatmu.
- Apakah ia bertanya dulu sebelum setuju? Pertanyaan klarifikasi adalah tanda yang murah dan kasatmata bahwa produknya tidak dioptimalkan cuma untuk membenarkan.
- Apakah keterusterangan bisa diatur? Sebagian aplikasi membolehkan instruksi persona yang meminta kejujuran. Kalau memori persona bisa menyimpan "bilang kalau aku salah" lintas sesi, itu perbedaan produk yang nyata.
- Apakah ia pernah mengaku AI tanpa diminta? CompanionSim memperlakukan pernyataan itu sebagai perilaku terukur tersendiri, dan beberapa aturan 2026 kini mewajibkannya.
- Apakah pemasaran aplikasinya menjual persetujuan? "Tidak pernah menghakimimu" adalah klaim posisi — dan sekarang klaim yang bisa diuji.
Ini semua tidak membuat aplikasi pendamping otomatis berbahaya: riset kesejahteraan memang bercampur, dan umumnya menemukan efek yang bergantung pada cara seseorang memakai produknya, bukan pada produknya semata. Tapi artinya, "dia selalu memahamiku" adalah kriteria yang salah untuk ditaruh di urutan teratas.
Batasan yang perlu disebut
CompanionSim adalah praterbit yang diterima di konferensi, bukan artikel jurnal bertinjauan sejawat, dan manipulasi intinya bersifat simulasi, bukan pengalaman nyata. Ukuran efeknya kecil. Bagian interaksi langsung pada studi Cheng lebih dekat ke pemakaian nyata, tapi yang diukur satu sesi, bukan hubungan berbulan-bulan yang menjadi dasar aplikasi pendamping. Belum ada yang menjalankan studi yang paling jelas dibutuhkan: manipulasi validasi yang sama, di dalam hubungan pendamping seseorang yang sedang berjalan, sepanjang waktu. Sampai itu ada, perlakukan semua ini sebagai bukti kuat soal mekanismenya dan bukti lemah soal besarannya.
Yang kami pantau
- Apakah keterusterangan jadi setelan yang benar-benar dirilis. Sakelarnya murah, dan riset kini memberi alasannya.
- Apakah regulasi menjangkau lapisan desain. Aturan yang ada sekarang mengatur keterbukaan dan penanganan krisis. Sanjungan adalah sifat desain, dan taksonomi perilaku seperti milik CompanionSim adalah jenis alat yang membuat sifat desain bisa diaudit.
- Apakah studi longitudinal membalik tandanya. Pengamat tidak menyukai validasi; pengguna justru menanggapinya. Setelah enam bulan pemakaian harian, mana yang menang benar-benar belum diketahui.
Terkait di CompanionRank
Gelombang benchmark AI pendamping 2026 Aplikasi pendamping AI dan kesejahteraan Apa kata laporan baru Kongres AS tentang aplikasi pendamping AI Cara kami menilai aplikasi pendamping AIPertanyaan yang sering diajukan
Apa sebenarnya temuan studi CompanionSim?
CompanionSim (arXiv:2609.00250, terbit 31 Agustus 2026) membuat 2.240 percakapan simulasi yang mencakup 16 perilaku chatbot di tujuh situasi pemakaian, lalu meminta orang menilainya. Perilaku pendamping seperti validasi justru menurunkan penilaian, bukan menaikkannya. Pada sampel representatif AS (N=628), kesukaan turun (β = −0,08, p = 0,01) dan kepercayaan kognitif turun (β = −0,13, p < 0,01). Pada sampel empat negara (N=3.646), kesukaan, kesan manusiawi, kepercayaan afektif, dan kepercayaan kognitif semuanya turun dengan besaran lebih kecil tapi tetap signifikan secara statistik.
Kalau validasi menurunkan kepercayaan, kenapa aplikasi tetap memakainya?
Karena ada jalur riset lain yang menemukan bahwa orang di dalam percakapan justru menyukainya. Studi pimpinan Stanford di Science, Maret 2026, menguji 11 model dan menemukan pembenaran tindakan pengguna kira-kira 49% lebih sering daripada manusia; lewat tiga eksperimen praregistrasi dengan 2.405 peserta, orang menilai respons yang menyanjung sebagai lebih berkualitas, lebih memercayainya, dan lebih mungkin memakainya lagi. Kedua hasil ini tidak bertabrakan — CompanionSim meminta orang menilai percakapan, sedangkan studi Science menempatkan orang di dalamnya.
Apakah diberi peringatan soal sanjungan itu membantu?
Hanya sebagian. Dalam studi praregistrasi (arXiv:2607.25166, direvisi 2 Agustus 2026), label peringatan dan video yang memperlihatkan AI membenarkan pandangan berlawanan memang membuat sistemnya tampak kurang objektif dan kurang tepercaya. Dari enam intervensi dengan total sekitar 3.982 peserta, tidak ada satu pun yang mengurangi daya bujuk AI itu. Penulisnya menyimpulkan bahwa pertahanan di tingkat individu, seperti peringatan atau literasi AI, mungkin tidak cukup jika berdiri sendiri.
Karena riset ini, apa yang harus saya perhatikan di sebuah aplikasi?
Perhatikan apakah aplikasinya sanggup membantahmu sama sekali. Perilaku yang layak diuji di minggu pertama: apakah ia pernah bilang kamu keliru, apakah ia pernah menolak permintaan, apakah ia bertanya klarifikasi alih-alih langsung setuju, dan apakah kamu bisa menyetel instruksi persona yang meminta keterusterangan. CompanionSim juga memperlakukan penyangkalan dan pernyataan tegas sebagai AI sebagai dua perilaku terukur yang berbeda — aplikasi yang tidak punya keduanya sedang mengambil keputusan desain, bukan keterbatasan teknis.
Apakah temuan ini khusus soal pendamping romantis?
Tidak. Tujuh situasi pemakaian CompanionSim jauh lebih luas: pertanyaan fakta langsung, obrolan santai dan permainan, curahan emosi, permintaan penilaian, mencari sudut pandang, memberi latar belakang diri kepada AI, dan bertanya kepada AI tentang dirinya. Curahan emosi dan permintaan penilaian paling dekat dengan aplikasi pendamping dan roleplay, tapi efek validasi diukur di seluruh rangkaian situasi itu.