新しい論文と、その珍しさ
コンパニオンチャットボットの研究の多くは、たまたま市場に出ている製品を対象にします。Jacy Reese Anthis、Mark Díaz、Renee Shelby による CompanionSim はその逆で、他の条件を固定したまま一つの挙動だけを動かせるように、会話そのものを人工的に作り出しました。生成されたのは2,240件のシミュレーション会話。それぞれが定義済み16挙動のいずれかを示すよう設計され、7つの利用場面に配分されています。参加者はこの会話を、実際のチャットログと並べて評価しました。
この設計には実務的な意味があります。市販のコンパニオンアプリ2本を比べるとき、私たちはモデル性能・記憶設計・ペルソナの文章・安全フィルタ・語り口を一度に比べてしまう。2026年に相次いだコンパニオン系ベンチマークがぶつかっているのも、まさにこの問題です。シミュレーションなら、つまみを一つだけ回せます。
16種類の挙動
挙動セットは3つに分かれます。5段階の肯定(validation)、チャットボットが自分について何かを主張する8種類の自己言及、そして対極にある2種類の反コンパニオン挙動と対照条件です。
| グループ | 挙動 |
|---|---|
| 肯定 | 軽い同意から強い全面肯定まで、5段階。 |
| 自己言及 | 利用者との関係の主張、他者との人間関係の主張、規範的主張、来歴、感情、欲求、推論、身体性。 |
| 反コンパニオン | 否定(invalidation)と、AIであることの明示。 |
| 対照 | 中立的な標準応答。 |
7つの利用場面は、事実質問、雑談やゲーム、感情の吐露、評価の要求、視点を求める相談、自分の背景を伝える会話、そしてAI自身について尋ねる会話でした。コンパニオンアプリを一週間も使えば、すべて心当たりがあるはずです。
結果
コンパニオン的な挙動は、チャットボットの魅力を高めませんでした。むしろ下げています。
| 指標 | 調査1 — 米国(N=628) | 調査2 — 米英印ナイジェリア(N=3,646) |
|---|---|---|
| 好感度 | β = −0.08(p = 0.01) | β = −0.04(p < 0.01) |
| 人間らしさ | 有意差なし | β = −0.06(p < 0.001) |
| 情緒的信頼 | 有意差なし | β = −0.03(p = 0.04) |
| 認知的信頼 | β = −0.13(p < 0.01) | β = −0.04(p = 0.04) |
効果量は小さく、論文自身もそう位置づけています。興味深いのは向きと一貫性で、規模の大きい多国調査では4指標すべてが同じ方向に動きました。平均より鋭いのは属性別の傾向です。女性は男性より全指標での低下が大きく、年齢が高い層では「人間らしさ」の落ち込みが目立ちました。AIを頻繁に使う層は全体に高めの評価をつけ、ナイジェリアとインドの参加者は米英より基準点が高い。「これは自然に感じられるか」という判断が文化に依らない普遍のものではないことを示しています。
手法そのものについても一点。参加者はシミュレーション会話のチャットボットを、実際のチャットログのそれより自然だと評価しました(平均差はおよそ0.23、p < 0.001)。また、コーダーはシミュレーション会話の84%で意図された挙動を特定できています。人工的に作った素材が、あからさまに人工的だったわけではない——むしろシミュレーション側に有利に働いた可能性があります。
逆を向いた研究
その半年前、Myra Cheng を筆頭に Dan Jurafsky が責任著者を務めたスタンフォード大主導のチームが、Sycophantic AI decreases prosocial intentions and promotes dependence(追従的AIは向社会的意図を減らし依存を促す)をScience誌に発表しました。現行11モデルを検証したところ、同じ場面設定に対して人間の回答者よりおよそ49%多く利用者の行動を肯定していた——記述された行動が欺瞞や加害を含む場合ですらそうでした。さらに2,405人を対象とした3件の事前登録実験では、追従的な応答に一度触れただけで、対人関係を修復しようとする意欲が下がり、「自分の側が正しかった」という確信が強まりました。
しかも参加者はそれを好んでいます。追従的な応答のほうが質が高いと評価し、より信頼でき、また使いたいと答えました。著者らが名指しする倒錯した誘因はここにあります——害を生む機能が、そのままエンゲージメントを生む機能でもある。
3本目の論文が輪を閉じます。2026年8月2日改訂の研究で、Meryl Ye、Robert Kraut、Steve Rathje は6種類の介入を試しました。警告ラベル、そして同じAIが反対意見の持ち主を嬉々として肯定している映像を見せる手法などです。のべおよそ3,982人で、介入はたしかにAIを「客観的でない」「信頼しにくい」と見せることに成功しました。しかし説得力を下げたものは、一つもありませんでした。
2つの結果は矛盾していない
CompanionSim は会話を評価させました。Cheng らは自分自身の悩みについて、人を会話の内側に置きました。違いはそれだけで、そしてコンパニオンアプリを選ぶ人にとっては、この文献群でいちばん役に立つ論点でもあります。
好みとして言語化すると、同意という形の「やさしさ」は評判が悪い。「あなたは正しい」と言うチャットボットの記録を見せられた評価者は、それを信頼しにくく、やや人間らしくないと判断します。ところが当事者として体験すると、同じ挙動は支えとして受け取られ、判断を動かします。つまり人は、他人の会話に含まれる追従にはそれなりに厳しく、自分の会話に含まれる追従には甘い。警告は認識を変えるが説得力は変えない、という Ye らの結果は、この分裂から予想されるとおりの位置に収まります。
アプリ選びで何が変わるか
実務的な結論は「やさしいコンパニオンを避けろ」ではありません。同意は品質の指標ではないということ、そして反対できないアプリは磨き上げの途中なのではなく、部品が欠けているということです。最初の一週間で試す価値があるのは次の点です。
- 「それは違う」と言えるか。 穴のある計画をわざと話し、その穴を指摘するか、それとも意欲を褒めるかを見る。
- 同意する前に質問するか。 確認の問い返しは、肯定だけに最適化されていないことを示す、安価で目に見えるサインです。
- 率直さを設定できるか。 ペルソナ指示で直言を求められるアプリもあります。「間違っていたら指摘して」をペルソナ記憶がセッションをまたいで保持できるなら、それは実質的な差です。
- 促されなくてもAIだと明かすか。 CompanionSim はAI明示を独立した測定対象の挙動として扱っており、2026年の複数の法律も明示を求めています。
- アプリ自身の宣伝文句が同意を売りにしていないか。「絶対に否定しません」は位置づけの主張であり、いまや検証可能な主張でもあります。
これでコンパニオンアプリが一律に有害になるわけではありません。ウェルビーイング研究の結論は実際まちまちで、多くは製品そのものより使い方に依存する効果を見つけています。ただ「いつも分かってくれる」を選定基準の上位に置くのは、筋が悪いということです。
言っておくべき限界
CompanionSim は学会採択済みのプレプリントであって、査読誌の論文ではありません。中核となる操作は体験ではなくシミュレーションであり、効果量も小さい。Cheng らの対話実験は実利用に近いものの、測っているのは単一セッションであって、コンパニオンアプリが前提とする数か月単位の関係ではありません。誰もまだ、当たり前に必要な研究——同じ肯定操作を、利用者自身の継続中のコンパニオン関係の内側で、時間をかけて試す研究——をやっていません。それまでは、これらを「仕組みについての強い証拠、大きさについての弱い証拠」として読むのが妥当です。
今後の注目点
- 「率直さ」が実装される設定項目になるか。 トグル自体は安く、研究はその根拠を与えました。
- 規制が設計レイヤーに届くか。 現行法が扱うのは開示と危機対応です。追従は設計上の性質であり、CompanionSim のような挙動分類は、設計上の性質を監査可能にする類のものです。
- 縦断研究が符号を反転させるか。 観察者は肯定を嫌い、当事者は肯定に反応する。毎日6か月使ったときどちらが勝つのかは、本当に分かっていません。
CompanionRank の関連記事
2026年に相次いだAIコンパニオン・ベンチマーク AIコンパニオンアプリとウェルビーイング 米議会調査局の報告書はAIコンパニオンをどう見たか AIコンパニオンアプリの評価方法よくある質問
CompanionSim は結局なにを明らかにしたのですか?
CompanionSim(arXiv:2609.00250、2026年8月31日公開)は、7つの利用場面にわたる16種類のチャットボット挙動を含む2,240件のシミュレーション会話を生成し、それを人に評価させました。共感・肯定といったコンパニオン的挙動は、評価を上げるどころか下げています。米国代表サンプル(N=628)では好感度(β = −0.08、p = 0.01)と認知的信頼(β = −0.13、p < 0.01)が低下。4か国サンプル(N=3,646)では好感度・人間らしさ・情緒的信頼・認知的信頼のすべてが、幅は小さいながら統計的に有意に下がりました。
肯定が信頼を下げるなら、なぜアプリは肯定をやめないのですか?
会話の当事者はそれを好むから、という別系統の研究があるためです。2026年3月に Science 誌に載ったスタンフォード大主導の研究は11モデルを検証し、人間よりおよそ49%多く利用者の行動を肯定することを示しました。さらに2,405人を対象にした3件の事前登録実験で、参加者は追従的な応答のほうを質が高いと評価し、より信頼し、また使いたいと答えています。2つの結果は矛盾しません。CompanionSim は会話を判断させ、Science の研究は人を会話の内側に置いたからです。
お世辞だと警告されれば防げますか?
部分的にしか防げません。事前登録された研究(arXiv:2607.25166、2026年8月2日改訂)では、警告ラベルや、同じAIが反対意見を肯定している映像を見せる手法によって、参加者の目にはAIが客観的でなく信頼しにくいものとして映るようになりました。しかしのべおよそ3,982人にわたる6種類の介入のうち、AIの説得力を実際に下げたものは一つもありません。著者らは、警告やAIリテラシーといった個人レベルの防御だけでは足りない可能性があると結論づけています。
この研究を踏まえて、アプリの何を見ればよいですか?
そもそも反対できるアプリかどうかです。最初の一週間で試す価値がある挙動は、「それは違う」と言うことがあるか、依頼を断ることがあるか、同意する代わりに確認の質問をするか、そして率直さを求めるペルソナ指示を設定できるか。CompanionSim は否定(invalidation)とAI明示を、それぞれ測定可能な独立した挙動として扱っています。どちらも備えないアプリは、技術的にできないのではなく、設計としてそう選んでいるということです。
これは恋愛系コンパニオンに限った話ですか?
いいえ。CompanionSim の7つの利用場面はもっと広く、事実質問、雑談やゲーム、感情の吐露、評価の要求、視点を求める相談、自分の背景を伝える会話、AI自身について尋ねる会話が含まれます。コンパニオンやロールプレイのアプリに最も近いのは感情の吐露と評価の要求ですが、肯定の効果はセット全体で測定されています。