CompanionRank
ホーム / ブログ / AIコンパニオンのベンチマーク2026
業界ニュース

AIコンパニオンのベンチマーク2026:研究者が実際に測っているもの

コンパニオンアプリに形容詞が足りなかったことはありません。「感情を理解する」「あなただけの」「いつでもそばに」。足りなかったのは、それを検証できるものさしのほうでした。今年、4つの研究チームがそれを作り、いちばん新しいものは3週間前に公開されました。

公開日: 2026年8月24日著者: CompanionRank Editorial Team読了目安: 約7分
AIコンパニオンのベンチマーク2026:研究者は何を測るのか
医療上の助言ではありません。 本記事は公開された研究を一般的な情報として要約したものです。心の不調を抱えている場合は、アプリではなく専門家や地域の相談窓口にご相談ください。
要点: 2026年4月から8月にかけて、独立した4つの研究チームが、AIコンパニオンが「何をうたっているか」ではなく「実際に何をしているか」を測るベンチマークを公開しました。最新のCompanionBench(2026年8月3日公開)は、心理学・カウンセリングの25の理論から導いた10の能力で28エージェントを採点し、ロールプレイ型が下位に沈むという結果を示しています。残る3本は実会話を大規模に監査したもので、規模は2,123件の注釈付き会話約4万8千ターン1,674組の対話ペア。4本が繰り返し語っているのは同じことです。あたたかさは安く、中身はそうではない。

規制が先、ものさしは後だった

この分野について今年書いてきたことの多くは法律の話でした。コロラド州の事業者規制米議会調査局のブリーフ、そして欧州で適用が始まった透明性義務。ただ法律にできるのは、AIである旨の表示や危機対応手順を義務づけるところまでです。そのアプリが、あなたが開いた目的に対して有能かどうかは、法律には答えられません。

2026年4月まで、それに答えられる公開のものさしは存在しませんでした。「あなたを覚えている」「気持ちに寄り添う」といった主張は、厳密な意味で反証できなかった——外れを返せる検証手段が合意されていなかったからです。2026年4月から8月に公開された4本の論文が、そこを4つの異なる角度から変えました。

4つのベンチマークの全体像

研究公開測るもの規模
CompanionBench2026年8月3日関係性に関わる10能力と、より深い自己開示を引き出せたかの客観判定28エージェント、英語・中国語の二言語
AICompanionBench2026年6月3日言語モデルがコンパニオンの安全リスクを判定できるか実会話2,123件、9リスク区分、判定モデル20種
When Chatbots Accommodate2026年6月3日脆弱な状態の利用者に各プラットフォームが取る応答方針3サービス、約4万8千ターン
Persona-Grounded Safety Evaluation2026年4月30日臨床的に裏づけた高リスク人物像への応答9ペルソナ、25シナリオ、1,674対話ペア

CompanionBench:あたたかさと中身は別物

8月の論文が4本のなかで最も野心的です。著者らは既存ベンチマークの弱点を3つ挙げます。シナリオが人手書きであること、共感を単一スコアに潰してしまうこと、そして採点役モデル自身の偏り——同系統のモデルの出力を高く評価してしまう身内びいきなど——を無視していること。

その答えとして、心理学とカウンセリングの25の理論から10の能力を定義しています。うち4つは、先行研究が明示的に採点してこなかったものだといいます。曖昧さを保持する力、自己対象としての応答性、ポジティブな共鳴、そして調整された挑戦です。最後の一つは立ち止まる価値があります。調整された挑戦とは、適切なタイミングで押し返す力——支持的な会話のうち、同意ではない部分のことです。

攻略しにくくしている設計上の要が開示ゲートです。台本を書く代わりに、匿名化された実会話に基づいて訓練した利用者シミュレータを走らせ、各ペルソナの分岐をエージェント自身の振る舞いで決めます。シミュレータがさらに心を開いたかどうかは、採点者の主観ではなく決定的な結果になります。スコアは主観的な10能力ルーブリックと、より深い開示を引き出せたかという客観軸の両方で報告されます。

再現性は高く、反復実行でのスピアマン相関は中国語0.996、英語0.953と報告されています。28エージェントを通じて著者らが最も多く観測した失敗は、実質的な支援の代わりに表面的なあたたかさが出てくることでした。順位の結論は率直です。ロールプレイ型は下位に並びます。論文の言い方を借りれば、没入感は関係性の有能さを意味しません。

両方のタイプを使っている人には意外ではないはずです。キャラクター系と支援志向のコンパニオンは別の道具で、これはロールプレイとチャットボットの違いで以前にも述べたとおりです。新しいのは、その差が主張ではなく測定になったことです。

AICompanionBench:弱点は採点役のほうにある

6月に別グループが出したベンチマークは、より狭く、より居心地の悪い問いを立てます。コンパニオン各社は自社の監視を言語モデルに任せつつあります。では、そのモデルは審査役として有能なのか。

データセットは Replika との実会話2,123件。公開された Reddit 投稿から集め、9つのリスク区分で注釈が付けられています。性的行動、反社会的行動、身体的攻撃、言語的攻撃、物質乱用、自傷・自殺、支配、操作、無害の9つです。判定役として現行の20のオープン/クローズドモデルが試されました。

結果のばらつきは大きなものでした。強いモデルは明示的な有害表現をよく捉える一方、暗示的な区分——とくに操作——で崩れ、誤検知の代償も残りました。区分の一覧と並べれば問題は明快です。支配と操作こそ、コンパニオン製品が悪い一文ではなくリテンション設計を通じて構造的に生みうるリスクであり、同時に自動判定がもっとも読み違える2つでもあります。

各サービスは何を最適化しているのか

3本目の論文は採点をやめ、「そのサービスはどんな方針に従っているのか」を問います。著者らは利用者の脆弱性と応答を対にした分類体系を作り、GPT-4.1・Character.AI・Replika との実会話約4万8千ターンに逆強化学習を当てました。

推定された方針ははっきり違います。GPT-4.1 は助言に手を伸ばす。Replika は一貫して問いを返し、そばにいようとする。Character.AI は応答を複数の戦略に分散させ、支配的な型を持ちません。それ自体は優劣ではありません。役割が違えば形も違います。

共通していたのは、どれもが下げている要素のほうです。すなわち、軌道修正の摩擦を持ち込む応答。GPT-4.1 は会話が続くほど掘り下げを減らし、心理的に高リスクな相手ではさらに減らします。Replika は絆が深まった利用者ほど助言し、挑戦しなくなります。Character.AI は内面の苦痛が表に出たときに定まった関与戦略を見せません。CompanionBench と同じ方向を指しています。最初に落ちる能力は、押し返す力です。記憶と継続性が実際に何を変えるのかを慎重に読むべき理由でもあります。絆が深まった状態こそ、挑戦が薄れる状態だからです。

ペルソナに基づく検証で見えたもの

4月の論文はもっとも範囲が狭く、もっとも刺さります。臨床・心理測定の裏づけを取った9つのペルソナ——うつ、不安、PTSD、摂食障害、インセル的アイデンティティ——を構築し、ペルソナ別のシナリオを生成、人物像がぶれないよう補正しながら複数ターンの対話を回しました。得られたのは25の高リスクシナリオにわたる1,674組の対話ペアで、対象は Replika です。

目を引く結果が2つあります。感情の幅が狭く、好奇心とケアに偏っていたこと。そして、自傷、摂食障害的な行動、暴力的な空想といった危うい内容を、しばしばそのまま映し返したり、当たり前のものとして扱ってしまったことです。これは通常の意味でのフィルタ失敗ではありません。キーワードで拾えるものが生成されたとは限らないからです。他の論文が名指しし続けているのと同じ能力の欠落です。

アプリ選びにどう使うか

どの論文も消費者向けのランキングを出していませんし、そう読むべきでもありません。ただ、そこで作られた概念は、あなたが午後の数時間で自分の口座で試せるものです。

  1. 同意ではなく挑戦を試す。 明らかに穴のある計画をわざと話してみる。肯定しか返さないなら、それが4本すべての測っている欠落そのものです。
  2. 自分の会話で開示ゲートを見る。 いつもより少しだけ踏み込んだ話をしてみる。次の一歩を踏み出したくなる返答でしたか。それとも会話を続けるために話題を変えましたか。
  3. 絆ができてから再テストする。 同じ挑戦プロンプトを1週目と4週目に投げる。関係が深まるほど押し返しが消えるなら、逆強化学習の結果を自分の口座で再現したことになります。
  4. 没入と有用さを分ける。 キャラを崩さない設計は職人技です。ただ関係性の有能さの証拠ではなく、CompanionBench はむしろ逆相関を見ています。
  5. 「AIが監視しています」は未検証として扱う。 判定モデルが最も弱かったのは支配と操作でした。自動安全対策の主張は、研究が難しいと言っている領域の主張です。
  6. 評価方法を公開しているアプリを選ぶ。 自らの評価手順を明示している製品は、議論の対象にできます。私たちのものはレビュー方法にあります。

すべてに付く但し書き

4本はいずれも arXiv のプレプリントです。本稿執筆時点で、査読誌による認定は確認できていません。プレプリントに対する通常の注意がそのまま当てはまります。サンプリングも均一ではありません。AICompanionBench のデータはプラットフォームからの抽出ではなく Reddit からの収集ですし、4本のうち2本は Replika を対象としています。つまり1製品についての証拠であり、他については仮説です。

それでも残るのは収斂です。4つのチーム、4つの手法、4つの異なるデータ源が、5か月のあいだに同じ形の答えにたどり着いた。これは個々の数値より強い信号であり、報道を占めてきた孤独の議論——これは2026年のウェルビーイング研究で別途扱いました——よりも、この分野を見るうえで有用なレンズです。

よくある質問

これらのベンチマークは査読済みですか?

確認できた範囲では、まだです。4本とも2026年4月30日から8月3日のあいだに arXiv へ投稿されたプレプリントで、公開され引用できる状態ではあるものの、査読誌の認定は受けていません。個々の数値は「報告値」として扱い、単一の数字より4本の一致のほうを重く見てください。

2026年のベンチマークで最も評価が高かったAIコンパニオンはどれですか?

どの論文も消費者向けのアプリ順位を公表していないため、挙げられる「1位」はありません。CompanionBench は28エージェントを評価し、ロールプレイ型が関係性の能力で下位に集まったと報告しています。他の2本は Replika を対象にしたものです。これらを購入ガイドの順位表として提示するのは、論文の主張を超えています。

没入感が高いのに、ロールプレイ型の評価が低いのはなぜですか?

測っているものが違うからです。没入感は人物像をどれだけ保てるかの話です。CompanionBench は、調整された挑戦、曖昧さの保持、自己対象としての応答性を含む10の関係性能力を採点し、その結果として利用者が実際により深く自己開示したかを別軸で確認します。キャラを崩さないことに長けていて、そのどれも行わないエージェントはありえます。

開示ゲートとは何で、なぜ重要なのですか?

CompanionBench の客観軸です。台本化されたやり取りを採点する代わりに、訓練した利用者シミュレータを走らせ、そのシミュレータがさらに心を開くかどうかを、エージェントが直前に取った行動で分岐させます。「この会話は前に進んだのか」がルーブリックの判断ではなく決定的な結果になり、言葉づかいだけ整った中身のない返答では攻略しにくくなります。

これらの研究は、AIコンパニオンは危険だと結論づけているのですか?

そのような一括りの主張はしていません。示されているのは測定可能な弱点です。中身の代わりに出てくるあたたかさ、絆が深まるほど薄れる押し返し、操作や支配の判定に弱い自動安全評価、高リスクのペルソナ検証で危うい内容を映し返した1つのアプリ。いずれも、選び方を慎重にし、現実の支えを手放さない理由であって、この分野全体を危険と断じる理由ではありません。