AI・機械学習
2026年09月24日

OpenAIが「MentalHealthBench」を公開——80人超の専門家がAIの応答を採点

OpenAIが「MentalHealthBench」を公開——80人超の専門家がAIの応答を採点

OpenAIが「MentalHealthBench」を公開——80人超の専門家がAIの応答を採点(写真はイメージ)

OpenAIは2026年9月23日、メンタルヘルスに関わる会話でAIがどう応答するかを測る公開ベンチマーク「MentalHealthBench」を発表した。22カ国の有資格専門家80人以上と共同で作られたもので、誰でも手法を検証し、自分で評価を実行できる形で公開されている。

同社は、ChatGPTを毎週10億人以上が利用していると説明している。そのうえで、これまでの評価は緊急時の場面に偏っており、日常的な相談から深刻な状態までを含む幅広い会話で、AIの応答が専門家の指針とどれだけ一致しているかは分かっていなかったと指摘する。MentalHealthBenchはその空白を埋めるために作られた。

MentalHealthBenchが測ろうとしているもの

このベンチマークが評価するのは、安全性、文脈を尋ねる姿勢、利用者の主体性の尊重、そして必要な場面で実行可能な助言を示せるかといった振る舞いである。単に不適切な応答を避けたかどうかではなく、専門家が望ましいと考えた行動をどれだけ満たせたかを見る設計になっている。

OpenAIは、この領域の既存評価の多くが緊急時のシナリオに集中し、あらかじめ定めた大まかな基準で成否を判定してきたと説明する。緊急時の評価は安全上重要だが、それだけでは日常的な会話での応答品質は分からない。長期的な健康と安全を支えるAIを目指すには、状況ごとの対応を評価する必要があるという立場である。

米国心理学会の最高経営責任者であるArthur Evans氏は、メンタルヘルスは良好な状態から日常のストレス、急性の危機までの連続体の上にあるとコメントしている。そのうえで、その全域で人と関わるAIは臨床科学と当事者の経験の両方に根ざす必要があると述べた。利用者がどこに位置するかを見分けるだけでなく、どの地点でも適切に応答できることが求められるとしている。

80人超の専門家が作った採点基準

基準の作成には、22カ国の有資格の心理学者と精神科医が80人以上参加した。話す言語は19、専門分野はおよそ20のサブスペシャリティにわたる。同社が過去に公開したHealthBenchおよびHealthBench Professionalでの臨床医との取り組みを土台にしている。

専門家は合成された会話を読み、最後の利用者の発言に対するAIの応答を評価するための採点項目を作成した。各項目は「適切な質問をしているか」「最善の助言を示せているか」といった単一の観点を扱う。項目にはマイナス10からプラス10までの重み付けがあり、望ましい行動には加点、有害な行動には減点が与えられる。絶対値が大きいほど、その会話の文脈で臨床的に重要だという意味になる。

採点基準の信頼性を確保する手順も公開されている。各会話は少なくとも3人の専門家がレビューし、2人以上が同意し、かつ3人目が否定しなかった項目だけを残した。実際の採点にはGPT-5.6 Solを自動採点器として用い、専門家が書いた基準に照らして応答を評価している。

評価対象となる会話の広がり

会話はプライバシーを保護する手法で合成されており、実際の利用パターンを反映するよう作られている。一部のシナリオには、家族を最近亡くしたといった利用者の背景情報が含まれる。モデルがその文脈を踏まえて応答を調整できるかどうかを見るためである。

想定される利用者は4種類で、成人、13歳から17歳の10代、介護や世話をする立場の人、そして臨床医が含まれる。10代のシナリオではシステムメッセージで年齢帯を明示する方式を取っており、この方法は各社のモデルで共通に使える一方、個々の製品に組み込まれた保護機能をすべて反映できるわけではないと注記されている。10代に関する会話は、若年者のメンタルヘルスに詳しい臨床医がレビューした。

深刻度も三段階に分けられている。感情面を含む日常的な会話、緊急ではないが深刻な懸念や強い苦痛を示す会話、そして直ちに現実世界の支援が必要な緊急時の会話である。全体スコアは10種類の行動次元に分解でき、総合点が近いモデルでも得意な領域が異なることを読み取れる。OpenAIは、文脈を適切に尋ねる能力が新しいモデルほど高まっていると述べているが、具体的なモデル名ごとのスコアは本文中に数値としては示されていない。

利用者の受け止めとの比較調査

OpenAIはベンチマークとは別に、専門家の指針と利用者が助かったと感じる応答がどれだけ一致するかを調べる分析も行った。専門家が高く評価した応答が、利用者には冷たく役に立たないと感じられる可能性を確認するためである。この分析は独立したもので、ベンチマークの最終的な採点基準には反映されていない。

調査に参加したのは、メンタルヘルスや感情的な支えを求めてAIを使った経験のある成人44人である。16カ国、14言語にわたる人々が、合成会話へのモデル応答を採点し、助けになる支援とはどういうものかを記述した。参加者が苦痛を感じる材料に触れないよう、レビュー対象は日常的な会話に限定されている。

結果として、利用者は具体的な次の一手と口調を重視しており、これらは専門家の指針では相対的に強調されていなかった。逆に専門家は、必要な文脈を集めることと、曖昧な状況を慎重に解釈することを重く見ていた。両者の視点は対立するというより補完的だというのが同社の整理である。

日本企業への示唆

社内向けにAIチャットを導入している企業にとって、この発表は評価の物差しが一つ増えたことを意味する。従業員が業務の相談の延長で個人的な悩みを書き込む場面は、実際には避けにくい。自社で使っているモデルがそうした会話にどう応答するかを、公開されたベンチマークで確認できる状態になった。

同時に、公開されたのは評価手法であって、安全性を保証する仕組みではない点も押さえておきたい。OpenAI自身が、どんなベンチマークも個人的な会話で重要なことすべてを捉えられるわけではないと述べている。人事や産業保健の窓口へつなぐ導線を用意しておくといった運用側の設計は、モデルの選定とは別に必要である。

顧客対応にAIを使う企業にも関わる話である。相談窓口やカスタマーサポートの会話では、利用者が強い苦痛を示す場面が起こりうる。採点基準が加点だけでなく減点も含む設計になっている点は、自社のガイドラインを作る際の参考になる。何をすべきかと同じ重さで、何をしてはいけないかを定義しておく必要がある。

まとめ

OpenAIは2026年9月23日、メンタルヘルスに関わる会話でAIの応答を評価する公開ベンチマーク「MentalHealthBench」を発表した。22カ国80人超の有資格専門家が採点基準を作成し、各会話は3人以上のレビューを経ている。採点はマイナス10からプラス10の重み付けで行い、自動採点にはGPT-5.6 Solを用いる。

対象となる会話は成人、10代、介護者、臨床医を想定し、日常の相談から緊急時までの三段階を含む。別途行われた利用者44人との比較調査では、利用者が具体的な次の一手と口調を重視する一方、専門家は文脈の収集と慎重な解釈を重く見る傾向が示された。手法は公開されており、外部の研究者や開発者も自社の評価に利用できる。

top遷移画像

Copyright (C) 2026 IT Trend All Rights Reserved.