+8618675556018

GPT-4 はチューリング テストに不合格: インテリジェントな会話の分野には課題が残る

Nov 06, 2023

人工知能のスーパースターである ChatGPT は、前進を続ける中で、次のような疑問に直面しています。人間の応答と区別できない出力を生成するためのチューリング テスト基準を満たしているか? 最新の調査によると、ChatGPT はその優れたパフォーマンスにもかかわらず、そのしきい値を完全には超えていないようです。

カリフォルニア大学サンディエゴ校の2人の研究者、言語、意味論、機械学習の専門家であるキャメロン・ジョーンズと認知科学教授のベンジャミン・バーゲンは、70年前のチューリングの研究を参照しながらこの質問をした。 チューリングは、機械が他人を人間だと思い込ませるのに十分なレベルの知能と会話能力を達成できるかどうかを判断するプロセスを提案しました。

彼らのレポートのタイトルは「GPT-4 はチューリング テストに合格しますか?」です。 これは、arXiv プレプリント サーバーにあります。 この研究では、650人の参加者を集めて、参加者が別の人間またはGPTモデルと短い会話をし、誰と話しているのかを判断するよう求められる1,400の「ゲーム」をプレイさせた。

研究者たちが発見したことは注目に値するものだった。 GPT-4 モデルは 41 パーセントの確率で参加者を騙しましたが、GPT-3.5 は 5 ~ 14 パーセントの確率で参加者を騙しただけでした。 興味深いことに、人間は試験の 63% で参加者に自分たちが機械ではないことを納得させることに成功しただけでした。

「GPT-4がチューリングテストに合格したという証拠は見つかりませんでした」と研究者らは結論付けました。 しかし、チューリングテストは、円滑な社会的相互作用や欺瞞を測定するためのフレームワークとして、機械による会話の効果を評価する上で、そしてこれらのデバイスに適応するための人間の戦略を理解する上で依然として価値があると彼らは指摘している。

ただし、多くの場合、チャットボットは引き続き説得力のある方法でコミュニケーションできるだろうと彼らは警告しています。 「41パーセントの成功率は、特に人間が人間と話していない可能性に対する警戒心が低い状況では、AIモデルがすでに欺く能力を備えている可能性があることを示唆している」と研究者らは指摘している。 人間を忠実に模倣する AI モデルは、社会的および経済的に広範な影響を与える可能性があります。」

研究者らは、AI を人間と正しく識別した参加者がいくつかの要素に注目していることを観察しました。 形式的すぎるモデルや非公式すぎるモデルは疑惑を引き起こします。 参加者の表現が冗長すぎたり簡潔すぎたり、文法や句読点が異常に優れていたり、「説得力がないほど」貧弱だったりする場合も、参加者が人間と対話しているのか機械と対話しているのかを判断する重要な要素となります。 さらに、参加者は一般的すぎると思われる回答にも敏感でした。

研究者らは、AI モデルがより流動的になり、人間のような癖をより多く吸収するにつれて、追跡 AI モデルがますます重要になるだろうと示唆しています。 「欺瞞につながる要因の特定と、それを軽減する戦略がますます重要になるだろう」と彼らは述べた。 この研究は、インテリジェントな会話の分野が依然として課題に直面していることを明らかにしていますが、AI モデルをどのように改善できるかについての有益な洞察も提供します。

お問い合わせを送る