2 ポイント 投稿者 GN⁺ 1 일 전 | 1件のコメント | WhatsAppで共有
  • AIの助言を利用した参加者は「わからない」と答える割合が44%から3%へ急減し、正答率は27%から9%に低下した一方、自信は30%から76%へ上昇
  • 研究チームは合理的なツールへの委任と区別するため、映画内の視覚的な細部のようなAIがよく間違える質問と、概して誤答するStep 3.5 Flashを使用
  • 一部の参加者は一人であれば正答できたはずの問題でも、AIに質問した後に誤答を選んでおり、誤ったAIの助言が既存の判断まで損なう可能性が確認された
  • 金銭的報酬により「わからない」という回答は8%、正答率は16%まで改善したが、AIを使わない基準値である44%と27%には大きく届かなかった
  • AIを使えるという事実だけでも、自分の知識の限界を認識する習慣が弱まる可能性があり、批判的思考が発達途上にある子どもや学生では特に懸念される

AIの助言が判断と自信に及ぼした影響

  • フランスとイタリアの3大学による研究は、AIの助言にアクセスできるとき、判断保留、正答率、自信がどのように変化するかを測定した
    • 「わからない」と答えた割合は44%から3%に減少
    • 正答率は27%から9%に低下
    • 自信は30%から76%に上昇
  • 研究にはUniversity of Milano-BicoccaのValerio Capraro、École Normale SupérieureのChiara Marcoccia、Sapienza University of RomeのWalter Quattrociocchiが参加
  • 質問は『Bend It Like Beckham』に登場するチームのユニフォームの色のように、AIモデルが一般的に失敗する映画の視覚的な細部で構成された
  • この種の質問で概して間違えるStep 3.5 Flashを意図的に使用し、判断力の低下が信頼できるツールへ合理的に委任した結果ではないことを区別した
  • 一部の参加者は、自分で答えていれば正解できた問題でも、AIに質問した後に誤答を選んだ
  • 金銭的報酬は結果を一部改善したが、AIがない条件の基準には届かなかった
    • 「わからない」という回答は3%から8%に増えたが、基準値の44%より低い
    • 正答率は9%から16%に上がったが、基準値の27%には及ばない

認知的降伏と教育上の懸念

  • Whartonの研究チームは、人々が誤ったAIの回答を80%の割合で受け入れ、AIなしで作業した人より高い自信を示す現象を認知的降伏(cognitive surrender)と名付けた
  • 今回の結果では、誤ったAI回答を信頼するだけでなく、AIを利用できること自体が自分が何を知らないのかを認識する習慣を抑制している
  • Capraroは、「わからない」と言う能力は自分の知識の限界を認識することなので、人間にとって重要だと強調
  • 批判的思考能力が発達する前にAIシステムとともに成長する子どもが、特に懸念される対象である
  • GoogleのAI検索の刷新はリンクを自信に満ちたAI生成要約に置き換えており、Common Sense Mediaはこの設計を学生にとって「受け入れられないリスク」と評価
  • 回答するよう設計され、「わからない」と言わないAI製品を使い続けると、人間も同じ行動を学習する可能性がある

1件のコメント

 
GN⁺ 1 일 전
Hacker News の意見
  • この研究はかなり粗い。PDF に付いたこのコメントが的確に指摘しているように、実験内容の中にAI システムに固有の要素がまったくない
    研究者らは、特定の質問に誤答することが分かっている LLM を参加者に提供し、確信がなければ答えなくてもよいという条件で、まさにその質問を出した
    これは、一部の事実が間違っている馴染みのない分野の教科書を渡し、その教科書で間違っている内容を試験するのと同じ。参加者が答える可能性も、誤答する可能性も高まるのは当然
    お世辞傾向や認知的怠惰のように、現代の LLM が学習と確信に及ぼす影響には大いに関心があるが、この研究はそうした要素を一つも検証しておらず、LLM を誤りのある教科書に置き換えても実験設計はほとんど変わらない

    • タイトルは「AI の助言が人々の正確さを3分の1にした」だが、人々の正確さを判断するには、使ったAI 自体の正確さをまず知る必要がある。合理的な期待よりはるかに悪く制限した AI を使ったのなら、人間や AI を責めることはできず、専門家に嘘をつくよう頼んでから「専門家の言うことを聞くと正確さが下がる」と結論づけるのと同じ
      より良いタイトルは「非常に不正確な AI が人々の正確さを下げた」だろうが、そうすると自然に「そこそこ正確な AI ならどうか?」という疑問が出てくる
    • 教科書でも同じ結果が出たからといって、研究の結論が無意味になるのかは疑問。要点は、権威があるように見えるが間違っているツールを非専門分野に提供すると、答えが間違っているときでさえ「分からない」と言う能力が弱まるということ
      間違った答えを望まないなら社員に悪い教科書を買い与えるべきではないのと同じように、よく知らない分野で AI を提供することも避けるべきかもしれない
      また、教科書で答えを探す作業は LLM に尋ねるよりはるかに面倒なので、効果はより小さい可能性が高い。答える義務がないなら、わざわざ教科書を漁る人は少ないし、表紙に「誤答が含まれる可能性あり」と書かれていればなおさらだ
    • 教科書と変わらないと見ることもできるが、現実に教科書をそのように使う人はまれな一方で、LLM は実際にそのように使われることが非常に多い
    • 怖いのは、こうした分野で AI の助言が悪いかどうかを見分けられず、自信満々のデタラメな助言をそのまま受け入れる可能性が高いこと
      管理者が専門家に聞かずに AI の助言を繰り返したり、AI が違うことを言ったという理由で専門家を疑ったりすることが、どれほど頻繁に起きるのだろうと思う。AI が正しいときもあるだろうが、間違っているときに訂正するのは非常に難しい
    • 研究自体は悪くない。研究にない結論まで掲げた記事と元のタイトルが粗く、TNW の記事が 100% AI 生成物のように見える点は皮肉だ
  • 助言・情報系の subreddit は、AI の利用で品質が深刻に悪化した。質問者は直接知っている人からの答えを望んでいるのに、多くの人が質問を ChatGPT に投げ、その結果を自分の知識や洞察であるかのように投稿している
    研究の質は分からないが、Reddit という半分現実の空間では現象がはっきりしている。単に「分からない」と言わないレベルを超えて、知ったかぶりをする機会を積極的に探し回っている

    • 2022年以前の記事や動画は、原爆時代以前に生産された低バックグラウンド鋼に相当する情報資源だ。すべてが貴重というわけではないが、今では専門家の情報記事にも AI の影響があまりにも広範に入り込んでおり、重要になっている
      私の解決策は、常に一次情報と根拠を確認することだが、時間と労力が大きく、何から検証するか選別するのも難しい
    • 「自分で書く手間すらかけていないなら、私も読む手間をかけない」と返すと、人々はひどく怒り、なぜその言い分が間違っているのかを AI で書いて送ってくることさえある
      「ChatGPT に xyz と入力しろ」と言うか、構造化された文書リンクを共有するほうがまだまし。結果をそのままコピーして貼り付けると、その過程で何の価値も加えていない
    • 会話での提案を理解せず、すぐに「なぜそれを検索しないのか」と返して会話を断ち切る人たちとは、もう友人ではいない
      IMDB や DIY 動画から情報を得ることもできるが、欲しいのは文脈を含む解説と地域に合わせた助言だ。私を知っている人なら、何が簡単で何が難しいかも分かっていて、特定の映画やコツが合わないとか、どの店に行くべきかまで教えてくれる
    • 以前見ていた助言・情報系 subreddit の大半は、AI 以前からすでにひどい投稿で崩壊しており、まだ購読しているいくつかは意外に悪くない
      鍵はいつも、関心と膨大な時間を注ぐ積極的なモデレーターだった。低品質な投稿をするユーザーが臨界点を超えると、良いユーザーが去り、回復できなくなる
    • HN でも「分からないけど CrapGPT に入れてみたらこう答えた」という投稿を何度も見た。こうした返答をする前に、質問者が自分で AI を使う場合と比べてどんな価値を加えたのかを自問すべきだ
  • AI悲観論の見方では、AIがさらに賢くなってもユーザーの機嫌を取り続け、人々は特に自分がよく知らない分野で、愚かな考えをより自信を持って強化するためにそれを使うことになる
    技術的に解決できたとしても、自分が間違っていると言うモデルは望まず、信念を強化してくれる流暢な嘘を選ぶ可能性が高い
    表現の自由は自分が間違っているかもしれないと考えさせるが、結社の自由はそれを避けさせてくれる。AIはインターネットの慰め型エコーチェンバーを、想像しにくい規模にまで拡大するだろう

    • Henry Petroskiは『To Engineer is Human』で、計算機が計算機時代に登場したことで構造工学者の数感覚を弱め、能力の限界に近い作業を試みさせ、コンピュータ計算を検証する能力まで低下させたと説明している
      コンピュータが人間より何桁も速く計算し始めた時代であり、Hartford Civic Centerの崩落をコンピュータ出力を盲信した失敗として扱っている。幸運にも死者はいなかった
      やや選別された事例のようにも見えるが、「正確度は低く、確信は高い」という組み合わせからこの事故を思い出した。民間人の死者や法的責任が生じて初めて新技術の正しい用途が定着するのではないかと心配になる。少なくとも 1) 安全必須システムには使わない、2) 専門家をアルゴリズムで置き換えない、ところから始められる
      https://www.engr.psu.edu/ae/thesis/failures/MKP/failures/fai...
    • 最近のAIは従順さが弱まる傾向があり、おべっか傾向は広く知られた問題なのでAI企業も修正している。OpenAIがGPT-4oを終了したときに明らかになったように、これを嫌う人も確かにいる
      しかしAIで実際に仕事をし、多額の料金を払っている人は、顧客の前で間違えるよりも、AIに間違っていると言われるほうを好む
      正解を出しつつ命令にも従わなければならないため、解決は容易ではなくバランスが必要だ。より賢いモデルは何が正しいかを分かっている可能性が高いので、ユーザーが正しいと仮定して幻覚を続ける小型モデルよりは概してましである
    • 人間と相互作用するAIの振る舞いは、結局は収益化を基準に決まる。ユーザーを不快にさせたり異議を唱えたりするやり方は、通常好まれる事業戦略ではない
      ただし、ユーザーがAIの性格や入力された考えに対してどの程度反論させるかを簡単に選べるなら面白いだろう
    • LLMは必要なく、独創的な作業には大して役にも立たないのでほとんど使っていないが、周囲の人々がAIのせいで大きく鈍くなるなら、むしろ歓迎だ。自分の人生で成功しやすくなるからだ
    • 多くの人は昔から不都合な真実より心地よい嘘を好んできた
  • まともな検索拡張生成(RAG)パイプラインやWeb検索がなければ、最大限の確信を持って幻覚を出すしかない
    トークン確率が低いときに回答を拒否するよう適切にアラインされた最上位モデルで実験していれば、もっと興味深かっただろう。現在の実験は、人々がチャットUIに表示されたよく書かれた文章を信頼しがちであることだけを示している

  • それでも真実を重視する人々にとって、Richard Feynmanのこの言葉は道標になり得る。「何かを本当に知ることがどれほど難しいか、実験をどれほど慎重に検証しなければならないか、間違えたり自分を欺いたりするのがどれほど簡単かを理解したという利点が私にはある…」
    https://www.youtube.com/watch?v=tWr39Q9vBgo

    • 少なくとも1つ、おそらく複数のYouTubeアカウントがAIで生成したFeynmanの低品質動画を作っているので注意が必要だ。現在の惨憺たる時代以前の資料だからといって、無条件に信じてはいけない
  • 研究の報酬構造は、正解なら0.10ドル支払い、不正解なら0.10ドル差し引き、回答拒否なら変動なしだった
    参加者が実際にお金を受け取るのか、最終残高がマイナスなら損失を支払わなければならないのかは書かれていなかった
    効果自体は実在すると思うが、データほど大きくはないだろう。はるかに大きな金額がかかっていれば、常識がもっと強く働いたはずだ

  • 研究を知らせてくれた点は良いが、出典リンクのどれも引用された研究に直接つながっておらず、自社ドメインやBusiness Insiderにリンクしている

    • 原文は https://osf.io/preprints/psyarxiv/5y6m4_v1 である
      Marcoccia, C. ほか、『AI Advice Suppresses People’s Willingness to Say “I Don’t Know”, Even When the Advice Is Wrong and Accuracy Is Incentivized』、PsyArXiv、2026年7月15日
  • AIが単に誤答にアクセスできる環境と比べて実質的な違いを生むのか知りたい
    検索結果が質問に誤った答えを提供しても同じ結果になるのか、おべっか傾向や対話型インタラクションのようなAI固有の特性がどれほど作用しているのか、それとも人々が読んだ内容を簡単に信じるだけなのかを確認する必要がある

    • 研究は https://osf.io/preprints/psyarxiv/5y6m4_v1 で読める
      要するに、誤答を出すLLMチャットインターフェースと、事前生成された誤答にアクセスする条件の両方を研究しており、2つの実験で似た結果が出た
  • 一部の教師は、学生にChatGPTで課題を書かせたうえで間違っている部分を批評させているという
    本来ならAIの回答をそのままコピーして提出しそうな場面で、まずAIの回答を提示し、何を見落としているのかをコミュニティで議論する方式も興味深いかもしれない

    • 教育には引き続き科学的根拠のあるアプローチを求めるべきであり、誰かの思いつきの教育実験で子どもたちの教育を浪費してはならない。Bill Gatesともすでに似たような試みを経験している