1 ポイント 投稿者 GN⁺ 2024-07-29 | 1件のコメント | WhatsAppで共有
  • イスラエルの仮釈放委員会で、休憩の前後に有利な判断の割合が急落・回復するという有名な結果は、実際の判断の歪みだけでなく、統計的アーティファクトによっても大きく膨らんでいる可能性がある
  • 元の研究は、セッション最初の判決で有利な判断が出る確率が約65%から最後の判決ではほぼ0%まで下がり、食事休憩後に再び65%へ戻ると解釈し、これを精神的消耗の可能性と結び付けた
  • 再分析の要点は、有利な判決は不利な判決より時間がかかるという点にある。DLAのデータでは、有利な判決は平均7.37分、不利な判決は平均5.21分で、セッション後半のサンプルには有利な事件が残りにくくなる可能性がある
  • 仮想的な合理的裁判官が、残り時間内に終えにくい事件を次のセッションに回すと仮定すると、事件の順序がランダムでもDLAに似た下降曲線が現れ、各セッション最後の5%を除外するとこの効果はさらに大きくなった
  • 元データだけでは、外生的要因が法的判断を大きく歪めたという結論には十分ではなく、合理的な時間管理や非ランダムな事件配置といった要因を、順序・空腹効果から切り分ける必要がある

元の「空腹の裁判官」結果

  • Danziger、Levav、Avnaim-Pesso(DLA)は、イスラエルの仮釈放委員会による1,112件の判決を分析し、セッション内での事件順序が有利な判決の確率と関連していると考えた
    • 同委員会は1日に3回セッションを行い、遅めの午前の軽食休憩と昼食休憩によってセッションが分かれていた
    • 分析対象にはイスラエルの仮釈放申請の約**40%**が含まれていた
  • DLAの中心的な結果は、セッション最初の判決では有利な判断が約**65%だったのに対し、セッション最後の判決ではほぼ0%**まで低下したというものだった
    • 食事休憩後の次のセッションでは、有利な判決の割合が再び約65%に戻った
    • DLAは、反復的な判断の後に裁判官が疲労・空腹・精神的消耗の状態となり、申請を却下する現状維持戦略をより容易に選んだ可能性がある、と慎重に解釈した
  • この効果は、法的判断が事件の順序や食事の有無といった法的に無関係な要因に左右され得ることを示すものとして、心理学、法学、経済学などで広く引用された
    • 引用数は、2015年2月27日時点のGoogle Scholarで222回だった

効果量への疑問

  • DLAが観察した低下幅は非常に大きい
    • 有利な判断が65%から5%へ下がることは、オッズ比35、または標準化平均差d = 1.96に相当する
    • これは通常の「大きな効果」の基準の2倍を超える水準である
  • 精神的消耗が原因だという仮定と比べると、その大きさは特に際立つ
    • CarterとMcCulloughによる出版バイアス補正後の推定値はd = –0.10〜0.25で、平均的には小さな効果しか見込まれない
    • 23の研究室、N = 2,142規模の事前登録済み多施設追試研究ではd = 0.04が見つかり、0と有意に異ならなかった
  • したがってDLA効果が本当に精神的消耗によるものなら、実験室研究で期待される効果よりはるかに大きな現象が法廷環境で生じたことになる

事件順序と休憩時点の交絡要因

  • 事件順序の効果を主張するには、事件の配置がランダムであるか、分析に含まれていない隠れた要因が順序と判決を同時に左右していない必要がある
  • DLAは、犯罪の重大性、過去の収監、服役月数、リハビリプログラム参加、過去の有利な判断率などの変数を統制し、結果は頑健だと見なした
  • Weinshall-MargelとShapardは、仮釈放手続きの関係者への非公式インタビューに基づき、事件順序はランダムではないと反論した
    • セッション内では弁護人のいない受刑者が通常後ろに回され、弁護人のいる受刑者より仮釈放が認められる可能性が低いという説明である
    • DLAは、弁護人の有無を統制しても下降傾向は維持されると回答したが、効果量がそのままかどうかは報告していない
  • いつ休憩を取るかも重要な変数である
    • DLAは、事件の特性は休憩時点を予測しないと考えた
    • Weinshall-MargelとShapardのインタビューでは、裁判官が1つの刑務所の事件群のような事件セットを1つのセッション内で終わらせようとする組織的な計画を行う可能性がある、という証言があった

選択的脱落と合理的な時間管理

  • 再分析の出発点は、有利な判決が不利な判決より時間を要するという事実である
    • DLAのデータでは、有利な判決は平均7.37分、標準偏差5.11分
    • 不利な判決は平均5.21分、標準偏差4.97分
  • セッション当たりの処理事件数は一定ではなかった
    • 午前セッションは平均7.8件、標準偏差4.51、最小2件、最大28件
    • 軽食後・昼食前のセッションは平均11.4件、標準偏差5.14、最小2件、最大25件
  • 有利な判決により時間がかかるなら、セッション後半に進むほど有利な判決の事件がサンプルから選択的に脱落し得る
    • 主に不利な判決で構成されるセッションは、より多くの事件を処理できる
    • 高い順番の観測値には、不利な判決が多いセッションの事件が相対的に多く残る
  • 裁判官が休憩直前に時間のかかる事件を始めないようにする行動は、合理的な時間管理であり得る
    • 事件の書類量、申請の種類、弁護人の有無、弁護人・刑務所・受刑者に関する表面的な手がかりだけでも、処理時間が長いか短いかをある程度予測できる
    • この計画は、事件の法的実体や判決結果を事前に知っているという仮定を必ずしも必要としない

合理的裁判官シミュレーション

  • シミュレーションは、誤りやバイアスなしに判断する仮想的な理想的裁判官を仮定する
    • 裁判官は各セッションにおおよその時間制限を設け、次の事件がその上限を超えると見込まれる場合、現在のセッションでは処理せず次のセッションの最初の事件に回す
  • シミュレーションは10,000件のランダム順序の事件を生成した
    • 有利に判断される事件の基本比率は36%、不利に判断される事件は64%とした
    • 判決時間には有利・不利事件の平均時間差を反映し、正規分布または正の歪度を持つWeibull分布のノイズを用いた
    • セッションの時間制限は60分に設定した
  • 事件順序がランダムで裁判官が合理的であっても、セッション後半に進むほど有利な判決の確率が大きく低下するパターンが現れた
    • 正規分布とWeibull分布のいずれでも、質的に似た結果が現れた
    • 高い順番では残る観測値が少なくなり、推定が不安定になって、0%または高い比率のピークが生じ得る
  • このメカニズムは、残り時間が短いほど有利な事件がセッションに含まれにくくなることから生じる
    • 例では、残り時間が15分なら有利・不利事件の大半を開始できる
    • 残り時間が5分なら有利な事件のうち12%しか入れないが、不利な事件は46%が入れる
    • セッション後半のサンプルでは、有利な事件の相対比率が低下する

セッション序盤の上昇とデータの打ち切り

  • シミュレーションとDLAデータのいずれでも、セッション最初の判決における有利な判断率が基本比率より高く現れる現象がある
    • セッションは有利な判決の直前で終わる可能性が高いため、前セッションの最後から外れた有利な事件の確率質量が、次セッションの最初の判決へ移動する
    • 事件群単位の計画が時々あるなら、2番目・3番目の判決も基本比率より高く現れる現象を説明できる
  • DLAは、高い順番における小標本問題を減らすため、各セッション最後の**5%**の事件を除外した
  • 再分析シミュレーションでは、この**打ち切り(censoring)**は低下幅を小さくせず、むしろ大きくした
    • 打ち切りは選択的脱落を人為的に増加させる
    • 順番が有利な判決率に与える影響を分析する際には、このような打ち切りを避けるべきである
  • DLAデータには、前の判決が後の判決と正の相関を持つ自己相関もある
    • シミュレーションで1次自己相関r = .10を追加した場合、アーティファクトの大きさは目立って変わらなかった

事前予測がない場合

  • 先のシミュレーションは、裁判官が次の事件の予想所要時間をある程度予測し、セッション制限を超える事件は開始しないと仮定している
  • DLAは、委員会の構成員は次の事件の詳細を事前に知らないとしていたため、完全な予測可能性を仮定するのは強い条件かもしれない
  • 再分析では、予測なしに裁判官が時間制限を超えた後でセッションを止める場合もテストした
    • 打ち切りと自己相関がなければ、アーティファクトは消えた
    • 打ち切りと自己相関を含めると、再び低下効果が現れた
  • 理由は、有利な判決の方が時間を要し、時間制限に引っかかる可能性が高いためである
    • セッション末尾の5%を除外すると最後の事件が抜ける場合が多く、この最後の事件は不利な事件より有利な事件である可能性が高い
    • 予測がない条件で打ち切りが作り出した低下幅は約**15%**で、予測があるシミュレーションより小さい

残る限界と結論

  • 再分析は、順序や精神的消耗がDLAの法的判断データに影響しなかったと排除するものではない
    • ただし、観察された大きな低下のかなりの部分は、外生的要因がなくても合理的な時間管理と選択的脱落によって生じ得る
  • 合理的な時間管理と選択的脱落は、DLAデータのすべての特徴を説明するものではない
    • シミュレーションの効果量は元の効果よりやや小さい
    • 元データではセッション開始時の比率が45%ではなく**65%**とより高く、特に1日の最初のセッション開始時の比率はこの説明だけでは説明しにくい
    • DLAが報告した時間そのものの効果は、順番ベースのアーティファクトでは簡単に説明できない
    • 経験的な曲線はより滑らかで、シミュレーション曲線は序盤・終盤の低下がより強く、中盤はより平坦である
    • DLAの設定上、次の事件に対する直接予測が一部制限されていたなら、合理的な時間管理が説明できる低下幅は約**15%〜45%**と推定される
  • 元データは追加の詳細分析に使用できなかった
    • DLAの研究者らはデータ共有の意思があったが、最初にアクセス権を与えた側がそれを阻んだとされている
    • 正確な判決環境も完全には再構成できず、残る論点には後続研究が必要である
  • 元の研究における順序効果と精神的消耗効果は過大評価されていた可能性がある
    • 休憩時点に関する合理的な時間管理、弁護人のいる事件が先に配置される非ランダムな順序、潜在的な順序・精神的消耗効果が混在している
    • 効果を切り分ければ、順序や精神的消耗の推定値はより小さくなる可能性が高い
  • より広く見れば、非合理に見える行動にも直感に反する合理的基盤があるかもしれない
    • コンピューターシミュレーションと形式的な数学分析は、その可能性を見つける手段である
    • 法的主体や個人の行動を大きく非合理的だと結論づける前に、合理的行為者シミュレーションと形式分析をより早い段階で、より積極的に用いるべきである

1件のコメント

 
GN⁺ 2024-07-29
Hacker News のコメント
  • 元の研究には、事件の処理順序を考慮していないという欠陥があったように見える
    重大性の低い事件が先に扱われ、より重大な事件、つまり処罰がより重い事件は後回しにされていたという点が抜けていた
    「Danziger らは、事件の順序がランダムであり、したがって意思決定プロセスとは独立しているという仮定に大きく依存している。この仮定は強く反論された。Keren Weinshall-Margel と John Shapard は、PNAS に掲載された短く非常に批判的な回答の中で、元研究のデータと、自ら直接収集した別のデータを分析し、関連する裁判所職員への追加インタビューも行った。彼らは、事件の順序はランダムではないと指摘している。合議体は休憩前には、ある刑務所の事件をすべて処理しようとし、休憩後には次の刑務所の事件に移る。特に、弁護士のいない受刑者の申立ては通常、各セッションの最後に処理される。そのため、法的代理人のいない受刑者は、いる受刑者よりも有利な判断を受ける可能性が低い。また弁護士は複数の受刑者を代理することが多く、事件の提示順を決めるが、最も強い事件から始める可能性も十分にある」
    [1] Chatziathanasiou, K., 2022. Beware the lure of narratives:“hungry judges” should not motivate the use of “artificial intelligence” in law. German Law Journal, 23(4), pp.452-464

  • 興味深い。元の研究は、昼食直後の裁判官はより寛大で、昼食直前には最も厳しくなるという結果で知られていた
    この新しい研究は、肯定的な判決にはより時間がかかり、休憩直前には単純な否定的判決をより多く差し込めることを示し、その結論の強さに異議を唱えている。ここでの否定的判決は仮釈放の却下なので、より早く終わる
    つまり裁判官は、休憩直前に有利な結論になりそうな複雑な事件を始めたがらないということだ。元の研究は数え切れないほど引用してきたが、今回の再検討のおかげで、はるかに多くの文脈が得られた

    • 心理学専攻としては、科学研究は再現されるまでは引用すべきではないと思う。心理学研究ならなおさらだ
    • この研究に関連して、以前 HN のトップページに載った別の記事があった。効果量を扱っていて、その大きさがあり得ないほど大きいと主張していた
      それが本当なら、昼食時分に交通事故がものすごく急増するはずで、常識的には正午直前の運転を禁止すべきだと言えるほど大きい、という論旨だった
      「空腹が私たちの精神的リソースにこれほどの大きさの影響を与えるのなら、社会は毎日 11:45 に小さな混乱に陥るだろう。少なくとも社会は、この信じがたいほど強い精神的消耗効果を中心に組織されているはずだ」
      https://daniellakens.blogspot.com/2017/07/impossibly-hungry-...
    • 「仕事が嫌だ、昼食が待ち遠しい」といった局所的で無害に見える傾向が、現実の結果として凝縮されるのを見るのはいつも興味深い
      似た文脈では、夏時間の開始と心臓発作の増加との相関を扱った有名な研究もある [0]
      [0] https://www.sciencedirect.com/science/article/pii/S254245482...
    • 裁判官や書記官にこの結果について聞いた人はいたのだろうか? 電話一本で「はい、私たちは日程を組み、否定的だったり簡単だったりする事件を意図的に後ろに回しています」という答えが得られれば、全体を反証できたように思う
  • 関連記事:
    Do judges give out tougher sentences when hungry? A study too good to be true - https://news.ycombinator.com/item?id=35491060 - 2023年4月、コメント202件
    Impossibly Hungry Judges - https://news.ycombinator.com/item?id=22020716 - 2020年1月、コメント1件
    Rebuttal to hungry judges give harsher sentences - https://news.ycombinator.com/item?id=19958435 - 2019年5月、コメント1件
    Impossibly Hungry Judges (2017) - https://news.ycombinator.com/item?id=18112378 - 2018年10月、コメント58件
    Impossibly Hungry Judges - https://news.ycombinator.com/item?id=14701328 - 2017年7月、コメント70件
    Do hungry judges give harsher sentences? - https://news.ycombinator.com/item?id=2438189 - 2011年4月、コメント1件
    https://hn.algolia.com/?dateRange=all&page=0&prefix=false&qu...
    https://hn.algolia.com/?dateRange=all&page=0&prefix=false&qu...

  • 長さが互いに異なる対象を扱う統計は厄介だ。LANでパケットのサンプリングをしていた頃を思い出す
    長さの分布が双峰型だったため、平均を前提にした統計計算が誤解を生んでいた

  • Alexander PopeのThe Rape of the Lockを誰も引用しないのが不思議だ
    “The hungry judges soon the sentence sign,
    And wretches hang that jury-men may dine;”
    (https://rpo.library.utoronto.ca/content/rape-lock-canto-3)

  • これは初めて見たので興味深い。似たようなことを喫煙に関して見たことがあるので、今度は依存症の裁判官効果、たとえば喫煙のようなものも気になってきた

    • それぞれ異なる依存症が裁判官に違った形で作用する可能性もある。昼休みの買春に依存している裁判官、昼休みのタバコに依存している裁判官、昼休みのスコッチに依存している裁判官は、それぞれ違う判決を下すかもしれない
  • 現在の再現失敗のうち、どの程度が観察対象者たちがその現象を知って意識的に補正したためなのだろうか?

  • 時間制限があると、合理的な裁判官でも事件をより早く処理しようとして、不利な判決のほうに傾く可能性がある、という研究に見える
    昼休みと、おそらく退勤時間がそうした時間制限なので、昼休みが近づくほど有利な判決が減り、昼食直後にまた回復する現象が現れる
    それなのに研究が「DLAの分析は、外部要因が法的判断に影響するという仮説について決定的な証拠を提供しない」としているのは腑に落ちない。昼休みと退勤時間が外部要因でないなら何なのか?
    ただし上の説明は元の発見の一部しか説明せず、研究も別の要因がさらに作用していると認めている

    • この研究はそうは言っていない
      シミュレーションされた合理的な裁判官たちは「理想的」であり、事件の順番や休憩後の経過時間によって判断が影響されない
      研究が述べているのは、このような完全な行動にもかかわらず、いつ休憩を取るかを決める一部のシミュレーション方法では、有利な事件がセッション序盤に割り当てられる可能性が高くなり得るという点だ。最後のシミュレーションでは、元の研究と同じ統計処理を適用して初めてこの効果が現れる
  • 元の研究を読んでから何年もの間、昼食前の会議を入れないようにしていたのに、なんてことだ

    • より良い戦略は、裁判官との会議を入れないことだ
      もう少し真面目に言うと、私は逆にしている。人々が空腹で判断を誤らないようにし、午前中を互いに分断された2つのブロックに分けないためだ
    • それは間違いではなく、まともな人として振る舞ったということだ
    • 会議が減るのは良いことだ。同じ数の会議をこなすために遅くまで残るのでなければ
  • デフォルトの結果が逆の場合と比較してみると興味深そう
    受刑者は刑務所にいて、そのまま刑務所にいることになる
    もし裁判官が、なぜ引き続き収監されるべきなのかを論証しなければ受刑者が釈放される仕組みなら、結果は変わるだろうか?もちろん、かなり複雑になりそう

    • 仮釈放委員会の代わりに刑事裁判所を研究すればよいのかもしれない