- 契約レビューにおいて、LLMをジュニア弁護士およびリーガル・プロセス・アウトソーシング(LPO)と比較した実験で、シニア弁護士の判断を正解基準として、論点判定・位置特定・速度・コストを併せて評価
- 法的論点の判定では、GPT4-1106がF-score 0.871でLPOの0.874とほぼ同等、ジュニア弁護士の0.860を上回った一方、位置特定ではLPOの0.770がGPT4-32kの0.740を上回った
- 実験では匿名化された調達契約10件を使用し、NDAは文書が短く複雑な評価に適さないという理由で除外。米国・ニュージーランド管轄の契約をバランスよく含めた
- レビュー速度ではLLMが大きく先行し、平均時間はジュニア弁護士56.17分、LPO 201分に対し、GPT4-1106 4.70分、GPT4-32k 2.11分、Palm2 text-bison 0.73分程度
- 契約あたりのコストはClaude 2.0・Claude 2.1が0.02ドル、GPT4-1106が0.25ドルと算出され、ジュニア弁護士の74.26ドルおよびLPOの36.85ドルに対して最大99.97%のコスト削減を示した
契約レビューで何を比較したのか
- 目的は、LLMが大量の契約レビュー業務において、正確性、速度、費用対効果の面でジュニア弁護士やLPOを上回る、または同等であるかを評価すること
- 比較対象の業務は、契約内の法的論点を判定し、その判断に影響した契約条項の位置を見つける作業
- シニア弁護士が作成した判断を正解基準として、LLM、ジュニア弁護士、LPOの結果を比較
- 研究課題は3つに整理される
- LLMは契約内の法的論点判定と位置特定において、ジュニア弁護士やLPOより優れているか
- LLMは契約をより速くレビューできるか
- LLMは契約をより安価にレビューできるか
データセットと実験設計
- データセットは実際の法務契約から取得した調達契約10件で構成され、機密保持のため匿名化された
- 調達契約は法務実務でレビュー量が多い契約類型として選ばれ、NDAは通常短く、LLMの複雑な法的論点判定能力を評価するには十分ではないと判断された
- 管轄は米国とニュージーランドの契約をバランスよく含む
- 米国は制定法とコモンローが組み合わさった体系として扱われる
- ニュージーランドはコモンローに基づく体系として扱われる
- 各契約は、文書シナリオと契約レビュープレイブックという2要素構造で分析された
- 文書シナリオは、管轄、履歴、組織規模、契約当事者の製品・サービスの文脈を提供する
- レビュープレイブックは、実例から派生した標準化されたチェック項目を提供する
- シニア弁護士は、各契約が事前定義された基準を満たすかを判断し、判断に影響した特定の契約部分を見つけて記録した
- 関連情報が契約に存在せず基準が満たされない場合も明示的に記録した
- 複数のシニア弁護士の結果は多数意見基準で集計された
- 研究はOnit Inc.の倫理基準に従って実施され、参加者への通知、撤回権、匿名化、契約データの非識別化、倫理委員会の関与と監査を含む
モデル選定とプロンプト
- モデルは、LLM分野の主要プロバイダー、予備テストの結果、コンテキストウィンドウのサイズを考慮して選定された
- 16,000トークン以上を処理できないモデルは、契約全体の文脈を扱うのが難しいとみなされ、除外された
- LLaMA2とAmazon Titanは文書を複数部分に分割する必要があり、各部分ごとにシナリオ・プレイブック・定義条項を繰り返す必要があった
- RAGのような手法も検討されたが、予備評価では契約文脈の理解に不連続性が生じ、人間の弁護士レベルの理解と比較するには適していなかった
- 評価に含まれたモデルと設定は次のとおり
- GPT4 32k: temperature 0.2、入力32,768トークン、学習データは2021年9月まで
- GPT4-1106: temperature 0.2、入力128,000トークン、学習データは2023年4月まで
- GPT3.5-turbo-16k: temperature 0.2、入力16,385トークン、学習データは2021年9月まで
- Claude 2.1: temperature 0.2、入力200,000トークン、学習データは2023年初頭まで
- Claude 2.0: temperature 0.2、入力100,000トークン、学習データは2023年初頭まで
- Palm2 Text-bison-32k-2: temperature 0.2、入力32,768トークン、学習データは2021年半ばまで
- プロンプトは役割、作業、文脈で構成される
- 役割は、モデルが弁護士のペルソナに従うようにするもの
- 作業は、与えられた基準に従って契約をレビューし、論点の有無と位置を判断すること
- 文脈は、契約の対象読者、当事者の背景、交渉シナリオなど、弁護士・LPO・契約レビュアーに提供される指示と類似する形で構成される
正確性: 論点判定は接近、位置特定には差
- 法務実務者グループ間の一致度はCronbach’s Alphaで評価された
- 全参加者の一致度は0.923366と高かった
- シニア弁護士同士の一致度は0.719308で最も低かった
- ジュニア弁護士は0.765058だった
- LPOは1.0で完全な回答一致を示した
- 法的論点判定でF-score基準の上位結果はLPOとGPT4-1106
- LPO: precision 0.933、recall 0.823、F-score 0.874
- GPT4-1106: precision 0.835、recall 0.910、F-score 0.871
- ジュニア弁護士: precision 0.876、recall 0.845、F-score 0.860
- Claude 2.0とGPT4-32kはそれぞれF-score 0.817、0.820を記録
- GPT3.5は0.657、Palm2 text-bisonは0.708と低めだった
- 論点位置の特定では、LPOが最も高いF-scoreを記録
- LPO: precision 0.915、recall 0.666、F-score 0.770
- GPT4-32k: precision 0.847、recall 0.660、F-score 0.740
- Claude 2.1: precision 0.911、recall 0.569、F-score 0.701
- GPT4-1106: precision 0.857、recall 0.575、F-score 0.686
- ジュニア弁護士: precision 0.866、recall 0.542、F-score 0.667
- Palm2 text-bisonはF-score 0.452で最も低かった
- LLMは論点判定ではジュニア弁護士およびLPOと同等または上回る可能性があるが、条項の位置を正確に示す作業ではモデルごとの差が大きく、常に人間の実務者を上回るわけではない
速度・コストと導入時の制約
- 平均契約レビュー時間は、LLMが人間の実務者よりはるかに短かった
- シニア弁護士: 43.46分
- ジュニア弁護士: 56.17分
- LPO: 201.00分
- GPT4-1106: 4.70分
- GPT4-32k: 2.11分
- GPT3.5: 1.44分
- Claude 2.1: 2.05分
- Claude 2.0: 1.63分
- Palm2 text-bison: 0.73分
- 最速のLLMであるPalm2 text-bisonは、LPOより276倍、ジュニア弁護士より77倍速く契約レビュー作業を完了したと算出された
- LLMシステムプロンプトの設定、テスト、微調整、検証には平均16時間かかり、これはジュニア弁護士やLPOに類似業務を指示するのに使う時間と同程度
- 平均の契約あたりコストは、人間の実務者とLLMの間で大きな差を示した
- シニア弁護士: 75.92ドル
- ジュニア弁護士: 74.26ドル
- LPO: 36.85ドル
- GPT4-1106: 0.25ドル
- GPT4-32k: 1.24ドル
- GPT3.5: 0.05ドル
- Claude 2.1: 0.02ドル
- Claude 2.0: 0.02ドル
- Palm2 text-bison: 0.03ドル
- コスト計算は、人間の実務者の平均所要時間と時間単価、LLMの平均入力・出力トークン数とトークン単価に基づく
- Palm2 text-bisonはトークンではなく文字数ベースの価格で計算された
- 論点位置の特定性能が低いLLMは、単独で契約をマークアップするには制約があり得るため、法務業務ではモデル選定が性能やコストと同じくらい重要となる
1件のコメント
Hacker News の意見
弁護士が作成した契約書をテンプレート化する法律契約書生成スタートアップを運営していて、一般の人が契約書を読んで質問できるようにする GPT 分析機能も一部作ってみたことがある。
契約レビューでは、GPT は文書生成よりも文書分析のほうに強く、この論文もその点を裏付けている。ただし、いくつかの AI 文書レビュー系スタートアップを使ってみると、具体的な答えを掘り下げて聞いた瞬間にほとんどが崩れた。この論文は、弁護士と依頼者がやり取りするような対話ではなく、関連条項を探す程度だったように見える。
GPT は間違った答えをしても法的責任を負わないので、頭のいい人が自分で調べるときには役に立つ。以前から頭のいい人は Google で自分で調べられたのと似ている。
契約書生成については、ほとんどの場合、その場で GPT が毎回固有の契約書を作ってくれるよりも、よく作成されレビューされた標準契約書リポジトリのほうが役に立つと思う。弁護士たちは契約書を手放さないし、私たちがテンプレート化する契約書を書いてくれる弁護士を探す過程も非常に大変だった。結局は彼ら自身と専門家コミュニティの将来の収益源を減らすことになるからだ。GPT-4 の訓練には数億ドルかかったが、1,000万ドルだけ使って、よくレビューされた契約書リポジトリを作っていたとしても、同じ金額で契約書生成モデルを訓練するより有用だったはずだ。
人々は文書でやりたいことについてかなり多様な質問を投げかけるが、GPT はまだうまくできていなかった。近い将来も、弁護士の仕事はまだ残りそうだ。
たとえば20年ほど前、少なくとも私の住む地域では、建築家たちも複数の人に安く売るための設計を作りたがらなかった。そうした設計が建築成果物の市場を縮小すると考えていたからだ。しかし、ほとんどの人に本当に固有の設計が必要なわけではないことは簡単に分かる。
結局、市場はあまり気にせず、誰かが使える設計ライブラリとビジネスモデルを作れるようになると、問題は自然に解決した。建築家の側には、協力して一部でも取りに行くか、そうでなければ失うかの選択肢しか残らない。
弁護士も同じ道をたどると思う。最も簡単で収益性の高い仕事が自動化されることで厳しい時期を迎え、法律サービス市場は縮小し、残る仕事は自動化では処理できない、より複雑な業務になるだろう。
ペットの扱いのように、それほど重要だと感じない問題にはむしろ多くの比重を置いている感じだった。出力結果を自分向けに修正することはできたが、150ドルのサービスならもっと期待していた。
私が思い浮かべている会社は、マーケティング資料では完全な AI ベースのソリューションであるかのように示唆しているが、実際には完全に AI だけで動いているわけではなさそうだ。
極端な場合には倫理問題になって弁護士会の制裁を受ける可能性はあるだろうが、ほとんどは評判上の結果だけなのではないか。誤って作成された契約書について、弁護士に法的責任を問える状況はあるのだろうか。
LLM が支援できる領域の中でも、法律分野には特に期待している。5〜10年以内には、すでにこの論文を見るとほぼそこまで来ているようにも思えるが、自分の税務・医療・保険・婚姻関連文書にアクセスできる「弁護士」LLM と数時間会話し、時給500ドルを払わなくても個別化された助言や情報を受けられるようになりそうだ。
法的により詳しい普通の人々の波が来るはずで、本当に楽しみだ。
すでにソフトウェア関連のライセンスや法的結果について LLM に質問してみたが、趣味プロジェクト程度の質問については、高額な専門家を引き込まずに基礎をつかむことができた。
ただし、判断に大金がかかっているなら当然専門家のサービスを利用する。こうしたテーマでは「おおむね正しい」では十分ではない。
私たちの中核事業は法律文書生成で、AI ではなくルールベースのロジックで動いている。中核事業の結果としてユーザーの法律文書をすでに保有しているので、その文書に関連する補助的な AI チャット機能を作るには非常に良い立場にある。
最近は製品推薦 AI を本番環境にデプロイした。一部はルールベースで、パーソナライズされた推薦文は GPT-4 が生成する。現在は、ユーザーが複数の法律文書や私たちのサービスを理解するのを助ける AI チャット機能を作っている。一次カスタマーサポートをこの AI チャットで置き換えようとしているが、怒る前に、現在の一次カスタマーサポートが非常に出来の悪いルールベース AI であることを知っておいてほしい。
フィンランド語のメイン Web サイトは https://aatos.app だ。SE と DK 向けの一部サービスもあり、最近は UK で電子署名サービスだけを先に開始した。
LLMを法務分野に適用できるかどうかの判断は、文書・契約レビュー以外の課題で試されるまで保留したい。大企業の法務では、契約レビューは最近の卒業生数百人に外注されることが多く、実際の弁護士の能力は最小限しか使わない校正作業に近く、企業の収益を高める役割を果たしている
個人が主に購入する法律サービスは、家事事件、刑事事件、少額訴訟のようなものだ。重罪の刑事訴訟を扱うのに必要な、事実関係ごと・状況ごとの分析を、近い将来のLLMが担えるとは思えない。親権事件や争いのある離婚で必要になる、個別的で事件ごとに異なり、もつれた家族関係の力学にLLMが対応できることを示すものも見たことがない
弁護士が使うツールとしてLLMを受け入れられない理由はないが、反復的な法的校正作業を超えて実務に導入する準備ができた技術だとはまったく思わない
感情、個人的な見方、そしてそれらをもとに積み上がった判例がなければ、こうした事件がどんな姿になるのかはよくわからない
テクノロジー基盤の商業保険ブローカーでデータとAIを率いている。GPT-4を活用して保険要件に特化した深い契約分析ツールを作っており、Googleにいたときも、特許分類から証拠開示支援まで、Google法務チーム向けに複数のLLMソリューションを作った
言語モデルは、法律文言を咀嚼し、状況を分析するのに優れている。しかし多くの法律アプリケーションは、「現在の保険プログラムで契約上カバーされるのか?」のように、間違えてはいけない重要な判断につながっている。そこで法務領域のLLM製品は次の原則で作っている
専門家と一緒に使うhuman-in-the-loopツールでなければならない。可能なら自動化ではなく意思決定支援として設計すべきで、それでも大幅な時間短縮は可能だ
透明性と引用が必要だ。人が一緒に使うツールなら、信頼を築くための仕組みが必要になる。LLMが参照した文書条項をハイライトするにせよ、分析の一部が提供されなかった理由を説明するにせよ、根拠を引用することが重要だ
再現率よりも適合率に合わせるべきだ。多くの法務ユースケースでは偽陽性やハルシネーションが特に悪影響を及ぼすため、モデルやプロンプトを適合率重視に調整すると緩和に役立つ
「適合率に合わせる」というのはプロンプトエンジニアリングのことなのか、それとも実際にGPT-4をファインチューニングするという意味なのか気になる
この論文に長所がまったくないわけではないが、職業全体や「産業」について大げさなことを言うための口実のように見える。おそらく注目度を上げて、あとで何かを売る目的もあるのかもしれない
最悪なのは、先行研究としてプレプリント文書を1本だけ引用している点だ。その文書自体も契約レビューではなく、一般的な法的推論に関するものだ。LegalBenchの一部がもちろん「解釈」であり、既存の契約レビュー・ベンチマークの上に作られているとはいえ、もっと関連性の高い論文を見つけられたはずだ
法律文書レビューの自動化は、質問応答タスクを含め、約20年にわたって自然言語処理で非常に活発な分野であり、2017年以降はさらに活発になっている。少なくともKiraやLuminanceのようなツールは、LLMベースでなくても世界中の法務部門や法律事務所でかなり広く使われている。だから弁護士たちはその限界を実務で既に知っている
ただしKira系のツールは最新モデルの性能を測定しておらず、透明なベンチマークも使っていない。その点で、この論文のベンチマーク結果はLLM活用の観点から歓迎できる追加資料だ
しかし、単一のレビュープレイブックで10件の文書をレビューしたという限定的な範囲を考えると、「産業への含意」まで書くような話ではなかった。かなり見栄を張っており、法律サービス産業の未来というより、著者たちがその産業をよく知らないことを示している
機能と限界が気になるなら、軽いが有益な読み物としてこれらもおすすめする: https://kirasystems.com/science/, https://zuva.ai/blog/, https://www.atticusprojectai.org/cuad
弁護士たちが自分たちの産業を脅かす技術を弱体化させるために、どんな法的論理を作り出すのか気になる
論理は、効果的でない弁護のリスクから「子どもたちのことを考えろ」までさまざまだろう。独占を守るのに役立つものなら何でも使うはずだ
弁護士たちがChatGPTで調査し、訴訟書面の作成を手伝わせたものの、うまくいかなかった最近の事件を見ると、ここのコメントの楽観論に完全には納得できない
生成→検証の小さなパイプラインを作ることは些細ではないが、不可能でもない。言及された事件は、非常に怠慢なアソシエイトと、LLMが何をするものかについての非常にpoorな理解が組み合わさったものに見える
理論上、法律文はコードと同じように構造化されているべきです。論理的な構造があるため、他の自然言語よりもLLMに適用しやすい可能性があります。
弁護士たちが「偽の」判例を提出したという初期のニュースはありましたが、法律 profession の再編は時間の問題です。法律事務所には補助員など単純作業をする人が多く、LLMはその仕事をこなせます。彼らはホワイトカラーと見なされていますが、消えていくでしょう。
コーディングと似た形で進むでしょう。確認が必要なジュニアパートナーが1人増えるようなもので、標準的な文書作業を代行できます。
完全には信頼できませんが、ジュニア開発者だって完全には信頼しないでしょう。それでも80%の地点までは連れていってくれます。
興味深い問題領域です。ここに通用するかもしれない文化撹乱型の法理論がひとつあります。
月額99ドルの本人訴訟サービスが次の2つをしてくれるとしましょう。1) すべての資産を安全な手段へ移す方法を教える。2) 同時に、本人訴訟で自分を防御できるようにする。目的は勝つことではなく、システムを詰まらせることです。相手に法的には破産状態であることを示したうえで、申立書を出し続け、できるだけ苦痛にすれば、控訴手続きまで5年かかると気づいて、そのまま諦めるかもしれません。
弁護士たちがテンプレートサービスに法律文書を提供したがらないのは事実ですが、正直なところ、裁判所へ行って大量の提出書類を集めて学習させるだけでも十分かもしれません。その戦略では、優れた文書や法理論は必ずしも必要ありません。裁判所の提出要件を満たす文書であれば十分です。「はい、あなたの家政婦の娘たちに時給400ドルで証言録取を受けてもらう必要があります。問題があるなら審理を開いても構いません」といった具合です。十分に多くの人がこうすれば、法制度は事実上停止し、権力は人々の手に戻るでしょう。
このような問題のために闘い、亡くなったAaron Swartzを追悼します。
https://www.courts.ca.gov/12272.htm
[0]https://en.wikipedia.org/wiki/Paper_terrorism
「すべての刑事訴追において、被告人は自己の防御のために弁護人の援助を受ける権利を有する」— 米国憲法修正第6条
LLMが平均的な人間の弁護人より有能になった場合、この条項はなお人間の弁護人の援助を要求するのでしょうか?
もしかすると、弁護士の最も重要な特徴は技術的知識ではないのかもしれません。
LLMは事実関係の問題などを助けられますし、適切に構成されていれば、弁護士よりも強いプライバシー保護の保証を提供できる可能性もあります。もちろん、そんなことが実際に起きるとは思えませんが。