- がん治療ガイドラインは、臨床的根拠を構造化された推奨へと圧縮して治療のばらつきを減らすが、時間的制約や最新研究へのアクセス差のため、現場で一貫して適用するのは難しい
- NCCNは米国の主要ながんセンター32施設による連合で、がん種別の学際的専門家パネルがNCCN Clinical Practice Guidelines in Oncologyを毎年更新している
- 現在のガイドラインは、複数のページやリンクをたどる必要があるPDFフローチャートであり、希少サブタイプや複雑な患者条件では正しい版と経路を見つけにくい
- ガイドラインの本質は意思決定ツリーであるため、機械可読な形式であれば、診療記録システムが検査提案、ガイドライン逸脱の警告、高速な探索インターフェースを支援できる
- 試作ツールはNCCN乳がんガイドラインをLLMでJSONスキーマへ抽出し、271ノードのグラフとして保存したが、精度は70〜80%程度であり、臨床意思決定には使ってはならない
がん治療の標準化におけるガイドラインの役割
- 同じがん種、病期、腫瘍サイズ、部位を持つ2人の患者が別々の病院を受診しても、理想的には同じエビデンスに基づく治療や追加検査を受けるべきである
- 現実には、医師は時間的制約を受け、教育背景も異なり、最新研究に即座にアクセスできないことがある
- 臨床ガイドラインは、膨大な医学的根拠を構造化された推奨として整理し、病院と臨床医の間の治療標準化を支える役割を果たす
- 患者ごとの治療反応は異なり得るが、エビデンスに基づくガイドラインに従うことで、良好な結果の可能性を高められる
NCCNガイドラインが作られる仕組み
- がん種別の専門腫瘍医は毎年、診療で遭遇し得るさまざまな状況を列挙し、各状況の臨床的根拠を検討して行動を推奨する
- 例: 早期乳がん、過去に乳房部分切除術、現在妊娠中の患者
- 例: 乳管内浸潤がんで、腫瘍長が0.6〜1cmの患者
- 推奨は、特定の検査オーダー、治療過程の処方、今後の経過確認スケジュールなどにつながる場合がある
- パネルは定期的に新たな根拠を検討し、ガイドラインを更新する
- 地域ごとに利用可能な治療が異なるため、複数の団体が異なるガイドラインを作成しており、実際の適用も地域の影響を受ける
- NCCNは米国の主要ながんセンター32施設による連合であり、がん種別の学際的専門家パネルが最新研究を検討・選別し、スクリーニング、診断、治療、支持療法アプローチに関する合意を導く
- 成果物であるNCCN Clinical Practice Guidelines in Oncologyは、世界的に包括的かつ広く使われるがん治療標準として用いられている
PDFベース実装の現実的な問題
- NCCN乳がんガイドラインのあるページにはBINV-6のようなリンクがあり、各リンクは独自のフローチャートを持つ別ページへつながっている
- 医師は患者状況をフローチャートに当てはめ、HER2ステータスのように不明な情報が出てきたら検査をオーダーし、治療推奨に到達するまで複数ページをたどらなければならない
- ガイドラインを用いても完全な標準化は難しい
- 同程度の根拠水準を持つ複数の治療選択肢があり得る
- 治療に関連する患者状況がガイドラインに明示的に列挙されていないことがある
- 医師はなお判断を下す必要があるが、取り得る判断の幅は狭まる
- Mayo ClinicやMD Andersonのような優れたセンターは、資金、高度に専門化された腫瘍医、臨床試験へのアクセスに加え、体系的な診療プロセスとガイドライン実装手順を備えている
- どの病院でも診療がガイドラインから外れる可能性はある
- 例: 閉経後患者という条件がカルテで見落とされ、閉経前患者に対してより強く裏づけられている治療を受けることがある
- 医師は数百人の患者を診るため、ガイドラインへのアクセス性があっても一部条件を見落とすことがある
- がん治療成績を改善する方法には新薬の発見や手術技法の改善もあるが、エビデンスに基づく診療の格差を減らすことは、即時的で普遍的かつ達成可能なアプローチである
意思決定ツリーがPDFに閉じ込められたときに生じる限界
- ガイドラインには専門腫瘍医たちの数十万時間に及ぶ作業が込められているが、最終成果物は密で探索しにくいPDFである
- 希少な乳がんサブタイプを数年に一度しか見ない腫瘍医は、正しいPDF版を見つけ、がんの特性に合うセクションを探し、複数ページのリンクをたどりながら患者要因を追跡し続けなければならない
- ガイドラインは継続的に改訂され、新版が別個のPDFとして配布されるため、更新を見逃したり、臨床文書の間に埋もれた古い版を参照したりしやすい
- 本質的にガイドラインは意思決定ツリーであり、作成チームは根拠を検討してこれをツリー形式に整理することに大きな労力を注いでいる
- 適切に構造化されたデータがあれば、機械がガイドラインを解釈できる
- カルテシステムが患者に必要な診断検査を自動提案できる
- 治療がガイドラインから外れるとき、警告や「本当によろしいですか?」モーダルを表示できる
- 医師はPDFを探す代わりに、より速く自然な方法でガイドラインを確認できる
- ガイドライン作成機関は、ダウンロード可能なPDFとともに構造化された機械可読形式を提供すべきであり、理想的にはすべての機関と患者データシステムが同じ形式を解釈できるべきである
- ただし、このようなデータアプローチはガイドライン作成機関の専門領域ではない
構造化ガイドラインの試作ツール
- ソフトウェアエンジニアとして腫瘍医と働いた経験をもとに、PDFに閉じ込められた意思決定ツリーを機械が理解できる構造へ抽出する概念実証ツールが作られた
-
スキーマ設計
- まず、NCCNガイドラインの大半の情報を表現できるスキーマを定義した
- ガイドラインは情報のツリーのように見えるが、一部の参照は戻ることがあるためサイクルが存在する
- 1つのがん種の全ガイドラインは、いくつかの相互に分離した有向グラフに分かれる
- 条件、限定特性、治療選択肢など各地点はノードとして表現され、関連文献や脚注もノードに保存される
- フローチャートの矢印やページ間参照はノード間関係として表現される
-
データ抽出
- 第1段階でLLMが文書を走査し、ガイドライン各ページの参照ノードを生成する
- ページ参照は各ページ最上位ノードの親ノードとなり、他ノードが特定ページを指すときはそのページノードを指す
- その後、LLMがガイドラインを小さなページ群ごとに読み、ページ参照を合わせて受け取り、スキーマのJSON表現として抽出する
- NCCN乳がんガイドラインにこのプロセスを適用してノードと関係をデータベースに保存し、合計271ノードが生成された
-
可視化
- React Flowライブラリでグラフビューアを作成し、流入参照のないルートノードであるページ群を表示する
- ノードをクリックすると子ノードが現れ、利用者はノードの流れに沿って下っていける
-
エージェント実装
- 患者病歴を入力してグラフを探索するエージェントが実装された
- まず患者状況に最も近い最上位ノードを見つけ、続いて子ノードの中から患者に最も適したノードを選ぶ
- このプロセスを、リーフノードに到達するか、進み続けるための情報が不足するまで繰り返す
- 試作ツールはこちらで利用可能
限界と次のステップ
- デモデータはレビューされておらず、誤りや欠落があるため、臨床意思決定に使用してはならない
- 抽出プロセスには数時間、エージェントにはそれより短い時間が投入されており、より多くの努力で精度を高められる
- 現在の精度は約**70〜80%**である
- LLM抽出はプロトタイプを作りやすい方法であり、人間によるレビューがあれば信頼性を高められるが、理想的な方法は最初から構造化された形でガイドラインを書くことである
- 現在のデータはなお半構造化状態にある
- 因果関係のような情報や各ノードをどう評価するかは、依然として各ノードの自然言語理解を必要とする
- 今後の作業では、より評価しやすい、さらに構造化されたスキーマを定義できる可能性がある
1件のコメント
Hacker News の意見
PDF のほうがよいと思う。カスタムツールは診療所や電子カルテごとに異なる可能性が高く、保守コストも高くつくはず
PDF はいろいろな面で微妙だが、長持ちして移植性が高い。2人の腫瘍内科医と仕事をしていても、同じ PDF を使えばよい
投稿者の意図はよいが、結局は本人にしか理解できないツールになり、無数の例外のせいでさらに悪くなる可能性が高い
これを作って医療機関に売ろうとしているわけではなく、構造化された診療ガイドラインで何ができるかを示したかったのです。これが特定の診療所や電子カルテに依存する理由はないと思います
理想的には、診療ガイドラインを作成する機関が PDF とともに構造化された表現も公開してくれるとよいです。作成ツールが両方の形式に出力でき、腫瘍内科医は引き続き PDF を使いながら、システムは構造化データを活用できます
地域の腫瘍内科医は国立がんセンターに比べて技術的リソースが限られている。彼らの生活を楽にできるならよいことだ
ただし PDF のような出版文書もよい。システムはたいてい、6月リリースと9月リリースを比較しにくくする
ウィザード型システムはほとんどの情報を隠し、未知のバグがあり得て、代替経路をざっと確認しにくく、登録ユーザーに縛られる可能性が高く、システムが落ちることもある
はるかに賢いコンピューターシステムが医療の未来だとは思うが、がん診療ガイドラインだけのための、また別のカスタムツールから始めるのが正しいのかは疑問だ
このアイデアは初めてではない。computable clinical guidelines で検索すると関連する学術文献が多く出てくるし、この論文はよい出発点になる [1]
実際、1970年代から試みがあり、有名な MYCIN エキスパートシステムが代表例だ [2]
MYCIN の歴史が示すように、この問題は見かけよりはるかに微妙で、技術的・心理的・社会学的・経済的要因が絡み合っている。がん診療ガイドラインが PDF にとどまっている理由もここにある
それでも探究を止める理由にはならない。前の世代が解けなかったからといって、解けない問題というわけではない
[1] https://pmc.ncbi.nlm.nih.gov/articles/PMC10582221/
[2] https://www.forbes.com/sites/gilpress/2020/04/27/12-ai-miles...
追加で NCCN の Developer API も見ておくとよい。技術的に面白いというより、知的財産権の環境を示している点で意味がある
https://www.nccn.org/developer-api
核心は、医師が自分の推奨が最新の臨床研究を本当に反映しているか確認しにくい点にある
また、研究の中心にいる権威ある医療センターの医師が持つ利点を、すべての医師にも提供できるという点が重要だ。よく知識伝播の問題と呼ばれるものだ
現在は Cochrane 基準に基づく系統的レビューが最良のアプローチだ [0]。こうしたレビューは労働集約的で、実施頻度が少なすぎるが、きちんと行われれば非常に価値が大きい
こうしたレビューでは、バイアスや不完全なデータセットといった理由で、公開された研究がどれほど頻繁に除外されるかも明らかになる
リンク先の Geiger のアプローチは意図は素晴らしいが、成果物は手作業の系統的レビューが直面するのと同じ問題にぶつかるはずだ
投稿者が機械学習アプローチだけでなく、Cochrane ガイドラインのようなルールベースのアプローチも検討したのか気になる
[0] https://training.cochrane.org/handbook
NCCN ガイドラインと Cochrane レビューは、医学において相互補完的な役割を果たします。NCCN は研究と専門家の合意に基づき、実用的で頻繁に更新されるがん治療アルゴリズムを提供し、Cochrane レビューはランダム化比較試験により強く焦点を当てた厳密なエビデンス分析を、医学全般に提供します
NCCN ガイドラインは臨床現場でより即時に適用しやすく、Cochrane レビューはエビデンスの質についてより深い分析を提供します
私の主な目標は、適切に構造化された医療ガイドラインなら何ができるかを示すことでした。基準は望むものを選べます
好奇心旺盛な一部の人は追っているが、全体的な態度としては、すでに大変な学校教育を終えたのだから、もうその必要はないというものだ
「診療ガイドラインの核心は意思決定木だ」という言葉は願望であり、目標にしても役に立たない場合がある
診療ガイドラインには、考えられるすべての意思決定経路を網羅するデータはほとんどない。十分に裏付けられた結果を報告し、一部の補間されたケースでは専門家の意見を示し、残りの一部については考慮すべき要因を列挙する程度である
これを意思決定木に縮約すると、多くの枝が空になり、ほとんどの専門家は、より複雑な木へとつながるべき要因を見つけられる
理由は、枝がほとんど決定的ではないからだ。むしろ量子的な確率に近く、複数の可能性を同時に保持しておく必要があり、治療が効果を示すか失敗した後になって初めて、病気、ここではがんがその姿を現す
診療ガイドラインの真の情報構造が捉えられるまでは、標準治療についての権威ある教育的な叙述として伝えられることになる
ほとんどの場合、採用率を上げるために単純化したり運用手順にしたりするよりも、より早く出版し、参考文献を付けて透明性を高めることの方が重要である
動的な分野の医師の大半は、単純化を必要としていない。資料の難しさは生涯にわたる自己規律と誠実さで乗り越え、診療ガイドラインは、既知の懸念事項を扱ったかを確認するためのコミュニケーションと完全性の枠組みとして主に使っている
構造化された診療ガイドラインは、主に外部者が観察し統制できるようにするものであり、そのやり方は生産的でない可能性が高い
なぜ人間の知識すべてが巨大な JSON ファイル一つに入っていないのだろうか。診療ガイドラインは意思決定木ではあるが、機械的に適用するために書かれているわけではない。仮定の中に存在する、同じがんを持つ同じ患者などいないからだ
診療ガイドラインは、がんとの時間との戦いの中で意思決定木をリアルタイムに下っていく映画の中の一匹狼の医師のためのものではなく、互いに慣れた形で協働する高度に訓練された臨床チームのためのものだ。彼らには、指針が間違っている、あるいは拡張・修正が必要な箇所を見抜く能力がある
つまり診療ガイドラインは、最新の診療水準の抽象化である
こうした指針を、何らかの医療用バージョン管理システムのソースコードのように扱い、サブスペシャリティや専門医が容易に修正したりフォークしたりできればよいと思う。しかし、生物学的依存関係はシリコンの依存関係よりはるかに複雑で、今後もしばらくは離散化がより難しいだろう
筆者の志が間違っているというわけではない。とても良いものだ。ただ、この領域の進展は、関係するチーム内で行われるときが最も容易だと思う。システムの外から概念的に単純に見えるものは、解像度が足りないためにそう見えるだけだ
読みたいものがあるなら、検索可能な紙の文書だ
データシートが今も PDF である理由と同じだ。信頼でき、長持ちし、移植性のある形式だからである
私たちが事実上、紙をまねているという点は滑稽だが、その隙間を埋める別の形式がない
本来の目的からすれば HTML がその役割を果たすべきだったが、ここ20年ほどの焦点は、HTML をより良い情報交換形式にすること以外のあらゆるところにあった
複雑な HTML 文書を単一ファイルにまとめるという些細なことにさえ、標準的な解決策がない。
file://URL では Cookie が動作せず、ごく基本的なものが動かなかったり存在しなかったりするその代わりに ePUB のような派生形式が出てくるが、大半は HTML であるにもかかわらず、実際にはほとんどのブラウザが対応していない
この10年で、2つのスタートアップでこのような計算機化された手順を2回実装したことがある
NCCN はそれをやりたがってはいない
NCCN ガイドラインは PDF に閉じ込められているのではなく、医師たちの頭の中に閉じ込められている
NCCN ガイドラインが計算機化されたルールとして入ると、そのルールが今度はガイドラインを導き始める。これは基礎科学から遠ざける第二の影響力になる
ルールの体系化が必要だという点には完全に同意するが、それは極めて頻繁に変化する、がんの最前線の知識に完全に従属していなければならない
毎年 ASCO のような主要な全がん領域の学会や、San Antonio Breast Cancer Symposium のような疾患別学会の後に知識が更新される必要があり、年をまたがなくても重要な臨床試験の結果が出れば、医師たちは最新の試験と継続教育を通じて知識を更新しなければならない。これは NCCN が出版する境界と相互補完的な、全体としての知識体系である
生涯にわたってコンピュータサイエンスと医学の両方にまたがって仕事をしてきた立場から、医師たちはプログラマーやデータベースよりもはるかに速くルールを更新できると信じている
NCCN ガイドラインを少数のプログラマーだけが理解するスパゲッティコードに閉じ込めず、誰でもリンクをたどって確認できる PDF として開いておいてほしい
追記:この記事を1週間ほど消化したら考えが変わるかもしれない。もしかすると NCCN は、臨床変数を十分に標準化して、ルールに変えることが些細な作業になるようにすべきなのかもしれない。ただし、臨床試験の仮説がそのルールの中に収まらなければならず、それが可能かどうかを見るには、さらに1週間ほど考える必要がありそうだ
意思決定木は意思決定を行ううえでは機能する
しかし、他の意思決定手法ほどよく機能するわけではない。ランダムフォレスト、線形モデル、ニューラルネットワークなども、本質的にはすべて意思決定手法である
データの多い複雑系、すなわち人間の健康では、意思決定木の性能は良くない
それなのに、なぜ PDF に書きやすく、会議で推論しやすく、誰かに説明しやすいという理由だけで、劣っていると知られている手法を使っているのだろうか
人間には理解できないほど複雑であっても、最も高い「治療」確率を出す最先端の数学モデルを使うべきではないのか?
人間には理解できないほど複雑なモデルなら、後になってデータ漏洩や別のバイアスだと判明したとき、法廷で説明するには実に素晴らしいものになるだろう
現実の医療行為は、こうしたデータ点の間を頻繁に補間している
がん研究者として見ると、NCCN ガイドラインの意思決定木の一部の枝は、複数の選択肢がプラセボよりはいずれも優れているが、相互の間では統計的に有意な差がなかった研究に基づいている
そのような場合、臨床医は別の要因を使ってどの経路を選ぶかを決められる。前立腺がんにおける手術と放射線治療が古典的な例だ。両者はおおむね同程度に有効だが、患者が経験する内容は大きく異なる
想像しているよりもはるかに深刻です。臨床腫瘍学試験の患者登録を扱うヘルスケア系スタートアップで働いていましたが、課題はとてつもなく大きかったです
正直、データがプレーンテキストで存在していても、大きな違いはないでしょう。診断コードは医療機関ごとに異なり、診断情報の意味論的な理解も医療機関ごとに異なり、電子カルテは混沌としていて、あらゆるものがデータ構造ではなく自然言語で書かれています
ヘルスケアソフトウェアに関わったことがある人なら、もっと多くの恐ろしい話を聞かせてくれるはずです
大規模言語モデルがその一部を整理する助けになってくれることを期待していますが、ヘルスケアソフトウェアをやったことがある人なら分かるように、この問題は技術の問題ではなく、非常に人間的な問題です
それでも明るい点が一つあります。同僚たちは圏論と Prolog を使って、証明可能に最適な 3+3 臨床腫瘍学の用量漸増試験プロトコルを見つけるうえで大きな進展を遂げました [1]
David は Vienna の Scryer Prolog ミートアップで、これについて素晴らしい発表をしました [2]
医学がどれほど暗黒時代にあるのか、驚くほどです。これが 3+3 がん試験のための初の実行可能でプログラム可能な仕様であるにもかかわらず、彼は今もなお、それが最適な試験であることを医療関係の同僚や病院管理者に納得させるために奮闘しています。驚くことではありませんが、彼らはソフトウェアや統計の言葉を話せないからです
[1]: https://arxiv.org/abs/2402.08334
[2]: https://www.digitalaustria.gv.at/eng/insights/Digital-Austri...
https://jakeseliger.com/
https://github.com/Precisfice/DEDUCTION