メインコンテンツへスキップ

AIを使った研究を正しく報告する

  • レッスン 5 / 6
  • 13

自分の道具や予測モデルを使った研究を、TRIPOD+AI・CONSORT-AI・SPIRIT-AIのどれで報告すべきかを見分け、方法にAIの使い方をどこまで書けば読み手が検証できるかを型として身につける。

このレッスンで

終わる頃には、次ができるようになります

  • TRIPOD+AI・CONSORT-AI・SPIRIT-AIが対応する研究デザインを見分けられる
  • AIの使い方をMethodsに書くとき欠かせない項目を挙げられる
  • 自分の道具を使った研究を報告する前に確認すべき指針を選べる

前のレッスンまでで、道具のログを研究に見立て、計画書を書き、抄録からポスター、論文へと膨らませる流れを扱いました。ここで一段立ち止まります。あなたの道具がAIを使ったものだった場合、論文のMethodsには「何を使ったか」だけでなく「AIをどう使ったか」を書く必要があります。それを怠ると、査読の段階で差し戻されます。

なぜ専用の報告指針が要るのか

STROBEやCONSORTのような既存の報告指針は、AI特有の要素を想定して作られていません。モデルのバージョン、入力データの選び方、AIの出力を人間がどう判断に使ったか。これらは従来の報告指針の項目には無い情報で、書かなければ読み手はあなたの研究を再現も検証もできません。

この空白を埋めるために、2020年から2024年にかけて、研究デザインごとに3つの拡張指針が作られました。いずれも国際的な合意形成プロセス(Delphi調査・パネル会議・パイロット試験)を経て発行されています。

3つの指針、どれが自分の研究に当たるか

道具の使われ方によって、当てはまる指針が変わります。

TRIPOD+AI 予測モデルを作った・検証した

対象は、回帰モデルであれ機械学習モデルであれ、何かを予測するモデルの開発または検証を報告する研究です。2024年4月16日にBMJに掲載され(Collins GS, Moons KGM, Dhiman P, ほか。BMJ 2024;385:e078378)、回帰モデルと機械学習モデルを単一のチェックリストで扱う統合仕様になっています。

CONSORT-AI AIを使った介入の効果を試験した

対象は、AIを組み込んだ介入(診断支援ツール、トリアージツールなど)の効果を検証するランダム化比較試験です。CONSORT 2010に14項目を追加する形で、2020年9月9日にNature Medicine・BMJ・Lancet Digital Healthに同時掲載されました(Liu X, Cruz Rivera S, Moher D, ほか。Nat Med 2020;26(9):1364-1374)。

SPIRIT-AI AIを使った介入試験のプロトコルを書く

対象は、CONSORT-AIが対象にする試験を実施する「前」に書く試験プロトコルです。SPIRIT 2013に15項目を追加し、CONSORT-AIと同じ2020年9月9日に同時掲載されました(Cruz Rivera S, Liu X, Chan AW, ほか。Nat Med 2020;26(9):1351-1363)。プロトコルの段階からAIの扱いを明記させることで、試験が始まってからの後付け説明を防ぐ設計です。

見分け方は単純です。予測モデルそのものを作った・検証したならTRIPOD+AI。AIを使った介入を人に試してその効果を見る試験なら、計画書はSPIRIT-AI、結果報告はCONSORT-AIです。

名称の表記に注意する

設計段階の作業名は「TRIPOD-AI」でしたが、2024年に発行された正式名称は「TRIPOD+AI」です。ハイフンではなくプラス記号が付きます。EQUATOR Networkの現行掲載名もTRIPOD+AIで統一されています。一方でCONSORT-AIとSPIRIT-AIは、ベースになったCONSORT・SPIRITと同じくハイフン表記のままです。古い記事や下書き段階の資料に「TRIPOD-AI」という表記が残っていても、それは2024年の正式発行前の呼び方だと理解してください。

Methodsに何を書けば十分か

3つの指針は対象デザインが違いますが、AIの使い方を書かせる項目には共通の骨格があります。自分の道具を報告するとき、次の6点が揃っているかを確認してください。

  1. AIの仕様とバージョン: どんな種類のモデルか、なぜその種類を選んだか、構築の全ステップ(ハイパーパラメータ調整を含む)
  2. 入力データの取得・選定方法: データをどこから、どう選んで入れたか。質が低い・欠損したデータをどう扱ったか
  3. 人間とAIの相互作用: 入力の段階と出力の段階、それぞれで人間がどこに関与したか。全自動ではなく人が確認した箇所はどこか
  4. AIの出力が意思決定にどう寄与したか: 出力をそのまま採用したのか、参考情報として人間が最終判断したのか
  5. 性能評価に用いた指標: 識別能・較正など、何をどう測ったか。クラス不均衡への対処をしたならその方法と根拠
  6. 第三者が検証できる形での提供: モデルの数式・コード・APIを、第三者が実装・検証できる形で示せるか。解析コードを公開しているか

この6点は、TRIPOD+AIの項目12c・12e・13・22・18f、CONSORT-AIの項目5(i)〜(vi)、SPIRIT-AIの項目11a(i)〜(vi)に相当します。どの指針を使う場合も、この骨格を埋めればMethodsの土台ができます。実際に投稿する際は、該当する指針のチェックリスト原文で項目番号ごとに漏れを確認してください。

日本語資料の現在地

TRIPOD+AIには有志翻訳による日本語版(version 1.1、2025年3月19日作成)があります。一方でCONSORT-AI・SPIRIT-AIについては、ベースになるCONSORT 2010・SPIRIT 2013の日本語版はconsort-spirit.org上に存在するものの、AI拡張版の公式な日本語訳は同サイトに掲載されていません。ウェブ検索でも公式訳の存在は確認できませんでした。非公式の訳が別途あるかどうかまでは確認が取れていないため、[要確認: CONSORT-AI・SPIRIT-AIの非公式日本語訳の有無]としておきます。当面は英語の原文チェックリストに直接当たるのが確実です。

例で確認する(架空の設定)

架空の設定で当てはめてみます。ある医師が、外来の問診記録から重症度を予測する小さなモデルを作り、自施設のデータで性能を検証したとします。これは「予測モデルの検証」なので、報告にはTRIPOD+AIが当たります。Methodsには、モデルの種類(たとえばロジスティック回帰か勾配ブースティングか)、学習に使った入力データの選び方、欠損データの扱い、感度・特異度など評価に使った指標、そして第三者が同じモデルを再現できる形(数式または公開コード)を書きます。もし将来、このモデルを実際の外来判断に組み込んでランダム化比較試験を行うなら、その計画書はSPIRIT-AI、結果はCONSORT-AIで報告することになります。

今日のまとめ

  • AI特有の報告指針が要るのは、既存の報告指針がモデルのバージョンや人間とAIの相互作用を想定していないため
  • 予測モデルの開発・検証はTRIPOD+AI、AIを使った介入試験のプロトコルはSPIRIT-AI、その結果報告はCONSORT-AIに当たる
  • Methodsには、AIの仕様・入力データの扱い・人間とAIの相互作用・出力の使われ方・評価指標・第三者検証可能性の6点を書く

次のレッスンでは、報告まで終えた研究を次の研究につなげる、助成金申請の骨組みに進みます。

参考文献

  • Collins GS, Moons KGM, Dhiman P, et al. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024;385:e078378. DOI
  • EQUATOR Network. TRIPOD Statement(現行掲載ページ、TRIPOD+AIとして掲載)リンク
  • Liu X, Cruz Rivera S, Moher D, et al. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: the CONSORT-AI extension. Nat Med. 2020;26(9):1364-1374. DOI
  • Cruz Rivera S, Liu X, Chan AW, et al. Guidelines for clinical trial protocols for interventions involving artificial intelligence: the SPIRIT-AI extension. Nat Med. 2020;26(9):1351-1363. DOI
  • TRIPOD+AI Expandedチェックリスト 有志翻訳による日本語版 version 1.1(2025年3月19日)PDF

セルフチェック

1. 自分で作った予測モデルの開発と検証を論文として報告するとき、当てはまる指針はどれですか

2. TRIPOD+AIの正式名称の表記として正しいものはどれですか

3. AIの使い方をMethodsに書くとき、3指針に共通して求められる項目はどれですか

このレッスンは役に立ちましたか?