前のレッスンで、研究計画書を先に固定すると決めました。計画書ができても、まだ道具のログは研究データではありません。ログには、最初から患者を特定できる情報が混ざっています。ここでは、それをどこまで、どうやって取り除くかを決めます。
前のレッスンと同じ、外来の問診下書きをAIで作るツールを3か月使った場面で考えます(架空の例です)。このツールのログには、患者の氏名、カルテ番号、生年月日、そして医師が自由記載欄に打ち込んだ問診の下書き本文が残っています。下書き本文には、患者本人が話した言葉がそのまま入っていることも珍しくありません。これを一文一句このまま解析にかけると、研究データではなく個人情報の塊を扱うことになります。
混ざっているものを洗い出す
まず、ログに何が入っているかを棚卸しします。多くの道具のログには、次の3種類が混ざっています。
- 直接の識別情報: 氏名、カルテ番号、生年月日、連絡先。消せば個人情報でなくなる、分かりやすい部分です
- 自由記載に紛れ込んだ識別情報: 問診下書き・チャット履歴・メモ欄に、医師や患者が打ち込んだ氏名や固有の言い回し。ここは見落としやすく、目視での確認が要ります
- 准識別子: 単体では誰か分からないが、組み合わさると絞り込める情報。タイムスタンプ、診療科、年齢、そして希少な診断名の組み合わせがこれにあたります。小規模の診療科で「先月、あの日に来た患者」という情報だけでも、身近な人には十分な手がかりになります
1は機械的に削除できます。2と3は、削除リストを作っただけでは終わりません。次に、どこまで加工すれば安全と言えるかの基準を持ちます。
匿名加工情報と仮名加工情報、どちらを目指すか
個人情報保護法は、加工の程度によって2つの区分を置いています。
| 仮名加工情報(法第2条第5項) | 匿名加工情報(法第2条第6項) | |
|---|---|---|
| 定義 | 他の情報と照合しない限り、特定の個人を識別できないように加工した情報 | 特定の個人を識別できないように加工し、かつ元の個人情報を復元できないようにした情報 |
| 対応表(仮IDと元の情報の対応関係) | 保持してよい。照合すれば元に戻せる | 保持しない。戻せないことが前提 |
| 第三者への提供 | 原則として不可(内部利用に限る) | 本人の同意なしに提供できる |
出典: 個人情報保護委員会「匿名加工情報と仮名加工情報の違いは何ですか」
自分の道具のログを研究データに変えるときは、この2段階をそのまま作業の順番として使えます。解析している間、共同研究者内で共有している間は、仮名加工情報の水準で十分です。対応表を残しておけば、入力ミスに気づいたときに元のログへ戻って確認できます。一方、論文として外部に投稿するデータセット、あるいは学会の抄録に添付する生データは、対応表を捨てて匿名加工情報の水準まで進めてから渡します。両者を混同し、仮名加工情報のまま「匿名化済み」と呼んで外部に渡すことが、実務でいちばん起きやすい間違いです。
落とし穴: ログはそのまま研究データにならない
自分の道具のログを研究データに変える作業には、いくつか典型的な落とし穴があります。
- 自由記載欄をそのまま解析にかける。AI下書きツールのログには、患者の言葉や医師の所見がそのまま残っています。氏名だけ消して安心せず、本文を通しで読んで固有名詞が残っていないか確認します
- 准識別子を消し忘れる。氏名とカルテ番号を消しても、タイムスタンプ・診療科・年齢・希少な診断の組み合わせが残っていれば、身近な人には特定できることがあります。症例報告のように対象が1例に近いほど、この危険は大きくなります
- クラウドAIサービス側にログが残る。ツール自体が外部のAIサービスを呼んでいる場合、自分のサーバーからログを消しても、サービス提供者側に保持期間分のログが残っていることがあります。研究データに使う前に、そのサービスのデータ保持期間と学習利用への同意設定を確認します
- 対応表を研究用データと同じ場所に置く。分けたつもりでも、同じフォルダやスプレッドシートの別シートに置いていれば、実質的に分離できていません
データ管理計画: 最小の型
厳密なデータ管理計画は研究の規模に応じて作り込みますが、自分の道具を使った小規模な研究では、次の5点を先に決めておけば足ります。
- 生ログ(識別情報を含む元データ)の保存場所を1つに決め、アクセスできる人を研究責任者である自分に限定する
- 識別情報を削除し、仮IDに置き換えた「研究用データ」を、生ログとは別のファイル・別のフォルダに作る
- 対応表(仮IDと元の情報の対応)は暗号化し、研究用データとは別の場所に保存する
- 対応表をいつ捨てるか(仮名加工情報から匿名加工情報へ切り替える日)を、データを集め始める前に決めておく
- 共同研究者、査読者、投稿システムに渡すのは、常に研究用データの方。生ログや対応表を渡さない
この5点は、前のレッスンで固定した研究計画書と同じ発想です。データを見てから決めるのではなく、見る前に決めておきます。
データ管理計画の策定から収集・保存・整理・共有まで、研究データを段階ごとに扱うためのガイド
今日のまとめ
3行で振り返ります。
- 匿名加工情報は元に戻せない加工で本人同意なしに提供できる。仮名加工情報は対応表があれば戻せる分、内部利用に限られる。この2段階を作業の順番として使う
- 氏名やカルテ番号を消しても、自由記載欄の固有名詞や、タイムスタンプ・診療科・希少な診断の組み合わせで本人が分かることがある
- 生ログと研究用データを保存場所から分け、対応表を暗号化し、対応表を捨てる日を先に決めておく
次のレッスンでは、匿名化した研究データを、学会の抄録からポスター、論文へと膨らませる手順に進みます。
参考文献
- 個人情報保護委員会. "匿名加工情報と仮名加工情報の違いは何ですか". https://www.ppc.go.jp/all_faq_index/faq1-q14-1/
- 個人情報の保護に関する法律(平成15年法律第57号)第2条第5項・第6項. e-Gov法令検索. https://laws.e-gov.go.jp/law/415AC0000000057
セルフチェック
1. 個人情報保護法における仮名加工情報と匿名加工情報の違いとして正しいものはどれか
2. 道具のログを研究データに変えるときの落とし穴として正しい説明はどれか
3. 生ログと研究用データの扱いとして適切なものはどれか