報告書や論文に書かれている数字を、そのまま信じて引用してよいのか迷うことがあります。集計元のデータで確かめたくても、同じ計算を手元でやり直すのは時間がかかり、検定の種類や除外条件まで再現しようとするとさらに手間が増えます。
ここでは、生データのCSVをClaudeに渡し、記述統計と指定した検定を実際にコードで計算させ、報告書の数値との突き合わせ表を作らせる頼み方を紹介します。
CSVの添付と、コードを実行しての計算・再検定
生データのCSVファイル、報告書や論文に書かれている該当数値、確かめたい検定の種類
10分程度
1. 頼み方
そのまま使えるプロンプトです。〔 〕の部分を自分の場面に置き換えて、後ろに生データのCSVを添付してください。
添付は〔報告書 / 論文〕に載っている数字のもとになった
生データ(CSV)です。
1. 記述統計:各変数の〔平均・中央値・標準偏差など、
確認したい統計量〕を計算してください
2. 検定の再計算:〔使う検定名、例:対応のないt検定〕で、
〔比較したい群・変数〕の差を計算し直してください
3. 突き合わせ:計算し直した数字と、報告書に書かれている
数値(〔該当箇所の数値、例:平均差2.3、p=0.03〕)を
並べて、一致しているか差があるかを表にしてください
どの数字も、実際にコードを実行して計算してください。
目算や推測での概算は使わないでください。使った検定・関数・
除外したデータの範囲も、最後に手順として箇条書きで示してください。「実際にコードを実行して」と一言添えているのには理由があります。何も指定しないと、Claudeは実際に計算せず、それらしく見える数字を目算で示すことがあります。出力だけを見ても、実際に計算した数字か推測で書かれた数字かは区別がつきません。
2. 渡すもの
渡すのは、生データのCSVファイルと、報告書や論文の該当箇所(数値が書かれている部分の抜粋で十分です)です。どの検定を使うかも、この時点で自分で決めて伝えてください。決め方は5節で扱います。
該当箇所は、小数点の桁数や単位まで、報告書に書かれているとおりに貼り付けてください。書き写す際に丸め方を変えてしまうと、あとの突き合わせが不正確になります。
CSVファイルの添付と中身の表示だけなら、追加の設定は不要です。ただし記述統計や検定を実際にコードを実行して計算し直させるには、設定の「Capabilities」で「コード実行とファイル作成」がオンになっている必要があります(無料・Pro・Maxは手動でオン、Team・Enterpriseは既定でオン)。
注意
個人を特定できるデータは、渡す前に外す
生データに氏名・ID・連絡先など、個人を特定できる列が含まれていないか、添付する前に確認してください。含まれている場合は、該当列を削除するか、通し番号などの匿名化した値に置き換えたコピーを別に作ってから渡します。詳しくは5節で扱います。
3. 返ってくるもの
出力は、記述統計、検定の再計算結果、報告値との突き合わせ表、使った計算手順の4つに分かれて返ってきます。以下は架空の例です。実際の数値ではありません。
| 変数 | N | 平均(SD) | 中央値(IQR、四分位範囲) |
|---|---|---|---|
| 介入群 | 42 | 12.4(3.1) | 12.0(10.5-14.0) |
| 対照群 | 40 | 10.1(2.8) | 10.0(8.5-12.0) |
検定の再計算(架空の例): 「対応のないt検定を実行した結果、平均差2.3(95%信頼区間 1.1-3.5)、p=0.031。報告書の記載(平均差2.3、p=0.03)とおおむね一致します。」
使った計算手順(架空の例):
- 使用した検定: 対応のないt検定(両側)
- 除外したデータ: 欠損値を含む行3件を計算から除外
- 使用した列: 「スコア」列と「群」列
この突き合わせは、Claudeが渡されたデータと指示した検定に基づいて実際に計算した結果です。 それでも、除外基準の解釈違いや列の取り違えが起きていないか、返ってきた手順の記述を必ず読んでから使ってください。
数字が一致しない場合、まず疑うべきは報告書の誤りではなく、自分が伝えた検定や除外条件が報告書の方法と本当に同じかどうかです。除外した行数や、対応のある/なしの設定、丸め方が違うだけでも数字はずれます。原因が絞れないときは、「〔差の内容、例:平均差が2.3ではなく2.1になった〕理由として考えられる違いを挙げて」と聞き、除外行数・検定の前提・丸め方の順に候補を確かめてください。
4. 続けて頼むこと
突き合わせができたら、同じ会話のまま続けて2つのことを頼めます。
感度分析は、除外基準の違いで結論が変わるほど不安定な結果ではないかを確かめる目的で使います。図の作り直しは、報告書の図を手作業で再現する手間を省くために使います。
5. うまくいかないとき
欠損・外れ値の前提を先に確かめる
何も指定しないと、Claudeは欠損値や外れ値をどう扱うかを自分で判断して計算を進めてしまいます。除外した行数や条件は返ってきた手順の中に書かれているはずなので、まずそこを確認してください。自分の想定と違う扱いになっていたら、「欠損値は除外せず、〔補完方法〕で埋めてから計算し直して」のように、扱い方を具体的に指定して頼み直します。
どの検定かを指定する
検定の名前を指定しないと、Claudeはデータの形からそれらしい検定を選んで計算します。ただし、対応のある/なし、群分けの単位、分布の前提といった判断は、データの集め方を知っている自分にしか正しく決められません。1節のプロンプトのように、使う検定を先に指定してください。迷う場合は、「候補となる検定とその前提条件を先に挙げて」と聞き、前提条件が満たされているかを自分で確認してから、実際の計算に進んでください。
個人を特定できるデータを入れない
生データには、氏名・ID・生年月日・自由記述欄など、個人を特定できる情報が含まれていることがあります。計算に必要なのは変数の値であって、誰のデータかではありません。渡す前に、該当する列を削除するか、通し番号などの匿名化した値に置き換えてください。元の記録と照合する必要がある場合、対応表はClaudeに渡さず社内の安全な場所に別で保管します。