利益:
- データ サイエンスの 6 段階のワークフロー (問題定義、収集、クリーニング、発見、モデリング、コミュニケーション) と、タスクのリスク レベルに応じて各段階で人工知能が動作する権限を区別する能力
- 人工知能の各出力をソースに接続し、実行して比較し、専門家のフィルタリングを通過させることで検証する規律を適用する能力。
- 再現性とプライバシーの原則 (コードへの書き込み、匿名化) を初日から分析の習慣に変える能力
データサイエンティストのデスクには、生の、乱雑な、多くの場合「嘘」のデータが毎日置かれます。 sales テーブルでは、日付列が 3 つの異なる形式で書き込まれます。顧客番号が一部の行で空白になっています。列の名前は「収入」ですが、TL 値と USD 値の両方が含まれています。データ サイエンスの仕事は、この混沌から信頼できる意思決定を下すことです。つまり、データを収集し、クリーニングし、探索し、モデルを構築し、結果を検証し、それをストーリーに変えることです。人工知能 (AI、略して AI、テキストとコードを生成し、パターンを認識し、要約し、予測を行うことができるコンピューター システム) は、このチェーン内のすべてのリンクに触れることができます。クリーンアップ コードを数分で作成し、探索的分析のためのグラフを推奨し、モデルのメトリクスを解釈し、SQL クエリを修正します。しかし、同じ AI は、これまで見たことのないデータに対して「相関 0.72」などの自信に満ちた捏造を与えることもできます。
この最初の単元はライブラリの紹介ではありません。その目的は、データ サイエンス ワークフローのどこに AI を配置するか、どこに配置しないかを明確にすることです。最初から基本原則を説明しましょう。AI はアシスタントであり、データ サイエンティストではありません。どのようなデータを収集するか、どのようなメトリクスを決定するか、モデルを運用環境に導入するかどうか、および倫理的境界線をどこに引くかは、有能な専門家が決定します。未検証の AI 出力は、署名のない分析レポートと同様に危険です。
データ サイエンス ワークフロー: エンドツーエンド マップ
データ プロジェクトを理解するには、プロジェクトを 6 つのフェーズに分類すると役立ちます。このモジュール全体はこのマップに従います。
1. 問題定義: どの決定をサポートするために、何を、なぜ測定するのでしょうか?このフェーズは AI には委任されません。仕事を定義するのは人です。
2. データ収集: ソースの特定、データの抽出、サンプリング。 (2号機)
3. データのクリーニングと前処理: 欠損値、外れ値、型変換。 (3号機)
4. 探索的データ分析 (EDA - 探索的データ分析、データの分布と関係を「目で」認識する段階): (ユニット 4)
5. 特徴エンジニアリングとモデリング: 変数の生成、アルゴリズムの選択、トレーニング、評価。 (5号機、6号機、7号機)
6. コミュニケーションと制作: ビジュアライゼーション、ストーリー、MLOps (モデルを実際に使用してモニタリングする規律)。 (8号機、11号機)
AI は、これら 6 つの段階ごとに異なる権限で動作します。以下の表は、この権限の配分をまとめたものです。これは、モジュールの唯一の最も重要なテーブルです。
ステージ
AIの役割
リスクレベル
誰が承認するか
問題の定義
ブレーンストーミングのパートナー
低い
データサイエンティスト + 関係者
クリーンアップコードを書く
コードスケッチジェネレーター
中程度
データサイエンティスト(コードを読む)
EDAのコメント
パターン提案者
中程度
データサイエンティスト
特徴生成
アイデアとコードジェネレーター
中~高
漏れ管理は必須です
モデルの選択/メトリック
コンサルタント
高い
データサイエンティスト
量産化の決定
補助入力
非常に高い
チーム + ビジネスオーナー
倫理/プライバシーの承認
興奮剤
非常に高い
人間、いつも
このグラフの一文を心に留めておいてください。賭け金が高まるにつれて、AI の役割は縮小し、人間の承認は増大します。
検証がこのビジネスの中心である理由
AI 言語モデルは確かであるように見えますが、確かではない可能性があります。専門用語では、これは幻覚と呼ばれます。これは、モデルが、存在しない情報を流暢な文章で、あたかも真実であるかのように捏造することです。データ サイエンスでは、これには 3 つの形式があります。 1 つ目は偽の数値です。データを何も与えずにモデルに「平均注文金額はいくらですか」と尋ねると、データを一度も見たことがないにもかかわらず、モデルは自信を持って数値を教えてくれます。 2 つ目は存在しない関数です。モデルは、pandas.read_excel_fast() など、まったく存在しない関数を提案する場合があります。 3 番目に、統計的解釈が間違っています。モデルは、「p 値は 0.04 であるため、仮説は 96% 正しい」などの古典的な統計的エラーをスムーズに繰り返すことができます。
検証規律は 3 つのステップで構成されます。
- 出典へのリンク: すべての数値、レート、傾向は、AI のメモリではなく、データから取得される必要があります。 AI はデータを記憶するためではなく、データを操作するコードに使用します。
- 実行して比較: AI によって与えられた各コードを自分で実行します。生成される各メトリックを独立したベースラインと比較します。
- エキスパート フィルター: 出力が統計やドメインの知識と矛盾するかどうかを自分でテストします。
注意: AI によって書かれた分析を、実行したり読んだりせずにプレゼンテーションに組み込むことは、署名のないレポートを提示するようなものです。コードが機能するからといって、それが正しいとは限りません。間違った列を合計するコードもエラーなしで機能します。
再現性: 同じ結果を 2 回生成できること
データ サイエンスの静かだが重要な原則は再現性です。6 か月後に分析を再度実行するか、別のコンピューターで分析を実行しても、同じ結果が得られます。 AI を使用する場合、このリスクは高まります。AI に「このグラフを作成して」と指示して手動で再生すると、手順が消えてしまうからです。ルール: すべてのステップはコードとバージョン管理 (Git など) に登録する必要があります。ランダム性を伴うステップでは、ランダム シード (乱数発生器の初期値。固定されている場合、結果は再現可能になります) を固定する必要があります。このトピックについてはユニット 10 でさらに詳しく説明します。とりあえずは、「手でクリックするのではなく、コードを書く」という習慣を身につけてください。
ミニケース3個
ケース 1 — 安全な加速。電子商取引アナリストは通常、24 万行の注文テーブルをクリアするのに半日を費やします。彼は列名と最初の 5 行 (個人データなし) を AI に与え、パンダのクリーニング コードを要求しました。 AI は 8 秒でドラフトを作成しました。アナリストはコードを 1 行ずつ読み、日付解析のエラーを修正して実行しました。期間: 4 時間ではなく 35 分。コードは AI が提供し、検証は人間が行いました。
ケース 2 — でっち上げられたメトリック トラップ。インターンは AI に「このデータに対するランダム フォレストの精度はどのくらいですか?」と尋ねました。モデルをまったくトレーニングせずに。 「約89%です」とAIは言いました。インターンはこれをプレゼンテーションに盛り込みました。実際のモデルがトレーニングされたときの精度は 71% でした。間違い: AI にデータとモデルを与えずにメトリクスを待っている。
ケース 3 — サイレントリーク。あるチームは、AI が提案した「対象変数の平均を特徴量として追加する」というアイデアを何の疑問も持たずに実装しました。モデルはテスト セットで 98% のパフォーマンスを示しましたが、機能が将来の情報を漏洩していたため、本番環境ではクラッシュしました (データ漏洩、ユニット 10)。間違い: AI レコメンデーションを統計的にフィルタリングしていません。
弱いプロンプト / 強いプロンプト
弱いプロンプト:
この販売データを分析して、平均収益を教えてください。
この主張には欠陥があります。AI にはデータが与えられていないため、「平均収入」はでっち上げることしかできません。列も期間も通貨も明確ではありません。
強力なプロンプト:
あなたの役割: データ サイエンティストを支援するアシスタント。パンダのデータフレーム: df があります。列:- order_date (テキスト、形式「2024-03-01」)-amount_tl (10 進数、一部の行には NaN)-customer_id (整数)タスク: (1) 平均金額を計算する pandas コードを作成します。(2) NaN 値を処理する方法を説明します。(3) コードが行う仮定をリストします。データの内容をでっち上げないでください。コードを生成するだけで、実行して結果を確認します。
この要望書では、その企み、思惑、そして「捏造の禁止」が明確である。それでも、自分で実行して出力を確認します。
倫理とプライバシーの始まり
データ サイエンスは、顧客、患者、従業員の記録などの個人データを扱うことがよくあります。トゥルキエの KVKK (個人データ保護法) とヨーロッパの GDPR はこのデータを保護します。実名、ID、メールアドレス、または住所を公開 AI ツールに貼り付けることは違反です。ルール: 共有する前にデータを匿名化し、必要に応じてスキーマ (列名、型) とダミーのサンプル行のみを提供します。ユニット 11 では倫理のトピックを深めます。最初から原則を述べましょう。データを理解するには、多くの場合、その内容ではなく構造を共有するだけで十分です。
よくある間違い
- AI にデータを与えずに数値や指標を待つ。モデルはデータにアクセスできません。彼が与えた番号は偽物です。常に結果を計算して実行してください。
- 動作しているコードが正しいと考えている。間違った列を操作するコードもエラーなしで実行されます。ロジックを読まずに信用しないでください。
- 実際の個人データをオープンツールに貼り付ける。名前、ID 番号、電子メールは決して共有されません。図だけで十分です。
- 手順をコードに書き込むのではなく、手動で実行します。再現性のない分析は信頼性がありません。
- AIによる統計の解釈を何の疑問も持たずに受け入れる。 AI は、p 値や相関関係などの概念における古典的な間違いを繰り返す可能性があります。
ヒント: 各 AI セッションに短い「ルール ライン」を含めます。「データ コンテンツを作成しないでください。コード/分析を生成するだけで、実行して結果を検証します。不明な点は「わからない」と示してください。」この一文で幻覚のリスクが大幅に軽減されます。
要約すれば
AI はデータ サイエンスにおける強力なアシスタントです。コードのクリーニング、EDA の解釈、モデルの推奨と視覚化を加速します。しかし、問題の定義、指標の選択、生産の決定、倫理的境界は人間に属します。ワークフローは6段階に分かれており、リスクが高まるにつれてAIの役割は小さくなる。ソースのリンク (検証)、再現性 (コーディング)、匿名化 (機密性) という 3 つの習慣がすべての基礎です。これら 3 つを習得すると、モジュールの残りのすべてのツールが安全なアクセラレータになります。
アプリケーションタスク
所有している小さなテーブル (または仮説テーブル) のスキーマを作成するだけです。列名、型、および 2 ~ 3 個のダミーのサンプル行 (実際の個人データは含まれません)。上記の「強力なプロンプト」テンプレートを使用して、AI に要約統計コードを要求します。コードを実行し、出力を手動の値と比較し、誤った仮定がないか確認して、結果を 5 つの箇条書きで書き留めます。
チェックリスト
- [ ] AI に本物の個人データの代わりにスキーマと偽のサンプルを与えただけでしょうか?
- [ ] 生成されたコードを 1 行ずつ読んで実行しましたか?
- [ ] 出力内の各数値を個別に検証しましたか?
- [ ] 分析のすべてのステップをコードに記述し、繰り返し可能にしましたか?
- [ ] 私はミッションのリスクレベルを決定し、最終決定を人間に割り当てましたか?