利益:
- トピック、レベル、難易度の分布を指定して、人工知能に多肢選択問題、典型的なエラーに基づく注意散漫、および解決策のキーを生成させる機能。
- SymPy を使用して、各質問と回答キーを個別に (できれば一括で) 検証することにより、間違ったキーや複数/0 個の正しいオプションのエラーを検出する機能
- 気が散る要素の質、質問の曖昧さのなさと難易度のバランスを評価し、試験を受ける前に各質問を承認する能力。
試験問題と練習問題の準備は、数学教育において最も時間のかかる作業の 1 つです。適切な難易度の問題を設定し、もっともらしい気を散らすもの (間違っているがもっともらしい選択肢) を設計し、解答キーを準備し、難易度のバランスを取るには何時間もかかります。人工知能はこのプロセスをスピードアップし、1 つのトピックから数十の質問のバリエーション、複数の選択肢、解決策の鍵を生成します。ただし、生成された各質問の正確性と各回答キーに誤りがないことは、個別に検証する必要があります。キーが間違っていると、生徒は不当に減点されてしまいます。この単元では、AI を質問生成パートナーとして使用する方法と、各質問をモデレートする方法を学びます。
いくつかの定義。注意をそらすものは、正解ではないものの、生徒が犯す可能性のあるよくある間違いに対応する多肢選択問題の選択肢です。優れた気を散らすものはランダムではありません。典型的なエラー (符号エラー、ルールの混乱) を反映しています。回答キーは、質問に対する正解のリストです。難易度バランスとは、試験における簡単、中、難しい問題の適切な配分です。
質問生成へのAIの貢献
- 質問のバリエーション: パターンからの複数の類似した質問 (数字を変更)。
- 気を散らすデザイン: 一般的なエラーに基づく、おそらく間違った選択。
- 解決策の主要な概要: 各問題に対する段階的な解決策。
- 難易度の評価: 質問を簡単/中程度/難しいに分類します。
- 対象範囲: シラバスのさまざまなサブトピックをカバーする一連の質問。
- ブルーム分類法適合:記憶する、適用する、分析するなどの認知レベルに応じた質問。
ステップバイステップ: 信頼できる一連の質問を生成する
1. トピック、レベル、質問数を指定します。 「高校10年生、二次方程式、選択問題10問」みたいな。
2. 問題の種類と難易度の分布を尋ねます。 「簡単 4 つ、中程度 4 つ、難しい 2 つ」のような配分を要求します。
3. Solve each question independently.各質問を自分で、または SymPy を使用して解決します。 YZ が提供する回答キーと比較してください。このステップには交渉の余地はありません。
4. 気が散るものがないか確認します。間違った選択肢は本当に間違っているのでしょうか?場合によっては、AI が複数の正しい選択肢を生成したり、気が散るものが実際には正しい場合もあります。各オプションを確認してください。
5. 正解が 1 つだけ存在することを保証します。多肢選択では、1 つの選択肢だけが正しい必要があります。ゼロまたは複数の正解があってはなりません。
6. 不確実性や重複がないかチェックします。質問は一意ですか? 2 つの質問は同じことを測定しますか?数値は妥当ですか (ルートが負であるべきかどうかなど)。
注意: AI は、多肢選択式の質問を生成するときに、最もよくある 2 つの間違いを犯します。(1) AI が「true」とマークした選択肢が実際には間違っている、(2) 複数の選択肢が正しい、またはどれも正しくない。各質問を個別に解決し、4 つの選択肢をそれぞれ真/偽として個別に評価することなく、質問を使用しないでください。
質問品質管理表
コントロール
質問
何を探すか
精度
解答キーは正しいですか?
独自のソリューションによる確認
唯一の真実
正しい選択肢は 1 つだけですか?
残りの3つは間違っているはずです
ディストラクターの品質
その間違いは納得できるものでしょうか?
典型的なエラーに基づいている必要があります
明瞭さ
質問は一意ですか?
不確実性があってはなりません
レベル準拠
難易度は目的に適していますか?
簡単すぎず難しすぎず
範囲
トピックは適切に表現されていますか?
サブトピックのバランスが取れている
ミニケース3個
ケース 1 — 間違ったキー。教師は 12 問からなる多肢選択式の質問を作成しました。 SymPy で各問題を解いたところ、12 問中 3 問で、AI が「正解」とマークした選択肢が間違っていたことがわかりました。実際の正解は別の選択肢でした。先生は鍵をまっすぐに直した。このセットを検証せずに使用していたら、クラス全体が 3 つの質問で不当な評価を受けていたでしょう。
ケース 2 — 2 つの正しい選択肢。ある質問では、AI は「x = 2」と「x = 2 または x = −2」の両方を入力しました。どちらもある意味では真実であり、質問は不明確でした。教師は選択肢を並べ替えて、正解を 1 つだけ残しました。妨害者は明らかに間違っている必要があります。
ケース 3 — 弱い気晴らし。工学の授業では、AI が「42」、「aksaray」、「blue」、「17」などの無関係な気を散らすものを質問に挿入しました。正解は明らかに「17」でした。教師は、典型的な計算エラー (符号誤差から生じる値など) に基づいた数値的な注意をそらす要素を要求し、質問は真の識別要素になりました。良い気を散らすものは、真の誤った道を表します。
コピー可能な 4 つのテンプレート
1) 多肢選択式の質問セット:
[トピック] について [n] 個の多肢選択式の質問を生成します。レベル:[レベル]。難易度: [x 簡単、y 中、z 難しい]。各質問に 4 つの選択肢があるようにします。正確な 1 が正解で、他の 3 は典型的なエラーに基づくもっともらしい注意をそらすものであるとします。各質問に対する段階的な解決策と正答も書きます。それらをすべてSymPyで検証してみます。
2) 質問のバリエーション (パターンから):
この質問を PATTERN: [サンプル質問] として取り上げます。同じコンセプトを測定するが、数値/コンテキストが異なる [n] 個の異なるバージョンを生成します。各バージョンの答えを段階的に解決してください。答えがそれぞれ異なるものにしてください。
3) ソリューションキーの生成:
以下の各質問に対する段階的な解決策と最終的な回答を作成してください。使用するルールを指定します。不明な解決策にマークを付けてください。それぞれの回答を個別に検証します。質問:[こちら]
4) 気を散らす要素の改善:
この多肢選択問題の注意をそらす要素を確認してください。それぞれの間違った注意散漫要因が生徒のどの典型的な間違いに対応するかを説明してください。無関係な、または明らかに不正確な注意をそらす要因を、実際のエラーに基づいたものに置き換えます。質問: [ここ]
弱いプロンプト / 強いプロンプト
弱者: 「派生的な質問を 10 個やってください。」
結果: 不確実なレベル、ランダムな難易度分布、未検証の解答キー、ランダムな一連の注意散漫要素 (存在する場合)。
Strong: 「高校 12 年生向けに、多肢選択式の導関数問題を 10 問作成します。簡単な 4 問 (基本ルール)、中程度の 4 問 (連鎖/積のルール)、難しい 2 問 (複合関数)。各質問には 4 つの選択肢があり、正確に 1 つ正解します。残りは典型的な間違い (内導関数の忘れ、符号誤り) に基づく注意をそらすものです。各質問を段階的に解き、正しい答えを示してください。」
結果: 水平でバランスが取れており、気を散らす要素が含まれているセットには意味があり、すべての答えは監査可能です。
よくある間違い
- 回答キーを検証していません。 AI が「正しい」と言うものは、多くの場合、間違っています。各質問を個別に解決してください。
- 1 つ以上またはゼロが正しいオプションです。多肢選択では、真実は 1 つだけ存在する必要があります。各オプションを個別に確認してください。
- 弱い気を散らすもの。無関係な選択肢や明らかに間違った選択肢があると、質問が分かりにくくなります。
- 難易度分布の指定はありません。それらはすべて同じ難易度のように見えます。レベル評価はできません。
- 繰り返しと重なり。異なる質問が同じ概念を測定する場合があります。カバレッジバランスを確認します。
- 曖昧な表現。二重の意味を持つ質問は、生徒を不当に誤解させます。
ヒント: 一連の質問を検証する最も効率的な方法は、SymPy を使用してすべての質問を一度に解決するコードを作成することです。 AI に「SymPy でこれら 10 個の問題をそれぞれ解決するコードを書いてください」と指示し、コードを実行して、SymPy の結果を AI の回答キーと一括比較します。このようにして、10 個の質問を 1 つずつチェックするのではなく、まとめて決定的にチェックします。
要約すれば
AI は数学の問題と試験の生成を劇的にスピードアップします: 問題のバリエーション、注意をそらす要素の設計、解決策のキー、難易度の評価。ただし、各質問と各回答キーは個別に検証する必要があります。できれば SymPy で一括検証する必要があります。最も一般的なエラーは、間違った解答キー、複数またはゼロの正解選択肢、および弱い注意散漫です。最初からテーマやレベル、難易度の配分を指定するとクオリティが上がります。未検証の質問は試験に出すべきではありません。
アプリケーションタスク
トピックを選択してください。 Have the AI produce 8-10 multiple choice questions + solutions with a certain difficulty distribution with the 1st template.次に、単元 4 を思い出して、すべての質問を SymPy で解決するコードを AI に書かせ、コードを実行します。 SymPy の結果を YZ の回答キーと比較します。各質問に正しい選択肢が 1 つだけあること、および注意をそらす要素が実際に間違っていることを確認します。少なくとも 1 つの間違いまたは弱い注意をそらすものを見つけて修正します。
チェックリスト
- [ ] 科目、レベル、難易度分布を明記しました。
- [ ] 各質問を個別に解決しました (できれば SymPy でバッチで)。
- [ ] 解答キーと SymPy の結果を比較しました。
- [ ] 各質問に正しい選択肢が 1 つだけあることを確認しました。
- [ ] 気を散らすものは典型的な間違いに基づいており、実際には間違っていることを確認しました。
- [ ] 曖昧な発言や繰り返しの質問がないことを確認しました。