收益:
- 能够清晰地定义宇宙并评估采样方法的代表性以及系统地排除谁
- 能够区分数据偏差和人工智能带来的刻板印象并控制两者
- 能够不夸张地表达仅限于样本的发现,并撰写诚实的限制部分。
社会研究最关键的概念是样本——即你选择的子群体,因为你无法一一考察你感兴趣的整个群体(宇宙/人口:研究想要谈论的所有人或单位)。研究结果可以推广到哪些人(即“这个结果是否只对这些人有效,还是对更广泛的群体有效”)完全取决于样本的代表性。错误或有偏差的样本的结果是错误的,无论分析得多么好。在本单元中,您将学习如何使用人工智能来思考样本设计,检测偏差——数据的系统漂移或朝一个方向的解释,并诚实地表达泛化的局限性。
这里有必要区分两种类型的偏见。首先是数据中的偏差:样本过多地代表了一个群体,而低估了另一群体(例如只能参加在线调查的人,即可以访问互联网的人)。第二个是人工智能自身的偏见:人工智能带有其所接受训练的文本模式,并且可以对社会群体产生刻板的概括。一个好的社会研究者必须对这两方面都保持警惕;人工智能可以帮助你识别两者,也可以放大两者。
一步一步:思考代表性
1. 描述宇宙。你想告诉谁你的发现? “土耳其的所有选民”和“伊斯坦布尔社区的年轻选民”是截然不同的宇宙。如果没有写清楚这一点,就无法建立样本。
2. 选择采样方法。诸如随机(每个人都有平等的被选择机会)、分层(将宇宙分组并从每个组中进行选择)、滚雪球(一个参与者推荐另一个参与者)等方法给出了不同的代表权。人工智能可以用简单的语言解释每种方法的优缺点。
3. 询问谁被排除在外。每次采样都会错过某人。网上调查错过了没有互联网的人,电话调查错过了没有固定电话的人,白天访谈错过了员工。人工智能为“这种方法系统地排除了谁?”提供了一个很好的清单。
4. 找出偏见的来源。列出诸如选择偏差(谁被选择)、反应偏差(谁回答)、回忆偏差(记错过去)等来源。
5. 写出泛化极限。将这一发现表述为“样本中的年轻人”,而不是“所有青少年”。人工智能可以标记草稿中的过度概括。
提示:一份好的研究报告会通过“局限性”部分得到加强,而不是削弱。诚实地写下你的样本不代表谁会让你的研究更加可靠。让 AI 起草此部分,但请自行确认任何限制。
三个迷你箱子
案例 1——隐藏的选择偏差。为了衡量对市政当局服务的满意度,一个团队在市政当局的网站上进行了一项调查,发现满意度为 78%。当我问人工智能“这个样本缺少谁?”时,结果发现已经使用该网站(即可以访问该服务并且可能更满意)的部分比例过高。该调查结果被更正为“网站用户中 78%”。
案例 2——人工智能的刻板印象。当研究人员让人工智能总结“农村老年人对技术的看法”时,人工智能添加了数据中没有的刻板框架,例如“老年人害怕技术”。当研究人员意识到这一点并说“只要依赖笔录中的陈述”时,就会发现数据中实际上存在各种各样的态度。
案例 3——分层抽样校正。在 500 人的样本中,女性占 30%,而总体中女性占 51%。 AI用通俗易懂的语言解释了加权逻辑,团队根据人口比例对结果进行加权,得到了更具代表性的图片。
四个可复制模板
1)对样本的批评:
我的研究领域:[描述]。我的采样方法是:【方法】。您的任务:列出该样本可能系统地代表性不足或过多的人。分别考虑选择、反应和回忆错误。针对每个风险给出缓解建议。不要夸大我的发现;诚实地表明界限。
2)泛化控制:
检查这些发现句子:[文本]。标记每一个过度概括。用数据实际支持的更窄的陈述重写“所有/每个人/年轻人/女性”等陈述。例如,“样本中 Y% 的青少年报告了 X”,而不是“年轻人做了 X”。标记任何来源不明的索赔。
3)AI偏差捕获:
我给你总结如下。检查:您添加的任何判断、形容词或概括是否确实存在于给定文本中?标记并删除任何不在文本中但来自您自己的模式的表达方式。只要坚持文本中的内容即可。
4) 草案限制部分:
根据以下方法信息编写“限制”部分草稿:样本大小 [n]、方法 [x]、上下文 [y]。解释每个限制如何影响研究结果。既不夸大也不低估;保持平衡和诚实。我会确认每一项。
弱提示/强提示
弱提示:
根据我的调查结果,大多数年轻人都有这样的看法。用强有力的句子写下这个。
这会产生过度概括,而无需质疑样本。人工智能很容易陷入数据不成立的主张,例如“土耳其的年轻人......”
强力提示:
我的样本:一所大学的 220 名本科生,在线调查,自愿参与。我想表达一个发现:61%的参与者表达了意见X。用简洁的学术句子写下这一点,清楚地说明样本的局限性(代表性、志愿偏见)。限制对此样本的概括。
区别在于:第二句话提出了数据实际支持的合理主张。
抽样方法及代表性
方法
它是如何运作的
代表权
典型风险
简单随机
每个人都有平等的机会
高
运输费用
分层的
分组并选择
高
组定义错误
配额
灌装组费率
中等
群体内偏见
容易
不要询问任何可以联系到的人
低
严重的选择偏差
滚雪球
根据参与者建议
低
网络内相似性
常见错误
- 建立样本而不定义宇宙。如果不知道你将概括给谁,就无法评估代表性。
- 将便利抽样推广到整个人群。最常见的错误; “调查受访者”与“所有人”混淆了。
- 永远不要问谁被排除在外。每一种方法都会绑架一个人;有意识地寻找这一点。
- 没有注意到人工智能添加的刻板印象。该模型可能会添加数据中不存在的刻板印象。
- 隐藏限制。隐藏样本的脆弱性会使研究变得脆弱且不可靠。
综上所述
调查结果的价值取决于其所依据的样本的代表性。人工智能;是解释抽样方法、确定代表性不足、标记过度概括以及起草诚实的限制部分的有力帮助。但要注意两种偏见:数据本身的偏见和人工智能所携带的刻板印象。清楚地定义宇宙,询问谁被排除在外,限制对样本的概括,并诚实地写下限制。
应用任务
描述真实或假设研究的总体和抽样方法。使用“抽样批评”模板从人工智能中提取可能代表性不足/过多的人,并识别至少三个偏见来源。然后将发现的陈述转化为数据实际上通过“泛化检查”模式支持的狭义陈述。最后,写一个诚实的半页限制部分。
清单
- [ ] 我已经清楚地定义了宇宙(我将概括给谁)。
- [ ]我评估了抽样方法的代表性。
- [ ] 我列出了哪些人被系统地排除在外。
- [ ] 我仅表达了仅限于样本的发现,并没有夸大其词。
- [ ] 我删除了人工智能添加的刻板印象/概括。