收益:
- 能够将研究计划为从设计到文档的连贯的六阶段工作流程
- 能够确定人工智能在每个阶段的安全使用极限,并在阶段转换时验证之前的输出
- 能够在团队层面建立负责任的使用协议,并根据五个基本原则进行自我评估
在前面的十个单元中,我们涵盖了社会研究各个阶段的人工智能:问题和文献、抽样、调查和定量分析、定性编码和主题、混合方法、可视化、伦理、再现性和写作。我们将所有这些都集中在这个最后的单元中。目标是将个人技能连接到端到端的工作流程中——从研究问题到发表的发现的一致、安全和诚实的过程。我们还将超越个人,讨论治理:团队、部门或机构如何在社会研究中负责任地使用人工智能的共同规则。
端到端思考的价值在于,你在每个阶段做出的决定都会影响下一个阶段。即使完美的分析也无法挽救有偏差的样本;未经证实的来源甚至会驳斥最好的写作。这就是为什么有必要在每个阶段以相同的原则使用人工智能:为其提供强大的资源,验证每一个输出,保护人类的判断,提前照顾道德和隐私,透明地记录过程。这些原则可以用一句话来概括:人工智能加速研究,但不会取代研究人员。
逐步:端到端流程
1.设计(问题+伦理+样本)。建立明确的问题,重新制定伦理审批和保密规划,评估样本的代表性。现阶段,人工智能有助于缩小问题范围和筛查道德风险。
2.资料收集(调查+访谈)。准备一份可靠的调查和采访指南。人工智能捕捉问题陷阱;收集数据和参与者关系的任务是你的。
3. 处理(清洗+编码+匿名化)。匿名、清理、编码数据。人工智能绘制蓝图;您批准每一个决定和密码本。
4.分析(定量+定性+三角测量)。通过程序运行统计数据,将主题与引文联系起来,交叉验证结果。 AI解释的是方法,而不是计算。
5. 演示(可视化+写作)。制作诚实的图形和原始文本。每个来源和号码均经过验证;人工智能的作用被宣告。
6.文档(日记+即时记录+分享)。记录决策、提示和转换,并在可能的情况下共享匿名数据和代码。
提示:在办公桌上保留一份端到端清单。在每个步骤转换时询问:“我是否验证了此步骤的输出,我的样本/道德/来源是否安全,我是否没有留下任何痕迹?”某一阶段的松弛会削弱整个链条。
三个迷你箱子
案例 1——链条中最薄弱的一环。一个团队做了出色的定性分析,但他们的样本来自单个在线小组。无论他们编码得多么好,结果都被困在了这个小组中。教训:端到端的质量取决于最弱的阶段;设计中的偏差无法在分析中纠正。
案例 2——团队治理发挥了作用。一家研究中心为整个团队编写了一个通用的人工智能使用协议:使用哪种工具、对哪些数据进行匿名化、使用哪个验证步骤。新来的助理从第一天起就按照协议安全工作;个人错误有所减少。
案例3——透明链获得裁判信任。一篇文章附上了决策日志、提示日志和AI语句。审阅者能够从头到尾观看整个过程并表示同意,认为它“高效且诚实”。透明度是将所有单独步骤粘合在一起的粘合剂。
四个可复制模板
1)端到端清单生成:
我的研究将经历以下阶段:设计、数据收集、处理、分析、演示、文档。为每个阶段制定一份清单:在该阶段我可以在哪里安全地使用人工智能,我应该验证哪些输出,我应该考虑哪些道德/隐私风险,我应该记录什么?将其放在表格中。
2)Team AI协议草案:
为社会研究团队起草人工智能使用协议。包括:批准的工具、数据匿名规则、允许/限制/禁止人工智能的角色、强制验证步骤、人工智能声明规则、问责制。编写简单、可操作的项目。
3)相变控制:
我完成了 [X 阶段],即将进入 [Y 阶段]。列出在此转换之前需要检查的事项:我是否验证了前一阶段的输出,我是否携带了会破坏下一阶段的错误(错误的样本、未经验证的来源、未跟踪的决策)?我准备好过渡了吗?如果没有,我应该解决什么问题?
4) 负责任的使用自我评估:
审核我完成的关于负责任地使用人工智能的研究。根据这五个原则进行评分并指出弱点:(1) 强大的源供给,(2) 验证每个输出,(3) 保留人类判断,(4) 道德和保密性,(5) 透明的文档。流程:【总结】
弱提示/强提示
弱提示:
用人工智能从头到尾完成这项研究并完成它。
这试图将所有责任转移给模型。结果:样本有偏差、来源捏造、统计数据未经验证、文本站不住脚。没有端到端的阶段是安全的。
强力提示:
我想从头到尾地计划我的研究。在每个阶段(设计、数据、处理、分析、演示、文档),它都可以作为我可以安全使用人工智能的路线图,哪里需要人类判断和验证,以及我应该考虑哪些道德和隐私风险。请记住我有责任。
区别在于:第二种方法将人工智能定位为伴侣;它从一开始就接受决策和验证属于人类。
端到端负责任的使用政策
原则
应用
在哪个单位
源源不断的饲料
提供您自己的数据/来源
1, 2
查询样品
代表性和偏见审计
3
将计算写入程序中
让人工智能产生数字
4
保持忠诚
链接引用与行号
5
保持矛盾的开放性
三角测量,诚实的呈现
6, 7
道德和隐私第一
匿名、经过验证的工具
8
记录流程
日记,即时记录
9
保持原创性
验证来源,你自己的声音
10
常见错误
- 单独考虑各个阶段并忘记链条。某个阶段的偏见会破坏整个研究。
- 将责任转移给人工智能。决定、验证和道德始终取决于人。
- 团队中没有共同的规则。个人使用会产生不一致和风险。
- 把文档留到最后。整个过程中痕迹被保留;以后就记不住了。
- 一旦你学习并放松。负责任的使用是每个项目中都重新应用的纪律。
综上所述
人工智能在社会研究中的真正价值不在于单个任务,而在于从头到尾一致且负责任的工作流程。在从设计到文档的每个阶段都应用相同的原则:强大的来源、验证每个输出、保留人类判断、优先考虑道德和保密性、透明地记录过程。团队层面的共同协议使这些原则成为永久性的。链条的强度取决于其最薄弱的环节;任何阶段都不要放松。人工智能加快了研究速度,但它永远无法取代研究人员的判断力、责任感和诚信。
应用任务
使用“端到端清单生成”模板为您自己的研究项目(实际的或计划的)创建一个六步路线图。在每个阶段,写下您将在何处使用人工智能、您将验证什么以及您将考虑哪些道德/隐私风险。然后使用“负责任的使用自我评估”模板根据五项原则对自己进行评分,找出您的两个最薄弱环节以及如何加强它们。
清单
- [ ] 我将研究计划为从头到尾的六阶段流程。
- [ ]我确定了人工智能在各个阶段的安全使用限度。
- [ ] 我验证了每个阶段转换的先前输出。
- [ ] 自始至终遵守道德规范、保密性和文件记录。
- [ ] 我根据五项原则对负责任的使用进行了自我评估。
模块考试
1、以下哪项是人工智能在社会学和社会研究中最准确的定位?
- A)人工智能可以在无需人类批准的情况下自行回答研究问题、解释和道德决策。
- B) 人工智能只起摘要文本的作用,与其他研究阶段无关
- C) 人工智能是摘要、抄本、代码和草稿助手;解释、框架和道德决策的责任在于研究人员 ✔
- D)由于人工智能总是比人类更公正,因此解释应该完全留给它。
描述:人工智能;是一名助理,负责总结文本、编辑笔录、建议代码和撰写草稿。研究问题、理论框架、样本判断、解释和伦理决策等关键工作由研究者负责;未经验证的输出可能会导致错误参考、捏造统计数据或错误归因。
2.为什么在扫描文献时直接告诉人工智能“用参考书目列出关于这个主题的10篇最重要的文章”是有风险的?
- A) AI 可以编造看似真实但实际上并不存在的来源、作者和 DOI;你必须从数据库中找到来源✔
- B)人工智能工作速度非常慢,在列出资源时浪费时间
- C)人工智能错过了土耳其文学,因为它只能找到英文资源
- D)随着人工智能多次重复同一来源,该列表不断增长
描述:文献综述是AI产生幻觉最多的任务;可以编造看起来真实但不存在的文章、作者和 DOI。寻找来源是数据库的工作;人工智能应该只综合您找到的实际摘要。
3. 在哪个问题上,应该最仔细地解释市政府网站上发布的一项调查中 78% 的满意度结果?
- A) 百分比计算不正确;满意度永远不能用单一数字来表示
- B) 由于调查时间太长,参与者感到无聊并随机回答
- C) 满意度在社会学上是不可能测量的,所以结果是无效的
- D) 样本存在选择偏差;由于只有该网站的用户可以参与,因此该发现无法推广到整个社会✔
说明:网站上发布的调查超过了那些已经使用该网站的人(他们可以访问该服务并且可能更满意);这是一种选择偏差。这一发现只能推广到“网站用户”,而不能推广到整个社会。
4. 为什么将 300 行数据集粘贴为文本并告诉 AI“计算平均值”不安全?
- A) 由于人工智能最多只能读取 100 行数据,因此它会丢弃更多
- B) 语言模型不是计算器;当在文本中进行算术运算可能会产生错误的数字时,必须在程序中进行计算✔
- C) 平均值是一种在社会学上毫无意义的衡量标准,根本不应该被计算。
- D)当数据粘贴为文本时,AI会自动删除它
说明:语言模型不是计算器,在文本中执行算术运算时可能会错误地生成平均值、百分比或 p 值。实际计算应在统计程序或表格中进行;人工智能应该仅用于方法和解释。
5. 在接受人工智能在定性主题分析中建议的报价之前应该做什么?
- A) 如果报价看起来流畅且令人印象深刻,可以直接添加到报告中
- B) 如果报价长度不超过一段,则无需验证
- C) 应通过行号确认引文确实出现在抄本中 ✔
- D) 引用自动可靠,因为人工智能会引用来源
说明:定性研究的核心是忠实于参与者自己的话。 AI可以编造一段流利但在文字记录中根本不存在的引言。因此,每个引用都应该链接到文本中的实际陈述并进行验证,最好是行号。
6. 如果在一项研究中,72%的人在调查中说“我回收”,但在访谈中大多数人实际上说他们不定期这样做,这个矛盾应该如何处理?
- A) 不应隐藏矛盾;应作为一项发现提出,并附有可能的解释,例如社会期望偏差 ✔
- B) 访谈数据因不准确而应被丢弃,仅报告调查结果
- C) 调查数据因不正确而应被丢弃,仅报告访谈
- D) 这两个数据都应该从报告中删除,因为矛盾令人尴尬
说明:定量和定性发现之间的差异不是缺陷,但往往是最有价值的发现。这里的矛盾指向诸如“社会愿望偏见”之类的现象,应该作为一个发现来呈现,而不是隐藏它。
7. 如果在 y 轴从 50 开始的图表上两组之间的差异(51% 与 54%)看起来像“巨大差距”,该怎么办?
- A) 图表应保持原样,因为差异看起来已经很大
- B)应该通过显示单个平均值而不是两组来完全隐藏差异
- C) 通过在图表中添加三维效果,差异应该更加令人印象深刻。
- D) Y轴应从零开始初始化;截断轴通过夸大微小差异来误导读者 ✔
解释:截断轴(不是从零开始)会误导微小的差异,使其看起来很大。在诚实的条形图中,轴应从零开始;因此,差异在其实际的小尺寸中显而易见。视觉的目的不是说服,而是正确的沟通。
8. 为什么仅仅从成绩单中删除姓名往往不足以实现匿名化?
- A) 删除一个名字总是足够的;没有其他信息透露身份
- B) 间接标识符(独特的角色、位置、稀有特征)可以在没有名字的情况下泄露一个人 ✔
- C) 仅当有电话号码时才需要匿名
- D)删除名字是没有意义的,因为它会使文本变得不可读
说明:仅仅删除名称是不够的;诸如“X 社区唯一的药剂师”或“该市唯一的女督察”之类的间接描述本身就可以暴露此人的身份。正确的匿名化需要清除所有直接和间接标识符。
9. 为什么在人工智能执行的分析中记录提示、使用的模型和日期很重要?
- A) 由于这只是法律义务,因此没有科学价值
- B) 出于商业原因保留提示,因为它们带有版权。
- C) 使过程可追溯、可再现;否则,“AI这么说”就不是科学依据了✔
- D)注册只是一个形式,因为模型总是给出相同的答案
说明:语言模型不会每次都给出完全相同的答案;如果没有记录提示和模型信息,该过程就变成了一个黑匣子,其他人(甚至是您)都无法重现该作品。这些记录是工作的“物料清单”,是可重复性的基础。
10. 在学术写作中合法使用人工智能与违反学术诚信之间的界限在哪里?
- A) AI可以帮助你表达自己的内容;但是,代表您思考并制作内容并将其作为您的作品呈现是一种违法行为✔
- B)任何人工智能产生的文本都可以直接使用,只要语法正确
- C) 只要人工智能添加资源,将内容完全打印到它上面是没有问题的。
- D) 在任何情况下都禁止使用人工智能,并且在任何阶段都不能使用人工智能。
披露:使用人工智能来澄清自己的草稿并改进语言和结构是合法的,并且是透明的。让人工智能编写的内容并将其呈现为您自己的作品,既违反了原创性,而且几乎肯定会产生捏造的来源。 Line:AI帮助你表达你的想法,它不会替你思考。
11. 社会研究中的“端到端质量降至最弱阶段”是什么意思?
- A) 只有最后一个阶段(拼写)很重要;前面阶段的错误通过拼写纠正。
- B)各阶段相互独立;一个错误不会影响其他
- C) 最强的相可以拯救整个链,因此专注于单个相就足够了
- D) 某一阶段的弱点(样本有偏差、来源未经验证)无法在后期纠正,从而削弱整个研究 ✔
解释:每个阶段的决定都会影响下一个阶段:有偏差的样本即使通过完美的分析也无法挽救;未经证实的来源甚至会驳斥最好的写作。因此,从设计到文档记录的每个阶段都应采用相同的负责任使用原则。
12. 如果人工智能总结了你给出的文字记录,并添加了文本中没有的框架,例如“老年人害怕技术”,这是一个什么例子?
- A)它是参与者真实意见的准确总结
- B) 是把人工智能所携带的刻板印象从自己的训练数据中引入到数据中✔
- C)这是统计显着性检验的结果
- D) 证明匿名化已成功实施
说明:这是人工智能从其训练的文本中获得的刻板印象(刻板概括)的示例。该模型可能会添加数据中实际不存在的判断。研究人员应该通过说“仅依赖文本中的陈述”来消除这一添加。
13. 以下哪一项是一个范围明确的研究问题?
- A) 为什么社会会出现这种情况?
- B) 人们幸福吗?
- C) 18-25岁的大学生不参加地方选举的原因是什么? ✔
- D) 社交媒体和一切事物之间的关系是什么?
说明:一个好的研究问题是可回答的、有限的、有意义的;它的人口、背景和重点都很明确。一个包含特定年龄组、背景和具体焦点的问题是可以研究的,而不是诸如“为什么年轻人远离政治?”这样的广泛要求。
14. 如果两项不同的在线调查从同一社交媒体组招募参与者并产生相同的结果,为什么这不是真正的三角测量?
- A)两个来源不是独立的,因为它们来自相同的有偏差样本;这是相同偏见的重复✔
- B) 不一定要使用两次调查,一次调查就足够了
- C)在线调查永远不会产生有效数据
- D) 他们给出相同的结果这一事实证明该结果是绝对正确的。
说明:三角测量正在与真正独立的来源交叉测试结果。如果两个来源来自同一个有偏差的样本,那么它们相互“证实”就会产生误导;这是相同偏见的重复,而不是独立的确认。