收益:
- 了解发育筛查(如 Denver II、AGTE、GEÇDA)不是为了诊断,而是为了风险确定和指导,并将人工智能的作用定位在这个限度内
- 利用人工智能对筛选结果产生清晰的初步总结和报告草案,并能够作为专家做出最终的评估和转诊决定
- 能够在解释前发现年龄校正、文化适当性、单次错误和截止分数等陷阱
一个家庭来找你,担心他们两岁半的孩子:“他的朋友们会说话,但我的朋友们却很少说话。”这句话的背后有时隐藏着完全正常的个体差异,有时是需要支持的发育迟缓,有时是需要进一步评估的情况。将这三者分开是儿童发展专家最重要的工作之一。做出这种区分的第一步是发育筛查。在本单元中,我们将非常小心地介绍什么是筛查、什么不是筛查,以及人工智能可以在此过程中的哪些位置。
首先最关键的一句话:发育筛查不是诊断。筛查是一个简短而实用的筛查过程,有助于快速识别处于发育风险的儿童,进一步评估他们,并将他们引导给适当的专家/医生。诊断是详细的临床评估、多个数据源和相关医生/专家团队的工作。如果你一次不内化这个限制,人工智能就会反复建议你超过这个限制的句子,你就能在不知不觉中接受它们。
扫描工具和基本概念
土耳其常用的一些发育筛查和评估工具有:Denver II(0-6 岁发育筛查测试;扫描个人社交、精细运动、语言和粗大运动区域)、AGTE(安卡拉发育筛查量表;0-6 岁,基于家庭报告)、GEÇDA(Gazi 幼儿评估工具;0-72 个月)。这些工具的共同特点是它们经过验证和标准化。 “标准化”意味着该工具是在特定样本上开发的,并且其规范(根据年龄的预期值)已经确定。
让我们澄清几个术语。标准是一个参考值,表明给定年龄的大多数孩子何时掌握了一项技能。截止分数是划定“存在风险/需要进一步评估”的阈值。假阴性是指实际面临风险的孩子“正常”通过筛查——这是最危险的错误,因为支持被延迟了。误报实际上是将一个正常的孩子标记为“处于危险之中”——给家人带来不必要的担忧,但通常可以通过进一步评估来纠正。良好的扫描会尽量降低误报率。
注意:AI 内不会“运行”任何扫描工具。评分是根据该工具自己的手册和验证协议完成的。不使用AI计算分数或设定截止分数;仅使用它将经过验证的结果翻译成可理解的语言和草稿报告。
人工智能的正确作用
人工智能在筛查过程中不提供诊断或评分。它的安全工作是:在您应用该工具并获得正确的分数后,将这些结果转化为适合家庭和档案的简单而谨慎的初步总结。换句话说,人工智能将原始结果翻译成人类可以理解的草稿;您设定临床实质的解释和指导性决定。
以下是逐步的安全流程:
- 根据其规则应用该工具并对其进行评分。这完全是你的事; AI不干涉。
- 以匿名和结构化格式准备结果。现场调查结果不是名字,而是“3岁零4个月的男孩”。
- 让人工智能只写摘要和草稿。以“不做诊断,加减分评论”为限制。
- 检查是否存在年龄校正、文化适当性、单次会话效应等陷阱。
- 作为专家做出最终的评估和指导决定并签字。
舞台
谁做的
人工智能的作用
应用工具并对其进行评分
专家
无
基于截止分数的风险确定
专家(工具指南)
无
将结果翻译成通俗易懂的语言
专家监督下的人工智能
草图生成器
报告草稿/家庭摘要
专家监督下的人工智能
草图生成器
转诊和诊断决定
专家+医生/团队
无
验证前要避免的陷阱
年龄修正。对于早产婴儿,发育情况是根据校正年龄而不是日历年龄来评估的。校正年龄=日历年龄-(40周-出生周)。例如,32周出生的6个月婴儿的校正年龄约为4个月。如果你跳过这个修正,你会看到一个正常的婴儿“落后”。矫正通常要到2岁。
文化和语言的适当性。工具的一项(例如,与特定玩具或异物相关的技能)在每种文化中可能具有不同的含义。对于一个双语成长的孩子来说,一种语言的单词数量可能看起来比实际要少;应评估全部语言能力。
单会话谬误。当孩子饥饿、失眠、生病或身处异国环境时,他可能无法表现出自己的真实水平。单张扫描照片并不是整个胶片;必要时需要重复和多种来源(家人通知、老师观察)。
截止分数盲目性。略低于或高于截止分数并不会产生明显的“健康/患病”区别。接近临界值的结果是根据临床判断来处理的。
提示:打印结果摘要时,请 AI 将边界或模糊区域明确标记为“[需要专家临床判断]”。这可以防止您盲目相信大纲。
四个可复制的提示
1)提示将扫描结果转换为简单的家庭摘要:
您的角色:儿童发展专家的起草助理。不要诊断,不要评论截止分数,不要说“有延迟”。将以下匿名筛查结果转化为家庭的简单而谨慎的总结。不要指责;还要提到优点;必要时,使用指示性但非承诺性的语言,例如“可能建议进一步评估”。调查结果:[匿名,已派出]
2)年龄修正计算及警告提示:
我会评估婴儿的发育情况。使用以下信息计算更正年龄,逐步显示公式,并提醒您日历年龄和更正年龄之间的差异可以在评估中发生变化。出生周数:[X] 周。当前日历年龄:[Y 月 Z 天]。
3)报告草稿骨架提示:
根据下面的匿名扫描结果创建评估报告草案框架。部分:一般信息、应用工具、基于现场的发现、优势、需要注意的领域、建议/指导(谨慎),注意:添加句子“这是筛查摘要,而不是诊断”。在您留空的每个字段中写下[让专家填写]。调查结果:[匿名]
4)陷阱清单提示:
检查下面的筛选摘要草稿是否存在以下陷阱,并逐项列出您发现的任何问题:(1) 是否有任何语言表明诊断? (2)它是否将截止分数转化为最终决定? (3)是否遗漏了需要修正年龄的情况? (4) 文化/语言相关性是否被忽视了? (5) 它是否将单一会话呈现为绝对真理?草稿:[文本]
三个迷你箱子
情况 1 — 接近临界值的结果。 4岁零1个月的孩子的语言领域筛查结果略低于截止分数(例如,截止分数为12,孩子为11)。 AI草案明确指出“语言发展存在延迟”。专家更正了这一点,称“在语言领域观察到接近临界值的结果;建议进一步评估并通知家人提供支持。”区别在于:词语的选择会改变家人的焦虑程度和提示的准确性。
案例 2——年龄校正。对 28 周出生且日历年龄为 12 个月的婴儿的运动发育进行评估。修正年龄约为9个月。在初稿中,AI 使用日历年龄并表示“粗大运动落后 3 个月”。专家进行修正;婴儿的校正年龄是正常的。避免不必要的转诊和家庭恐慌。
案例3——双语儿童。在家讲两种语言的 3 岁孩子的土耳其语单词数量似乎很少。 AI草案仅查看了土耳其曲目并写下了“表达语言明显延迟”。专家评估孩子的两种语言的总能力和沟通意图;情况比预期更为积极。文化语言背景改变了结果。
弱提示/强提示
弱提示:
根据这个筛查结果,写一份报告,看看孩子是否有发育迟缓。
问题:要求人工智能做出诊断决策,将截止分数转换为精度,没有陷阱检查,身份/上下文不明确。
强力提示:
你的角色是选秀助理。将下面的匿名筛查结果转化为家庭友好的摘要草稿。做出诊断;将截止分数转化为最终决定;将边界附近的区域标记为[专家判断];如果有什么需要纠正的地方请提醒我。在末尾添加注释,“这是筛查摘要,而不是诊断。”结果:[匿名,逐个字段]
常见错误
- 将筛查转化为诊断:使用谨慎的语言,“可能建议进一步评估”,而不是“有延迟”。
- 忘记年龄校正:校正年龄对于早产儿来说至关重要。
- 绝对化截止分数:截止值需要临床判断。
- 将单次治疗视为绝对事实:孩子当天的行为并不总是典型的。
- 让人工智能计算分数:使用车辆自己的协议熟练地完成评分。
综上所述
发育筛查决定风险,而不是诊断;这个边界是一切的开始。人工智能在筛查过程中不会评分或诊断;它只是将经过验证的结果转化为简单而谨慎的摘要/报告草稿。在发表评论之前,要抓住诸如年龄校正、文化语言适当性、单次效应和分数盲目性等陷阱。最终的评价和指导决定由专家签字并作出。
应用任务
获取(匿名)扫描结果。首先用车辆自带的手册验证评分。然后,根据第一个提示生成家庭摘要草稿,并根据第三个提示生成报告框架。然后根据第四个提示检查吃水是否有陷阱。最后,将您在草稿中更正的诊断性或明确性陈述翻译成谨慎的语言,并记下至少两处更正。
清单
- [ ] 我根据该工具的协议对该工具进行管理和评分;我没有AI给它打分。
- [ ] 我保留了筛查与诊断的区别;我将草案中的精确表述翻译成谨慎的语言。
- [ ] 如果有早产,我计算出修正年龄。
- [ ] 我评估了文化/语言的适当性和双语能力。
- [ ] 我使用临床判断来处理临界结果。
- [ ] 我对数据进行了匿名处理;我在摘要中添加了注释“扫描不是诊断”。
- [ ] 我作为专家做出了最终转介决定并签字。