单位 2 / 11

开发评估支持:筛选工具和验证 AI 草案

收益:

  • 了解发育筛查(如 Denver II、AGTE、GEÇDA)不是为了诊断,而是为了风险确定和指导,并将人工智能的作用定位在这个限度内
  • 利用人工智能对筛选结果产生清晰的初步总结和报告草案,并能够作为专家做出最终的评估和转诊决定
  • 能够在解释前发现年龄校正、文化适当性、单次错误和截止分数等陷阱

一个家庭来找你,担心他们两岁半的孩子:“他的朋友们会说话,但我的朋友们却很少说话。”这句话的背后有时隐藏着完全正常的个体差异,有时是需要支持的发育迟缓,有时是需要进一步评估的情况。将这三者分开是儿童发展专家最重要的工作之一。做出这种区分的第一步是发育筛查。在本单元中,我们将非常小心地介绍什么是筛查、什么不是筛查,以及人工智能可以在此过程中的哪些位置。

首先最关键的一句话:发育筛查不是诊断。筛查是一个简短而实用的筛查过程,有助于快速识别处于发育风险的儿童,进一步评估他们,并将他们引导给适当的专家/医生。诊断是详细的临床评估、多个数据源和相关医生/专家团队的工作。如果你一次不内化这个限制,人工智能就会反复建议你超过这个限制的句子,你就能在不知不觉中接受它们。

扫描工具和基本概念

土耳其常用的一些发育筛查和评估工具有:Denver II(0-6 岁发育筛查测试;扫描个人社交、精细运动、语言和粗大运动区域)、AGTE(安卡拉发育筛查量表;0-6 岁,基于家庭报告)、GEÇDA(Gazi 幼儿评估工具;0-72 个月)。这些工具的共同特点是它们经过验证和标准化。 “标准化”意味着该工具是在特定样本上开发的,并且其规范(根据年龄的预期值)已经确定。

让我们澄清几个术语。标准是一个参考值,表明给定年龄的大多数孩子何时掌握了一项技能。截止分数是划定“存在风险/需要进一步评估”的阈值。假阴性是指实际面临风险的孩子“正常”通过筛查——这是最危险的错误,因为支持被延迟了。误报实际上是将一个正常的孩子标记为“处于危险之中”——给家人带来不必要的担忧,但通常可以通过进一步评估来纠正。良好的扫描会尽量降低误报率。

注意:AI 内不会“运行”任何扫描工具。评分是根据该工具自己的手册和验证协议完成的。不使用AI计算分数或设定截止分数;仅使用它将经过验证的结果翻译成可理解的语言和草稿报告。

人工智能的正确作用

人工智能在筛查过程中不提供诊断或评分。它的安全工作是:在您应用该工具并获得正确的分数后,将这些结果转化为适合家庭和档案的简单而谨慎的初步总结。换句话说,人工智能将原始结果翻译成人类可以理解的草稿;您设定临床实质的解释和指导性决定。

以下是逐步的安全流程:

  1. 根据其规则应用该工具并对其进行评分。这完全是你的事; AI不干涉。
  2. 以匿名和结构化格式准备结果。现场调查结果不是名字,而是“3岁零4个月的男孩”。
  3. 让人工智能只写摘要和草稿。以“不做诊断,加减分评论”为限制。
  4. 检查是否存在年龄校正、文化适当性、单次会话效应等陷阱。
  5. 作为专家做出最终的评估和指导决定并签字。

舞台

谁做的

人工智能的作用

应用工具并对其进行评分

专家

基于截止分数的风险确定

专家(工具指南)

将结果翻译成通俗易懂的语言

专家监督下的人工智能

草图生成器

报告草稿/家庭摘要

专家监督下的人工智能

草图生成器

转诊和诊断决定

专家+医生/团队

验证前要避免的陷阱

年龄修正。对于早产婴儿,发育情况是根据校正年龄而不是日历年龄来评估的。校正年龄=日历年龄-(40周-出生周)。例如,32周出生的6个月婴儿的校正年龄约为4个月。如果你跳过这个修正,你会看到一个正常的婴儿“落后”。矫正通常要到2岁。

文化和语言的适当性。工具的一项(例如,与特定玩具或异物相关的技能)在每种文化中可能具有不同的含义。对于一个双语成长的孩子来说,一种语言的单词数量可能看起来比实际要少;应评估全部语言能力。

单会话谬误。当孩子饥饿、失眠、生病或身处异国环境时,他可能无法表现出自己的真实水平。单张扫描照片并不是整个胶片;必要时需要重复和多种来源(家人通知、老师观察)。

截止分数盲目性。略低于或高于截止分数并不会产生明显的“健康/患病”区别。接近临界值的结果是根据临床判断来处理的。

提示:打印结果摘要时,请 AI 将边界或模糊区域明确标记为“[需要专家临床判断]”。这可以防止您盲目相信大纲。

四个可复制的提示

1)提示将扫描结果转换为简单的家庭摘要:

您的角色:儿童发展专家的起草助理。不要诊断,不要评论截止分数,不要说“有延迟”。将以下匿名筛查结果转化为家庭的简单而谨慎的总结。不要指责;还要提到优点;必要时,使用指示性但非承诺性的语言,例如“可能建议进一步评估”。调查结果:[匿名,已派出]

2)年龄修正计算及警告提示:

我会评估婴儿的发育情况。使用以下信息计算更正年龄,逐步显示公式,并提醒您日历年龄和更正年龄之间的差异可以在评估中发生变化。出生周数:[X] 周。当前日历年龄:[Y 月 Z 天]。

3)报告草稿骨架提示:

根据下面的匿名扫描结果创建评估报告草案框架。部分:一般信息、应用工具、基于现场的发现、优势、需要注意的领域、建议/指导(谨慎),注意:添加句子“这是筛查摘要,而不是诊断”。在您留空的每个字段中写下[让专家填写]。调查结果:[匿名]

4)陷阱清单提示:

检查下面的筛选摘要草稿是否存在以下陷阱,并逐项列出您发现的任何问题:(1) 是否有任何语言表明诊断? (2)它是否将截止分数转化为最终决定? (3)是否遗漏了需要修正年龄的情况? (4) 文化/语言相关性是否被忽视了? (5) 它是否将单一会话呈现为绝对真理?草稿:[文本]

三个迷你箱子

情况 1 — 接近临界值的结果。 4岁零1个月的孩子的语言领域筛查结果略低于截止分数(例如,截止分数为12,孩子为11)。 AI草案明确指出“语言发展存在延迟”。专家更正了这一点,称“在语言领域观察到接近临界值的结果;建议进一步评估并通知家人提供支持。”区别在于:词语的选择会改变家人的焦虑程度和提示的准确性。

案例 2——年龄校正。对 28 周出生且日历年龄为 12 个月的婴儿的运动发育进行评估。修正年龄约为9个月。在初稿中,AI 使用日历年龄并表示“粗大运动落后 3 个月”。专家进行修正;婴儿的校正年龄是正常的。避免不必要的转诊和家庭恐慌。

案例3——双语儿童。在家讲两种语言的 3 岁孩子的土耳其语单词数量似乎很少。 AI草案仅查看了土耳其曲目并写下了“表达语言明显延迟”。专家评估孩子的两种语言的总能力和沟通意图;情况比预期更为积极。文化语言背景改变了结果。

弱提示/强提示

弱提示:

根据这个筛查结果,写一份报告,看看孩子是否有发育迟缓。

问题:要求人工智能做出诊断决策,将截止分数转换为精度,没有陷阱检查,身份/上下文不明确。

强力提示:

你的角色是选秀助理。将下面的匿名筛查结果转化为家庭友好的摘要草稿。做出诊断;将截止分数转化为最终决定;将边界附近的区域标记为[专家判断];如果有什么需要纠正的地方请提醒我。在末尾添加注释,“这是筛查摘要,而不是诊断。”结果:[匿名,逐个字段]

常见错误

  • 将筛查转化为诊断:使用谨慎的语言,“可能建议进一步评估”,而不是“有延迟”。
  • 忘记年龄校正:校正年龄对于早产儿来说至关重要。
  • 绝对化截止分数:截止值需要临床判断。
  • 将单次治疗视为绝对事实:孩子当天的行为并不总是典型的。
  • 让人工智能计算分数:使用车辆自己的协议熟练地完成评分。

综上所述

发育筛查决定风险,而不是诊断;这个边界是一切的开始。人工智能在筛查过程中不会评分或诊断;它只是将经过验证的结果转化为简单而谨慎的摘要/报告草稿。在发表评论之前,要抓住诸如年龄校正、文化语言适当性、单次效应和分数盲目性等陷阱。最终的评价和指导决定由专家签字并作出。

应用任务

获取(匿名)扫描结果。首先用车辆自带的手册验证评分。然后,根据第一个提示生成家庭摘要草稿,并根据第三个提示生成报告框架。然后根据第四个提示检查吃水是否有陷阱。最后,将您在草稿中更正的诊断性或明确性陈述翻译成谨慎的语言,并记下至少两处更正。

清单

  • [ ] 我根据该工具的协议对该工具进行管理和评分;我没有AI给它打分。
  • [ ] 我保留了筛查与诊断的区别;我将草案中的精确表述翻译成谨慎的语言。
  • [ ] 如果有早产,我计算出修正年龄。
  • [ ] 我评估了文化/语言的适当性和双语能力。
  • [ ] 我使用临床判断来处理临界结果。
  • [ ] 我对数据进行了匿名处理;我在摘要中添加了注释“扫描不是诊断”。
  • [ ] 我作为专家做出了最终转介决定并签字。