이득:
- 환각이 언어 모델에 내재되어 있음을 이해하고 각 출력 유형에 대해 적절한 확인 방법을 선택하는 능력.
- 삼각 측량을 통해 두 가지 독립적인 방식으로 중요 값을 확인하고 유창함과 정확성을 혼동하지 마세요.
- 투명성, 추적성, 데이터 무결성 및 인간의 책임을 과학적 무결성의 기초로 적용하는 능력
이 모듈 전체에서 "AI가 생산하고 인간이 확인합니다."라는 단일 문구가 계속해서 반환되었습니다. 이번 단원에서는 해당 문장을 시스템으로 변환합니다. AI의 가장 위험한 행동인 환각(자신감 있는 언어로 허위/조작된 정보를 생성하는 것)을 인식하고, 각 출력 유형에 대한 구체적인 검증 방법을 확립하고, 이 모든 것을 과학적 무결성(정직성, 투명성, 추적성)의 프레임워크 내에 배치하는 것이 목표입니다. 화학 분야에서 검증되지 않은 AI 결과는 단순한 실수가 아닙니다. 실험이 폭발하는 것일 수도 있고, 사람이 중독되는 것일 수도 있고, 논문이 철회되는 것일 수도 있습니다.
환각이 불가피한 이유는 무엇입니까?
대규모 언어 모델은 "다음으로 가장 가능성이 높은 단어"를 생성합니다. 그것은 진실이 아닌 가능한 것을 목표로 합니다. 따라서 그는 그것이 진짜인지 확인하지 않고도 "합리적으로 보이는" 값으로 분자량, DOI 또는 끓는점을 채울 수 있습니다. 환각은 오작동이 아니라 이 기술의 특성으로 인한 결과입니다. 해결책은 모델을 "수정"하는 것이 아니라 각 출력 주위에 검증 셸을 구축하는 것입니다.
환각의 가장 교활한 측면은 자신감 있는 언어입니다. 잘못된 분자량은 올바른 분자량과 정확히 동일한 신뢰도로 표시됩니다. 따라서 "자신감 있어 보인다"는 것은 결코 "옳다"는 의미가 아닙니다.
주의: AI가 주제에 대해 얼마나 유창하고 자신감있게 말하는지는 해당 정보의 정확성과 관련이 없습니다. 유창함은 확신합니다. 독립적인 소스만이 정확성을 결정합니다.
화학의 출력 유형별 검증
각 출력 유형에는 고유한 확인 방법이 있습니다. 단일 규칙을 기억하는 대신 출력에 적합한 도구를 사용하십시오.
출력 유형
확인 방법
차량
분자량, 공식
수식에서 다시 계산
RDKit / 수동으로
미소/구조
구문 분석 + 정규화
RDKit
인용/DOI
데이터베이스에서 해결
doi.org, 크로스참조
물리적 상수(kn, pKa)
참조 데이터베이스
PubChem, 핸드북
수치 계산
코드 작성+실행
파이썬
반응/상태
문헌 확인
Reaxys, 기사
보안 주장
SDS/GHS
공식SDS
스펙트럼 할당
다중 기술 + 인간
실험 스펙트럼
이 표는 실제로 이 모듈을 요약한 것입니다. 각 단위는 하나의 행입니다.
삼각측량: 세 개의 독립적인 경로
가장 강력한 검증 기술은 "삼각 측량"입니다. 즉, 세 가지 독립적인 방법으로 동일한 결론에 도달합니다. 예를 들어, 분자량의 경우: (1) YZ가 말하는 것, (2) RDKit의 계산, (3) 공식에서 직접 계산합니다. 세 가지가 겹치면 신뢰도가 높습니다. 누군가가 길을 잃으면 멈추고 조사하십시오. 화학 분야의 단일 소스에만 의존하지 마십시오. 최소한 두 개의 독립적인 경로를 찾으십시오.
단계별: 확인 작업흐름
- 출력 분류: 숫자, 구조, 속성, 보안 주장입니까?
- 적절한 도구 선택: 위 표에서 출력 유형에 대한 적절한 확인 경로를 가져옵니다.
- 독립적으로 계산/검색: AI와 독립적으로 차량을 실행합니다. 결과를 비교해보세요.
- 편차가 있으면 중지: 값이 일치하지 않으면 어느 것이 올바른지 조사하지 않고 진행하지 마십시오.
- 흔적을 남기세요: 확인한 내용과 방법(과학적 무결성)을 기록하세요.
- 불확실성 지정: 확인할 수 없는 사항을 "확인되지 않음"으로 표시하고 숨기지 마십시오.
복사 가능한 템플릿 4개
1) 자체 검증:
방금 다음과 같은 출력을 제공했습니다: [OUTPUT]. 작업: 이 출력의 각 숫자/사실 주장을 별도의 줄에 나열합니다. 각 주장에 대해: "어떻게 독립적으로 검증할 수 있나요?" 쓰기 방법(도구/데이터베이스). 그 주장이 사실이라고 주장하지 마십시오. 확인할 수 있는 방법을 알려주세요.
2) 삼각측량 제어:
다음 분자의 무게를 세 가지 방법으로 확인하고 싶습니다. [웃음].과제: 1) 분자식을 도출합니다.2) 분자량 계산 원자를 원자별로 표시합니다(각 요소의 기여도). 참고: RDKit에서도 계산하고 세 번째로 귀하가 제공한 것과 비교할 것입니다. 세 개가 겹치지 않으면 경고합니다.
3) 모호성 표시:
다음 텍스트에는 여러 가지 사실적 주장이 있습니다.[TEXT]작업: 각 주장 옆에 신뢰 수준 라벨을 입력하세요.[VERIFIED] / [VERIFIED] / [UNCERTAIN]. 확실하지 않은 경우 [VERIFIED]로 표시하지 마세요.
4) 일관성 교차 쿼리:
나는 같은 질문을 두 가지 다른 방식으로 물을 것입니다. 귀하의 답변이 일관성이 있는지 확인하십시오. 질문 A: 화합물의 분자식은 무엇입니까?
약한 프롬프트 / 강한 프롬프트
약함:
이 화합물에 대해 알고 있는 모든 것을 적어보세요.
AI는 검증 가능한 정보와 조작된 정보를 무분별하게 혼합합니다. 어느 것이 진짜인지는 불분명하다.
강한:
이 화합물에 대한 정보를 제공하되 각 주장에 다음과 같이 라벨을 붙입니다: [결정성 - 장비로 검증됨] 예: 분자식,[실험적 - 인용 필요] 예: 융점,[불확실함 - 확실하지 않음]. 라벨이 없는 주장을 작성하지 마십시오.
차이점: 우리는 AI가 자신의 불확실성을 표시하도록 강요했습니다. 우리는 검증 작업을 계획 가능하게 만들었습니다.
과학적 진실성: 정직성과 추적성
검증은 단순한 기술적인 단계가 아니라 윤리적인 문제입니다. 과학적 진실성은 다음을 요구합니다:
- 투명성: AI를 사용하고 있다는 사실을 숨기지 마십시오. 출판/보고 정책에 따라 지정하세요.
- 추적성: AI에서 나온 결과와 그것이 어떻게 검증되었는지 기록합니다.
- 데이터 무결성: AI로 결과를 "미화"하고, 정당화 없이 이상값을 폐기하는 것은 사기입니다.
- 책임: 최종 결과에 대한 책임은 귀하에게 있습니다. “AI가 그렇게 말했다”는 변명은 아니다.
팁: 신고나 변호에서 "AI가 그렇게 말했다"라는 문구를 절대 사용할 수 없다는 점을 처음부터 받아들이세요. 이러한 승인은 자동으로 모든 출력을 확인하는 습관을 가져옵니다.
미니 케이스
사례 1 - 삼각측량에서 오류가 발견되었습니다. 한 학생이 세 가지 방법으로 분자량을 확인했습니다. YZ는 178.2, 수동 계산은 180.16, RDKit은 180.16을 나타냈습니다. 두 개의 독립적인 경로가 겹쳐서 AI를 제거했습니다. 교훈: 두 개의 독립적인 검증이 하나의 잘못된 출력을 자동으로 무효화합니다.
사례 2 - 안전한 언어, 잘못된 정보. AI는 반응이 "상온에서 자발적으로 진행된다"고 매우 자신있게 썼습니다. 문헌은 이를 위해서는 가열과 촉매가 필요하다는 것을 보여주었습니다. 학생은 안전한 언어가 아닌 출처를 신뢰했습니다. 교훈: 유창함은 정확성이 아닙니다.
사례 3 — 투명성을 얻었습니다. 한 연구원은 논문의 방법 부분에서 AI를 어떤 단계(텍스트 편집, 코드 작성)를 사용했는지 명확히 밝히고, 모든 수치 결과를 독립적으로 검증했다고 적었습니다. 심사과정은 순조롭게 진행됐다. 교훈: 투명성은 신뢰를 구축하고, 은폐는 위험을 낳습니다.
일반적인 실수
- 안전한 언어를 신뢰합니다. AI의 자신감 넘치는 어조가 정확성을 나타내는 것은 아닙니다.
- 단일 소스에 의존합니다. 삼각측량 없이 단일 출력을 허용합니다.
- 출력 유형을 분리하지 않습니다. 같은 방법으로 숫자, 속성, 보안 주장을 "확인"했다고 생각합니다.
- 불확실성을 숨깁니다. 확인할 수 없는 것을 확실한 것처럼 보고합니다.
- AI 사용을 숨깁니다. 투명성이 부족하면 과학적 완전성이 훼손됩니다.
- 책임을 위임합니다. "AI가 그렇게 말했다"는 변명은 유효하지 않습니다. 책임은 그 사람에게 있습니다.
요약하면
- 환각은 언어 모델에 내재되어 있습니다. 해결책은 각 출력 주위에 검증 셸을 구축하는 것입니다.
- 각 출력 유형에는 고유한 확인 방법이 있습니다. 출력을 분류하고 적절한 도구를 사용하십시오.
- 삼각 측량(두 개의 독립 경로)은 가장 강력한 제어입니다. 단일 소스를 신뢰하지 마십시오.
- 유창함과 자신감 있는 언어는 정확성과 관련이 없습니다.
- 과학적 무결성에는 투명성, 추적성, 데이터 무결성 및 인간의 책임이 필요합니다.
응용과제
AI 세션에서 분자량, 기준, 물리적 상수, 보안 주장, 수치 계산 등 다양한 출력을 의도적으로 생성합니다. 올바른 방법으로 각각을 독립적으로 확인하십시오(표 참조). 적어도 하나의 환각을 포착해 보십시오. 그런 다음 "검증 행렬"을 준비합니다: 행 출력, 열(AI 값/독립 값/겹쳤습니까/어떻게 검증했습니까). 이번 세션을 과학적 진실성 측면에서 어떻게 보고하시겠습니까?
체크리스트
- [ ] 환각이 불가피한 이유를 이해합니다.
- [ ] 각 출력물을 종류에 따라 분류하고 적절한 방법으로 검증합니다.
- [ ] 중요한 값에 대해 삼각 측량(두 개의 독립 경로)을 수행합니다.
- [ ] 나는 안전한 언어가 아닌 출처를 신뢰합니다.
- [ ] 확인할 수 없는 사항은 '불확실'로 표시합니다.
- [ ] 나는 AI 사용에 대해 투명하게 설명하고 결과에 대해 책임을 집니다.