단위 11 / 11

윤리, 차단방역, 기밀유지 및 과학적 진실성

이득:

  • KVKK, GDPR 및 윤리 위원회 규칙에 따라 민감한 인간/유전자 데이터를 보호하고 공개 모델에 제공하지 않는 능력
  • 차단방역/이중 사용 및 인구 편향의 위험을 평가하여 결과의 타당성에 의문을 제기할 수 있는 능력
  • 윤리적 책임은 차량에 위임할 수 없으며 의미 있는 인간 참여가 필요하다는 점을 이해함

생물학에서 인공지능을 강력하게 사용하는 것은 이를 책임감 있게 사용함으로써 보완됩니다. 생물학은 인간의 건강, 유전적 프라이버시, 환경, 심지어 생물보안까지 다루는 민감한 분야입니다. 이번 단원에서는 생물학적 연구에 인공 지능을 사용할 때 직면하게 될 윤리적, 법적, 보안 책임에 대해 논의합니다. 이 단원은 이전 단원의 검증과 정직성의 원칙을 바탕으로 구축된 프레임워크입니다.

기본 원칙: AI는 도구입니다. 윤리적 책임은 언제나 인간에게 있습니다. "제안된 모델"은 변명이 아닙니다.

네 가지 책임 영역

1. 데이터 개인정보 보호 및 인간 데이터

인간 참가자의 유전, 임상 또는 건강 데이터는 매우 민감합니다. 개인의 DNA 서열은 자신과 친척의 질병 위험과 신원을 밝힐 수 있습니다. 익명으로 처리된 것으로 생각되는 게놈 데이터도 재식별이 가능합니다. 이 데이터를 공개적으로 사용 가능한 AI 모델에 붙여넣는 것은 데이터 보호법(터키예의 KVKK, 유럽의 GDPR) 및 윤리 위원회(IRB/윤리 위원회) 승인을 위반할 수 있습니다.

  • 공개 모델에 개인/임상 데이터를 제공하지 마세요.
  • 동의 범위를 넘어서는 사용을 금합니다. 참가자는 무엇에 동의했습니까?
  • 기업/로컬(온프레미스) 또는 데이터 처리 계약 도구를 선택하세요.

2. 차단방역 및 이중용도

일부 생물학적 정보는 "이중 용도"입니다. 즉, 유용할 수도 있고 해로울 수도 있습니다. 예를 들어 병원체(질병 유발) 서열, 독소 생산. 위험한 병원체를 강화하거나 유해한 생물학적 작용제를 설계하는 데 대한 정보를 AI에 요청하는 것은 대부분의 장소에서 비윤리적이고 불법입니다.

  • 위험한 이중 용도 요청을 하지 마십시오.
  • 해당 기관의 생물안전위원회(IBC) 지침을 따르십시오.

3. 과학적 진실성

이전 단원에서 본 모든 내용이 여기에 통합되어 있습니다. 허위 귀속 없음, 데이터 미화 없음, p-해킹 없음, 선택적 보고 없음. 인공 지능은 이를 더 쉽게 만들 수도 있고 더 어렵게 만들 수도 있습니다. 차이점은 정직성에 있습니다.

  • 모든 결과(부정적인 결과 포함)를 보고합니다.
  • 인공지능 활용을 선언합니다.
  • 원시 데이터 및 코드를 공유하여 재현성을 지원합니다(가능한 경우).

4. 편견과 공정성

AI 모델은 훈련된 데이터의 편향을 전달합니다. 게놈 데이터베이스는 주로 유럽계 인구로 구성됩니다. 이로 인해 다른 모집단에서는 예측이 더 나 빠지게됩니다. 훈련 데이터에서 과소 표현되는 조건에서는 이미지 모델의 성능이 저하될 수 있습니다.

  • 모델이 어떤 모집단/데이터에 대해 훈련되었는지 질문하세요.
  • 결과가 모든 그룹에 걸쳐 유지되는지 평가합니다.
팁: 스스로에게 물어보세요. "이 데이터를 모델에 제공하면 해당 데이터는 누구에게 속하며 그 사람이 권한을 부여했습니까?" 답변이 모호하면 제공하지 마십시오. 기밀 유지 위반은 되돌릴 수 없습니다.

단계별: 책임 있는 AI 제어

  1. 데이터 소스를 분류합니다: 개인/민감한가요 아니면 공개인가요?
  2. 동의 및 권한 확인: 이 사용이 보장됩니까?
  3. 올바른 도구 선택: 민감한 데이터를 위한 보안/기본 환경.
  4. 이중 사용의 위험을 고려하십시오.
  5. 질문 편향: 결과가 모든 그룹에서 유효한가요?
  6. 문서화하고 사용을 선언합니다.

복사 가능한 프롬프트 템플릿

윤리적 관점에서 아래 분석 계획을 검토하십시오. 데이터 기밀성, 참가자 동의, 잠재적 편견 및 이중 사용 위험에 관한 주의 사항을 나열하십시오. 계획: [텍스트] (참고: 실제 환자 데이터는 공유하지 않고 계획만 공유합니다.)

이 게놈 데이터 세트를 사용하기 전에 어떤 개인 정보 보호 및 동의 질문에 대답해야 합니까? KVKK/GDPR 및 윤리위원회 측면에서 체크리스트가 준비되어 있습니다.

내 글의 방법 섹션에서 내가 사용하는 인공지능 도구를 어떻게 투명하게 선언해야 합니까? 선언문의 예를 작성하세요. 어떤 정보(도구, 버전, 사용 범위)를 포함해야 합니까?

이 모델의 결과에 인구 편향이 있는지 어떻게 평가합니까? 훈련 데이터와 확인 단계에 대해 물어봐야 할 질문을 나열하세요.

약한 프롬프트 / 강한 프롬프트

약함: "다음 환자의 유전 데이터를 분석하십시오: [실제 데이터]."

Güçlü: "임상 게놈 데이터로 작동하는 분석 계획을 설정하고 있지만 실제 환자 데이터를 공유하지는 않습니다. 방법론적인 관점에서만 어떤 기밀 유지 조치를 취해야 하는지, 어떤 환경에서 데이터를 처리해야 하는지, 어떤 승인 및 윤리 위원회 조건을 충족해야 하는지? 더미/샘플 데이터로 흐름을 보여줄 수 있습니다."

차이점: 강력한 프롬프트에서는 실제 민감한 데이터가 공유되지 않습니다. 방법만 묻습니다. 개인 정보 보호가 유지되며 모델이 여전히 도움이 됩니다.

세 개의 미니 케이스

사례 1 - 개인정보 침해: 연구원이 익명의 환자 엑솜 데이터라고 생각한 것을 공개 모델에 붙여넣어 분석했습니다. 윤리위원회가 이 사실을 알게 되자 연구가 중단되었습니다. 데이터 처리 계약이 없었습니다. 교훈: 민감한 데이터는 공개 모델에 절대 입력되지 않습니다.

사례 2 — 인구 편향: 다유전적 위험 점수 도구는 유럽에서 유래된 데이터에 대해 훈련되었습니다. 다른 집단에서는 위험 추정치가 상당히 부정확했습니다. 모델이 훈련 데이터의 구성에 의문을 제기하자 팀은 해당 모집단에 도구를 사용하지 않기로 결정했습니다. 교훈: 편견은 생명을 구하거나 해를 끼칩니다.

사례 3 — 공개 및 투명성: 팀은 AI를 사용하여 데이터 정리 코드를 작성하고 이를 방법 섹션에 명확하게 명시했습니다. 그는 또한 코드를 공유했습니다. 리뷰어들은 반복성이 강력했기 때문에 이를 환영했습니다. 교훈: 투명성은 신뢰를 낳습니다.

비교 차트

지역

안전한 행동

위험한 행동

환자 데이터

로컬/보안 환경

붙여넣어 모델 열기

동의

범위 내에서 사용

범위를 초과하지 마십시오

차단방역

이중 사용 방지

위험한 수요

무결성

모든 결과 보고

선택적 보고

편견

모집단 쿼리

맹목적으로 적용

투명성

사용 선언

숨기기

일반적인 실수

  • 개방형 모델에 민감한 데이터 제공: 되돌릴 수 없는 개인정보 침해.
  • 동의 범위 초과: 참가자가 승인하지 않은 사용.
  • 편견 무시: 결과를 모든 그룹에 일반화합니다.
  • 사용 은폐: AI 기여를 선언하지 않습니다.
  • "모델 제안" 방어: 차량에 책임을 부여합니다.
주의: 결과가 큰 생물학적 작업(임상 결정, 생물안전성, 인간 데이터)에서 AI 결과는 유능한 전문가 검증 및 윤리적 감독을 대체할 수 없습니다. 속도만 빨라질 뿐입니다. 궁극적인 책임은 결정의 윤리적, 과학적 결과와 함께 항상 인간에게 있습니다.

환경, 생태 및 전통지식

윤리적 책임은 인간 데이터에만 국한되지 않습니다. 생태학과 보존생물학 분야에서 인공지능을 활용할 때도 주의가 필요하다. 예를 들어, 멸종 위기에 처한 종의 정확한 위치 데이터(카메라 트랩 좌표)는 밀렵 위험 때문에 민감합니다. 이 데이터를 공개 모델이나 대중에게 공개하면 종에 해를 끼칠 수 있습니다. 마찬가지로, 지역 사회의 전통적인 생물학적 지식(예: 식물의 이용)이 허가 없이 사용될 때 윤리적, 법적 문제(예: 나고야 의정서)가 발생합니다. 데이터를 사용하기 전에 "이 정보는 누구의 것이며 공개로 인해 피해를 입는 사람은 누구입니까?" 항상 질문하십시오.

사람의 감독과 최종 결정

이 전체 모듈의 본질은 의미 있는 인간 감독이라는 하나의 원칙으로 귀결됩니다. AI는 제안을 하고, 초안을 작성하고, 패턴을 보여줍니다. 그러나 생물학적, 임상적 또는 윤리적 결정은 결코 모델 결과에 직접적으로 기반을 두지 않습니다. 특히 고위험 분야(진단, 치료, 종보존 결정, 방출)에서는 결정을 내리는 것이 아니라 전문가의 결정을 가속화하는 것이 모델의 역할이다. "인간 참여형(Human-In-The-Loop)" 접근 방식은 슬로건이 아니라 필수 사항입니다.

이 감시가 작동하려면 감독자가 유능해야 합니다. 맹목적인 동의(“모델이 말함, 수락”)는 감독이 아닙니다. 진정한 감독에는 출력에 의문을 제기하고 오류를 포착하며 필요할 경우 거부할 수 있는 전문 지식이 필요합니다. 따라서 인공지능은 전문가를 대체하지 않는다. 전문가가 더욱 중요해집니다. 차량을 가장 잘 사용하는 사람이 차량을 가장 잘 제어할 수 있습니다.

요약하면

생물학에서 AI의 책임 있는 사용은 데이터 개인 정보 보호(민감한 인간 데이터 보호), 생물학적 보안(이중 사용 방지), 과학적 무결성(정직하고 완전한 보고) 및 편견 인식(모든 그룹에 걸친 결과의 타당성)의 네 가지 영역을 다룹니다. 공개 모델에 민감한 데이터를 제공하지 말고 사용법을 투명하게 선언하고 인구 편향에 의문을 제기하세요. 윤리적 책임은 절대로 대리인에게 위임될 수 없습니다. 그것은 항상 인간 속에 있습니다.

응용과제

자신의 작업 공간에서 시나리오를 생각해 보세요(예: 인간 데이터 세트 또는 이미지 모델 사용). AI가 실제 데이터를 공유하지 않고 이 시나리오의 윤리적 체크리스트(기밀성, 동의, 편견, 이중 사용, 투명성)를 제시하도록 하세요. 각 항목에 대해 귀하의 상황에 "적절함/위험함/불확실함"으로 표시하고 위험함/불확실한 항목에 대한 실행 계획을 작성하십시오. 또한 기사에 대한 AI 사용 설명 초안을 작성하십시오.

체크리스트

  • [ ] 공개 모델에 민감한/개인 데이터를 제공하지 않았습니다.
  • [ ] 동의범위 및 윤리위원회를 확인하였습니다.
  • [ ] 이중용도/차단안전 위험을 평가했습니다.
  • [ ] 모든 결과를 솔직하게 보고하였습니다.
  • [ ] 인구/데이터 편향에 대해 의문을 제기했습니다.
  • [ ] 인공지능 활용을 투명하게 선언하고 책임을 다하겠습니다.

모듈 시험

1. 한 학생이 언어 모델에게 '이 FASTA 파일에는 몇 개의 문자열이 있습니까?'라고 물었습니다. 그가 묻고 모델은 '48'이라고 대답합니다. 가장 올바른 접근 방식은 무엇입니까?

  • A) 모델에서 부여한 숫자 48을 직접 사용합니다. 모델은 파일을 보기 때문에 신뢰할 수 있습니다.
  • B) 번호를 다시 한 번 물어보고 두 답변이 같으면 정답으로 받아들입니다.
  • C) Biopython으로 파일 읽기, 코드로 시퀀스 수 계산 및 출력 사용 ✔
  • D) 파일을 수동으로 열고 눈으로 판단하여 계산

설명: 계산 및 측정과 같은 결정적 작업은 언어 모델이 아니라 실행하는 코드에 맡겨야 합니다. 모델은 숫자를 '기억'하지 않으며 확률적 값을 생성하므로 실수할 수 있습니다. Biopython과 같은 도구를 사용하면 정확하고 재현 가능한 결과를 얻을 수 있습니다.

2. 현미경 이미지에서 세포의 수를 세어 각각의 면적을 측정하고 싶습니다. 이 작업에 가장 적합한 접근 방식은 무엇입니까?

  • A) Cellpose/StarDist와 같은 전문적인 세분화 도구를 사용하고 결과를 수동으로 확인 ✔
  • 나) 일반 언어 모델에 이미지를 붙여넣고 '셀이 몇 개인지' 물어보세요.
  • 다) 모델에게 이미지를 설명하고 대략적인 수치를 물어본다.
  • D) 보정 없이 픽셀 수를 셀 수로 받아들임

설명: 세포 분할 및 측정은 일반 언어 모델의 영역이 아니라 이 작업을 위해 특별히 훈련된 특수 이미지 모델(Cellpose, StarDist)의 영역입니다. 언어 모델은 이러한 도구를 호출하는 코드를 작성합니다. 전문가 모델이 측정을 수행하고 생물학자가 결과를 확인합니다.

3. 대학원생이 논문 소개에 언어 모델로 생성된 8개의 소스를 추가합니다. 컨설턴트는 이들 중 3개가 전혀 존재하지 않는다는 사실을 발견했습니다. 이런 상황을 어떻게 예방할 수 있습니까?

  • A) 다시 한 번 모델에게 자원 생산을 요청함으로써
  • 나) DOI가 있는 인용문만 선택하여 (DOI가 있으면 진짜임)
  • C) 모델에 '맞춤'을 지시하여 목록을 요청합니다.
  • D) PubMed/doi.org에서 각 인용을 독립적으로 확인하고 자신이 읽은 기사만 인용 ✔

설명: 일반 언어 모델은 문헌 데이터베이스가 아닙니다. 실제 기록을 검색하는 대신 현실적으로 들리는 속성(조작된 속성)을 '생성'합니다. 각 작성자와 DOI는 PubMed/doi.org와 같은 출처에서 독립적인 검증 없이 사용해서는 안 되며 실제로 읽은 기사만 인용해야 합니다.

4. 인공지능이 작성한 데이터 정리 코드의 정확성을 보장하는 가장 강력한 방법은 무엇입니까?

  • A) 코드가 오류 없이 작동하면 올바른 것으로 받아들입니다.
  • B) 알려진 작은 샘플로 결과를 테스트하고 주장을 통해 기대치를 검증합니다. ✔
  • C) 모델에게 '코드가 맞나요?'라고 물어보세요. '예'라는 대답을 묻고 믿으세요.
  • D) 코드를 여러 번 실행하고 매번 동일한 출력을 얻습니다.

참고: 코드가 오류 없이 작동한다고 해서 그것이 정확하다는 의미는 아닙니다. '잘못된 코드가 오류 없이 작동하는' 것은 생물학에서 가장 위험한 상황입니다. 결과를 미리 알고 있는 작은 샘플로 테스트하고 코드에 어설션을 포함하는 기대치는 자동으로 잘못된 결과를 방지하는 가장 강력한 방어책입니다.

5. RNA-seq 분석에서는 20,000개의 유전자가 테스트되었으며 3,800개의 유전자가 보정 없이 p<0.05로 '유의'한 것으로 나타났습니다. 이 결론의 주요 문제점은 무엇입니까?

  • A) 샘플 수가 너무 많아 줄여야 합니다.
  • B) p 임계값이 너무 높습니다. 0.10을 사용해야 합니다.
  • C) 다중 비교 보정(FDR)이 수행되지 않았습니다. 오탐지가 많습니다 ✔
  • D) 유전자 대신 샘플을 테스트해야 합니다.

설명: 수천 개의 유전자를 동시에 테스트할 때 실제 차이가 없더라도 많은 유전자가 우연히 '중요한' 것으로 나타납니다. 이를 다중 비교 문제라고 합니다. 해결책은 Benjamini-Hochberg와 같은 방법으로 FDR(false discovery rate) 보정을 적용하는 것입니다. 수정을 통해 목록은 일반적으로 수십에서 수백 개의 유전자로 줄어듭니다.

6. BLAST 결과에서 가장 잘 일치하는 항목의 E-값은 2.0입니다. 이것은 무엇을 의미합니까?

  • A) 경기는 무작위일 가능성이 높습니다. ✔ 신뢰할 수 있는 일치가 아님
  • B) 결합이 매우 강합니다. e-가치가 높을수록 좋습니다.
  • C) 2%의 비율로 일치하는 시퀀스
  • D) 두 시퀀스 사이에는 2개의 염기 차이가 있습니다.

설명: E-값은 일치가 무작위일 것으로 예상됨을 나타냅니다. 작은 것이 더 좋습니다. 1보다 큰 e-값은 일치 항목이 무작위일 가능성이 가장 높다는 것을 나타냅니다. 신뢰할 수 있는 일치를 위해 일반적으로 e < 1e-5와 같은 매우 작은 임계값을 찾습니다.

7. AlphaFold 모델에서 단백질의 말단 영역은 낮은 pLDDT 점수(<50)를 나타냅니다. 이 지역은 어떻게 해석해야 할까요?

  • A) AlphaFold가 이 영역에서 오류를 범했습니다. 분석에서 해당 영역을 제거해야 합니다.
  • B) 이 영역은 확실히 알파나선이다
  • C) 모델이 완전히 신뢰할 수 없으므로 구조를 사용해서는 안 됩니다.
  • D) 해당 지역은 불규칙하거나 탄력적일 가능성이 높습니다. '거짓'이 아닌 '불분명'으로 해석해야 합니다 ✔

설명: pLDDT는 각 아미노산에 대한 국소 신뢰도 점수입니다. 50 미만의 값은 실제로 불규칙한(유연하고 고정되지 않은) 영역을 반영하는 경우가 많습니다. 이러한 영역을 '잘못된 추측'으로 자동 삭제하는 것은 잘못된 것입니다. 점수가 낮다면 '불확실함/유연함'으로 읽어야 하며, 생물학적 의미를 평가해야 합니다.

8. 연구자는 셀 영역을 픽셀 단위로만 보고하며 그 결과는 문헌과 일치하지 않습니다. 누락된 단계는 무엇입니까?

  • A) 더 많은 셀을 계산했어야 합니다.
  • B) 스케일 보정(픽셀에서 마이크로미터로의 변환)이 수행되지 않았으며, 결과가 물리적 단위로 변환되지 않았습니다. ✔
  • C) 분할 도구가 잘못 선택되었습니다.
  • D) 이미지 해상도가 너무 높습니다.

설명: 이미지에서 물리적 크기를 추출하려면 스케일 보정(픽셀당 마이크로미터 수)이 필수적입니다. 이 단계를 건너뛰면 현미경 설정에 따라 값이 비교할 수 없는 상태로 유지됩니다. 면적은 제곱 마이크로미터와 같은 물리적 단위로 변환되어야 합니다.

9. 한 학생이 마우스 한 마리에서 10개의 조직 샘플을 채취하여 통계에 'n=10'을 사용합니다. 이것이 잘못된 이유는 무엇입니까?

  • A) 통계를 위해서는 10개의 샘플이 너무 적습니다. 최소한 30개는 필요합니다.
  • B) 조직 샘플은 다른 기관에서 채취되어야 했습니다.
  • C) 이 10가지 예는 기술적 반복입니다. 생물학적 n은 여전히 1입니다. 이것이 소위 반복입니다 ✔
  • D) 샘플은 같은 날 채취되었으므로 유효하지 않습니다.

설명: 동일한 개인에게서 반복적으로 측정한 값은 기술적 반복입니다. 여기서 통계적 n은 생물학적 단위(여기서는 생쥐)의 수입니다. 기술적 반복을 생물학적(유사 복제)으로 간주하면 잘못된 의미가 생성됩니다. 적절한 디자인은 여러 개인과 함께 작업하는 것을 의미합니다.

10. 한 분석에서는 p=0.03으로 나타났습니다. 이 값을 올바르게 해석한 것은 무엇입니까?

  • A) 실제로는 차이가 없는데 이 이상의 극단적인 결과가 나올 확률은 3% 입니다 ✔
  • B) 효과가 실제일 확률은 97%이다.
  • 다) 귀무가설이 참일 확률은 3%이다.
  • D) 결과는 97% 반복 가능합니다.

설명: p값은 '가설이 참일 확률'이나 '효과가 참일 확률'이 아닙니다. p-값은 실제로 차이가 없을 때 관찰된 것보다 더 극단적인 차이가 나타날 확률입니다. 따라서 p=0.03은 '효과가 97% 실제'라는 의미는 아닙니다. 결과는 효과 크기와 신뢰 구간을 기준으로 평가해야 합니다.

11. 프레젠테이션에서는 y축을 95~100 범위로 압축하면 두 그룹 간의 3% 차이가 크게 표시됩니다. 이것은 무엇의 예입니까?

  • A) 좋은 시각화 기술; 차이점을 강조
  • B) 색맹 친화적인 팔레트 문제
  • C) 허용되는 스타일 선택
  • D) 잘린 축과의 차이를 과장하여 오해를 불러일으키고 부정직한 차트 ✔

설명: 축을 0(잘린 축)에서 초기화하지 않으면 시각적으로 작은 차이가 과장되어 보는 사람에게 오해를 불러일으킬 수 있습니다. 이는 정직의 원칙을 위반하는 것입니다. 특히 막대 차트에서는 축이 0부터 시작해야 하며 그 차이가 실제 크기로 표시되어야 합니다.

12. 한 연구원이 익명의 환자 엑솜 데이터라고 생각하는 것을 공개 언어 모델에 붙여넣어 분석합니다. 이 동작이 왜 문제가 됩니까?

  • A) 문제 없습니다. 익명이면 데이터를 공유할 수 있습니다.
  • B) 민감한 환자 데이터를 개방형 모델에 제공하는 것은 개인정보 보호 및 윤리/법적(KVKK/GDPR) 위반이며 되돌릴 수 없습니다. ✔
  • 다) 분석이 느리기 때문에 문제가 된다
  • D) 모델이 데이터를 이해할 수 없기 때문에 문제가 있습니다.

설명: 환자 유전/임상 데이터는 매우 민감합니다. 익명이라고 생각되는 게놈 데이터도 재식별될 수 있습니다. 이 데이터를 공개 모델에 제공하는 것은 KVKK/GDPR 및 윤리위원회(IRB) 승인을 위반하는 것이며 되돌릴 수 없는 개인정보 침해입니다. 민감한 데이터는 로컬/안전하고 계약된 환경에서 처리되어야 합니다.

13. 한 연구에서 그들이 '환자 대 대조군'이라고 생각한 차이는 실제로 샘플이 서로 다른 이틀에 처리되기 때문이었습니다. 이 상황을 무엇이라고 하며 어떻게 처리합니까?

  • A) 이상치 효과입니다. 점을 삭제해야 함
  • B) 정규화가 부족합니다. 스케일 수정만으로 충분합니다
  • C) 배치 효과입니다. 설계에서 균형을 이루고 모델에 배치 변수로 추가되어야 합니다. ✔
  • D) p-해킹; 시험을 바꿔야 해

설명: 샘플링 배치/가공일에 따른 기술적 차이를 배치 효과라고 하며 생물학적 차이와 혼동될 수 있습니다. 올바른 접근 방식은 설계에서 배치의 균형을 맞추고 배치 변수를 통계 모델(예: '~배치 + 조건')에 추가하여 기술적 신호와 생물학적 신호를 분리하는 것입니다.

14. DNA 서열의 GC 비율을 계산하려고 합니다. 정확하고 반복 가능한 접근 방식은 무엇입니까?

  • A) Biopython으로 GC 비율을 계산하는 코드를 인쇄하고 실행한 후 출력물을 사용하세요 ✔
  • B) 모델에 시퀀스를 제공하고 GC 속도를 구두로 말하도록 요청합니다.
  • 다) 해당 모델에서 제시한 비율을 다른 모델에서 확인
  • D) 시리즈의 처음 100자를 보고 눈으로 추측하기

설명: GC 비율은 결정론적인 계산입니다. 언어 모델이 '기억하는' 값이 아니라 배열을 처리하는 코드를 기반으로 해야 합니다. 모델이 계산하도록 하는 대신 Biopython과 같은 도구로 계산 코드를 인쇄하고 직접 실행하면 실행할 때마다 동일한 결과를 제공하는 정확한 출력을 제공합니다.