이득:
- 결정론적으로 계산된 특징과 통계적으로 추정된 특징을 구별하고 신뢰도를 결정하는 능력
- 적용성 영역의 개념을 활용하여 모델이 신뢰할 수 있는 영역을 평가하는 능력
- 후보자의 순위를 매기고 실험을 통해 최종 결정을 내리려면 특성 예측을 사용해야 한다는 것을 이해하는 능력.
분자를 합성하기 전에 우리는 종종 "수용성인가? 얼마나 산성인가? 세포막을 통과하는가? 약물 후보로 타당성이 있는가?"라고 묻는다. 실험 전에 이러한 질문에 대한 답을 예측하면 많은 시간이 절약됩니다. AI와 그 특수 모델(특히 QSAR - 정량적 구조-활동 관계, 즉 분자의 구조적 설명자로부터 속성을 예측하는 통계 모델)은 이러한 예측에 강력합니다. 그러나 이러한 예측은 측정이 아닌 확률에 대한 예측입니다. 이번 단원에서는 특징 예측과 그 강점, 그리고 가장 중요한 개념인 적용 가능 영역(모델이 신뢰할 수 있는 영역)에 대해 알아봅니다.
어떤 특징이 예측되나요?
- logP: 분자의 오일/물 분배 계수; 친유성(지방을 좋아함)을 나타냅니다. 약물 흡수에 중요합니다.
- 용해도(logS): 물에 용해되는 정도입니다.
- pKa: 산도/알칼리도; 그룹이 이온화되는 pH입니다.
- TPSA: 위상학적 극 표면적; 투과도 추정에 사용됩니다.
- Lipinski "5의 법칙": 경구용 약물 후보의 분자량, logP, H-결합 기증자/수용자의 수에 대한 실제 임계값.
이러한 값 중 일부는 RDKit과 같은 도구를 사용하여 결정론적으로 계산됩니다(예: TPSA, H-결합 번호). 그 중 일부는 통계적 추정치(logS, 생물학적 활동)입니다. 이 차이를 아는 것이 당신이 얼마나 신뢰하는지를 결정합니다.
팁: 기능이 "계산"(규칙 기반, 반복 가능)인지 "예측"(모델에서, 불확실)인지 구별하세요. 계산에 대한 신뢰도가 높고, 예측에 대한 신중한 확신을 갖고, 실험을 통해 예측을 검증합니다.
적용 범위: 가장 중요한 개념
QSAR 모델은 훈련된 분자와 유사한 분자에서 잘 작동합니다. 훈련 데이터와 매우 다른 분자(예: 매우 크고 특이한 골격)를 제공하는 경우 모델은 여전히 숫자를 생성하지만 해당 숫자는 신뢰할 수 없습니다. 이를 "적용 범위 외"라고 합니다. 모델은 항상 답을 제시합니다. 답변이 신뢰할 수 있는지 여부를 판단하는 것이 귀하의 임무입니다.
언어 모델이 속성 값을 제공하는 경우 훨씬 더 위험합니다. 기본 계산 없이 "가능성이 있는" 값으로 숫자를 생성합니다. 따라서 가능하다면 언어 모델이 아닌 결정론적 도구(RDKit)나 불확실성을 제공하는 QSAR 모델에서 특성 값을 가져옵니다.
단계별: 안전한 특징 예측
- 분자 확인: RDKit(단위 2)를 사용하여 SMILES를 구문 분석합니다.
- 결정론적 계산: RDKit의 MA, logP(계산), TPSA, H-결합 번호.
- 예측을 별도로 표시: "예측" 태그를 사용하여 로그, 활동 등과 같은 모델 예측을 유지합니다.
- 적용 가능성 영역을 확인하세요. 분자가 훈련 데이터와 비슷합니까? 매우 크거나 특이한가요?
- 결정이 아닌 순위 지정에 사용: 예측을 사용하여 후보자 순위를 지정합니다. 궁극적인 선택은 실험입니다.
- 실험 종료: 측정을 통해 중요한 특성(용해도, pKa)을 확인합니다.
복사 가능한 템플릿 4개
1) RDKit의 결정적 기능:
from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (계산됨):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-결합 기증자:", rdMolDescriptors.CalcNumHBD(mol))print("H-결합 수용체:", rdMolDescriptors.CalcNumHBA(mol))
2) Lipinski 규칙 평가:
분자 (웃음): [웃음]과제: RDKit에서 계산할 MA, logP, HBD, HBA 값을 사용하여 Lipinski 규칙 5의 준수 여부를 평가합니다. 각 기준을 합격/불합격으로 별도로 표시합니다. 규칙: 숫자를 만들어내지 마세요. RDKit에서 가져오겠습니다. 댓글을 달아주세요.
3) 특징 추정 + 불확실성 요청:
분자(웃음): [웃음]과제: 수용해도(logS)(높음/중간/낮음)에 대한 정성적 추정치를 제공하고 구조적 특징으로 이론적 근거를 설명합니다. 정확한 숫자를 제공하지 마십시오. 이는 예측이며 실험을 통해 확인해야 한다고 명시합니다. 분자에 비정상적인 구조가 있는 경우 경고합니다(적용 가능성 위험).
4) 후보자 순위(예측에 따른 우선순위):
아래는 5개 분자의 미소입니다. 작업: 구조적 특징(극성 그룹 수, 고리, 친유성)을 기준으로 수용성(가장 잘 녹는 것부터 가장 적게 녹는 것까지)으로 순위를 매깁니다. 각 순위 결정에 대한 정당성을 작성합니다. 참고: 이것은 예비 정렬입니다. 최종 선택은 측정을 통해 이루어집니다.
약한 프롬프트 / 강한 프롬프트
약함:
이 분자의 용해도는 얼마입니까?
AI가 계산에 존재하지 않는 숫자(예: "12 mg/mL")를 구성합니다. 자신감을 주지만 틀릴 수도 있습니다.
강한:
분자(웃음): [스마일].작업: 1) RDKit로 계산할 logP, TPSA, HBD/HBA를 제공합니다: [값].2) 이 값을 기반으로 해상도가 높음/중간/낮음인지 해석합니다.3) 정확한 숫자 제공; 추측이며 실험이 필요하다고 명시합니다.
차이점: 우리는 차량에서 결정론적 값을 가져와 AI가 이를 해석하도록 했습니다. 우리는 불확실성과 실험의 필요성을 명시적으로 요청했습니다.
기능 유형 및 신뢰 수준
특징
얻는 방법
신뢰
참고
분자량
RDKit(결정적)
매우 높다
수식에서 잘라내기
TPSA, HBD/HBA
RDKit(결정적)
높다
규칙 기반
logP(계산됨)
RDKit 모델
중간 높이
실험에서 벗어날 수 있음
로그(해상도)
QSAR 추정치
중간
적용 분야에 따라 다름
pKa
특수 모델
중간
복잡한 구조로 되어있습니다
생물학적 활동
QSAR/ML
변수
반드시 테스트하고 검증하세요.
미니 케이스
사례 1 - 장착된 해상도 수. 한 학생이 AI에게 화합물의 용해도에 관해 질문했습니다. 그는 "25mg/mL"라는 답을 받고 이에 따라 실험 설계를 설정했습니다. 측정의 실제 값은 ~2mg/mL로 10배 차이가 났습니다. AI가 숫자를 만들어낸 것이다. 교훈: 해상도와 같은 속성을 언어 모델의 숫자로 취하지 마세요. 정성적 예측 + 측정.
사례 2 — 적용 범위를 벗어났습니다. QSAR 모델은 훈련 세트와 매우 다른 대형 거대분자에 대해 "활성도가 높다"고 말했습니다. 사용자는 분자가 훈련 데이터와 유사하지 않다는 것을 알아차렸고 예측이 신뢰할 수 없다고 생각했습니다. 실험에서는 활동성이 매우 낮았습니다. 교훈: 모델은 항상 반응합니다. 범위를 벗어나면 답변이 가치가 없습니다.
사례 3 - Lipinski의 올바른 사용. 하나의 후보 분자에 대해 AI는 RDKit: MA 512(>500, 경계선), logP 4.8(좋음), HBD 2, HBA 7의 값으로 Lipinski를 평가했습니다. 사용자는 "하나의 기준은 남아 있지만 규칙은 절대적이지 않습니다"라고 올바르게 해석했으며 분자를 완전히 제거하지 않았습니다. 교훈: 규칙은 기준이 아니라 지침입니다. 맥락에 맞게 해석하세요.
일반적인 실수
- 언어 모델에서 기능 수를 가져옵니다. 계산되지 않은 값은 조작된 것입니다. 불확실성이 있는 결정론적 도구나 모델을 사용합니다.
- 적용 분야를 무시합니다. 이 모델은 각 분자에 대한 숫자를 생성합니다. 현장 밖에서는 신뢰할 수 없습니다.
- 추정 측정을 고려합니다. logS는 추정치입니다. 이는 실험적 해결 방법을 대체할 수 없습니다.
- Lipinski를 절대적인 규칙으로 간주합니다. 국경에 있는 후보자는 자동으로 제거되지 않습니다. 많은 약물이 규칙을 위반합니다.
- '계산된'과 '추정된'을 혼동합니다. TPSA가 계산되고(신뢰할 수 있음) 활동이 추정됩니다(불확실함).
주의: 기능 예측은 후보의 순위를 매기고 우선순위를 지정하는 데 유용합니다. 그러나 혼자서 결정을 내리는 것은 아닙니다. "모델이 가용성이라고 말했다"는 가설입니다. "측정해보니 녹아요"라는 결과가 나왔습니다.
요약하면
- 실험 전에 분자 특성을 예측할 수 있어 많은 시간을 절약할 수 있습니다.
- 일부 기능은 결정적으로 계산되며(MA, TPSA, HBD/HBA), 일부 기능은 통계적 추정치(logS, 활동)입니다.
- 적용 가능성 영역은 가장 중요한 개념입니다. 모델은 항상 응답하지만 영역 외부에서는 신뢰할 수 없습니다.
- 언어 모델이 아닌 RDKit 또는 모호성 모델에서 기능 개수를 가져옵니다.
- 예측을 사용하여 후보자 순위를 매깁니다. 실험을 통해 최종 결정을 내리십시오.
응용과제
5개의 분자(예: 약물 시리즈)를 선택합니다. RDKit을 사용하여 각각에 대한 MA, logP, TPSA, HBD, HBA를 계산하고 Lipinski를 평가합니다. 별도로 각 분자의 용해도에 대한 정성적 추정(숫자가 아님)과 적용 가능성 경고 분야를 AI에 요청하세요. 결정론적 값과 AI 예측을 테이블로 수집합니다. 가장 약물과 유사한 프로필을 제공하는 분자는 무엇입니까? 불확실성이 가장 높은 곳은 어디입니까?
체크리스트
- [ ] 나는 결정론적 계산 속성과 예측 속성을 구별합니다.
- [ ] 언어 모델이 아닌 RDKit/모델에서 속성 값을 가져옵니다.
- [ ] 적용 범위를 벗어난 분자를 발견했습니다.
- [ ] 저는 Lipinski를 절대적인 규칙이 아닌 가이드로 사용합니다.
- [ ] 나는 순위 결정을 위해 예측을 사용하고 실험을 위해 결정을 사용합니다.
- [ ] 측정을 통해 중요한 기능을 확인할 계획이 있습니다.