Единици
1. Вовед во вештачката интелигенција во хемијата: улоги, граници, валидација и етика 2. Молекуларна претстава и хемиска структура: валидација со SMILES, InChI и RDKit 3. Предвидување и механизам на реакции: Предвидување на производот, состојбата и несаканите реакции 4. Поддршка за интерпретација на спектарот: NMR, IR и масовна спектрометрија 5. Преглед на литература и планирање на синтезата: извор, процедура и патоказ 6. Хемиска анализа на податоци и Пајтон: панди, стехиометрија и калибрација 7. Предвидување на молекуларни својства и QSAR: Резолуција, pKa и граници на моделот 8. Лабораториска документација: тетратка за експеримент, ELN и репродуктивност 9. Проценка на безбедност и опасност: GHS, SDS и границите на вештачката интелигенција 10. Потврда, халуцинација и научен интегритет 11. Човек во експериментот: етика, приватност, одговорност и работен тек од крај до крај
Единица 6 / 11

Хемиска анализа на податоци и Пајтон: панди, стехиометрија и калибрација

Добивки:

  • Способност да се засноваат нумерички резултати на извршен код на Python наместо вербално погодување на јазичниот модел
  • Способност да се напише стехиометрија, калибрација и код за чистење на податоците на вештачката интелигенција и да се тестира со примероци со познати одговори
  • Способност да се спречат грешките во анализата на податоците со секогаш специфицирање на единиците и проверка на нивниот редослед

Хемијата е полна со бројки: мерење, волумени, вредности на апсорпција, приноси, концентрации. Рачното обработување на овие податоци е бавно и склоно кон грешки. Вештачката интелигенција обезбедува две главни услуги овде: (1) пишува Python код кој ги обработува податоците, (2) го извршува тој код (во средина што може да го изврши кодот) и дава детерминистички резултат. Критичкиот принцип е ова: препуштете ја пресметката на излезот од извршениот код, а не на „вербалното предвидување“ на јазичниот модел. Јазичен модел "Што е 142 × 0,05?" понекогаш може погрешно да одговори на прашањето; но линијата Python што ја пишува секогаш правилно пресметува. Во оваа единица, ќе научиме анализа на хемиски податоци со вештачка интелигенција со оваа филозофија.

Зошто кодот е подобар од вербалното погодување?

Јазичниот модел прави аритметика со „предвидување на можниот исход“; па може да биде погрешно со големи броеви или пресметување со повеќе чекори. Додека во Python изразот 142 * 0,05 е детерминистички: секогаш враќа 7,1. Затоа, стратегија: немојте да ја натерате вештачката интелигенција да ја врши пресметката, испечатете го КОД на пресметката и стартувајте ја шифрата. Така, ја користите креативноста на вештачката интелигенција (градење на кодот) и ја оневозможувате несигурната страна (аритметика на главата).

Совет: Кога ќе добиете нумерички резултат од вештачка интелигенција, кажете „претстави го ова со линија на Python“. Самиот код ја потврдува сметката и ви овозможува да ја извршите и потврдите. Ако не гледате код, не му верувајте на бројот.

Типични задачи за анализа на податоци во хемијата

  • Стоихиометрија: мол, маса, ограничувачки реагенс, теоретски принос, пресметка на процентуален принос.
  • Концентрација: моларност, разредување (M1V1 = M2V2), конверзии ppm.
  • Калибрација: Исцртување на калибрациона линија со Beer-Lambert закон (апсорпција ∝ концентрација) и пресметување на непознатото.
  • Чистење податоци: читање мерни табели со панди, означување на оддалеченост, средна/стандардна девијација.
  • Визуелизација: цртање на калибрациона крива, кинетички график, крива на титрација.

Чекор по чекор: Безбедна анализа на податоци со вештачка интелигенција

  1. Дефинирајте податоци: Јасно дајте колони, единици, редици примероци. Ако нема единица, вештачката интелигенција прави претпоставки.
  2. Побарајте код, а не резултати: кажете „Напишете панди/NumPy код што го пресметува ова“.
  3. Извршете го кодот: извршете го сами или во средина што може да работи код.
  4. Тест со едноставни букви: Тестирајте го кодот со мал пример каде што го знаете одговорот.
  5. Проверка на единицата и редоследот: Дали единицата и големината на резултатот се физички разумни?
  6. Документ: Додајте го кодот и излезот во тетратката за експеримент (единица 8).

Четири шаблони за копирање

1) Стоихиометрија и процентуален принос:

Реакција: салицилна киселина (MA 138,12) + оцетна анхидрид -> аспирин (MA 180,16). Податоци: користени се 2,00 g салицилна киселина, вишок на оцетен анхидрид. променливи, испечатете го резултатот во единици.Не пресметувајте во глава; само дајте извршна шифра.

2) Калибрација на пиво-Ламберт:

Податоци за калибрација (концентрација mol/L -> апсорпција): 0,00->0,02, 0,02->0,21, 0,04->0,40, 0,06->0,62, 0,08->0,79. Непозната апсорпција на примерокот: 0,50. Задача: Изведете линеарна калибрација со numpy.polyfit, slope/intercept и Пресметајте R^2, најдете ја непознатата концентрација. Исцртај ги податоците + фит линијата со matplotlib.

3) табела за мерење со панди:

Имам CSV: колони = примерок, тежина_g, волумен_мЛ, апсорпција. Задача: читајте со панди, пресметајте ја концентрацијата (g/L) за секој примерок, означете ги редовите со апсорпција < 0 како неточни, дајте шифра за печатење на средната вредност и отстапувањето на стд на групите. Наведете ги единиците со линија за коментари.

4) Потврда на сметката за разредување:

Сакам да подготвам 100 мл раствор од 0,05 М од 0,5 М раствор. Задача: Напишете ја линијата Python која го пресметува потребниот волумен на акции со M1V1=M2V2. Испечатете го резултатот во mL и потврдете како коментар дека се очекува 10-кратно разредување за логичка проверка.

Слаб промпт / Силен промпт

Слаб:

Колку аспирин доаѓа од 2 грама салицилна киселина?

ВИ дава број од главата; Ако погрешно ги запомни молекуларните тежини, резултатот ќе биде искривен и како е пресметан нема да биде видлив.

Силно:

Претпоставете салицилна киселина MA=138,12, аспирин MA=180,16, маса=2,00 g, принос 100%.Задача: Напишете Python код кој ја пресметува теоретската маса на аспиринот; коментирајте го секој чекор (мол -> мол -> маса), испечатете го резултатот во г.

Разлика: дадени молекуларни тежини, баран код, коментирани чекори, специфицирана единица. Резултатот е и точен и може да се ревидира.

Вербално предвидување итн.извршен код

Големина

Јазичен модел вербално предвидување

Пајтон работи

Аритметичка точност

Променлива, може да се појави грешка

Детерминистички, сигурно

Ревизија

Спонтан абортус (не е јасно како излезе)

Високо (кодот е видлив)

повторливост

низок

високо

Следење на единицата

слаб

Може да се чува отворен во код

Правилна употреба

Идеја, градежна структура

Краен нумерички резултат

мини случаи

Случај 1 - Вербална аритметичка грешка. Студент прашува AI „0,0145 mol × 180,16 g/mol?“ праша тој; „2,72 g“, рече вештачката интелигенција. Всушност, тоа е 2,61 g. Кога ученикот рече „покажи го ова во Python“, YZ напиша 0,0145 * 180,16 и излезе како 2,612; Првиот вербален одговор беше неточен. Лекција: претпочитајте код дури и за многу едноставно множење.

Случај 2 — R² проверка при калибрација. Еден корисник направи калибрација на Beer-Lambert; Излегува R² = 0,981. Вештачката интелигенција рече „линеарно, доверливо“, но точката на најголема концентрација беше под линијата (заситеност). Кога корисникот го виде графикот, тој ја помести највисоката точка надвор од линеарниот опсег, R² се зголеми на 0,999. Лекција: само R² не е доволно; види остатоци/парцела.

Случај 3 - Конфузија на единицата. Во една анализа не беше јасно дали концентрацијата е mg/L или g/L; ВИ претпоставува g/L и резултатите беа 1000 пати погрешни. Тоа беше поправено кога корисникот експлицитно ја наведе единицата на колоната. Поука: секогаш менувајте ја единицата, под претпоставка дека вештачката интелигенција е скапа.

Вообичаени грешки

  • Потпирајќи се на вербален број. Секогаш барајте и стартувајте код наместо да правите ментална аритметика.
  • Не наведувајќи ја единицата. Мешањето mg/L со g/L, mL со L, предизвикува 1000-кратна грешка.
  • Не се тестира кодот. Примена на големи податоци без тестирање со мал пример каде одговорот е познат.
  • Сметајќи го R² како единствен критериум. Имајќи доверба во точките на нелинеарност без да ги гледате графички.
  • Прескокнете го реагенсот за тестирање. Пресметување на теоретски принос без определување на ограничувачкиот реагенс во стехиометријата.
  • Значаен чекор излевање. Пријавување на резултатот на 8 цифри кога мерењето е 3 значајни цифри.
Внимание: дури и кодот што го пишува AI може да е погрешен (погрешно име на колона, погрешна формула). Вклучувањето на кодот го прави резултатот детерминистички, но мора да потврдите со познат пример дека кодот ја пресметува вистинската работа.

Сумирано

  • Оставете ги нумеричките резултати на извршениот Python код, а не на вербалното погодување на јазичниот модел.
  • Вештачката интелигенција брзо пишува код за стехиометрија, калибрација, чистење на податоците и визуелизација во анализата на хемиските податоци.
  • Секогаш ставајте единици; Конфузијата на единицата е најскапата грешка.
  • Испитајте ги остатоците и графиконот покрај R² во калибрацијата.
  • Тестирајте го кодот со едноставен пример со познат одговор; Човекот ја потврдува точноста на кодот.

Задача за апликација

Имајте сет на податоци за калибрација или стехиометрија (ако не, користете ги податоците од Beer-Lambert погоре). Прашајте ја вештачката интелигенција за кодот на Python што ја прави анализата (шифрата, а не резултатот). Стартувај го кодот; потоа тестирајте го со мал примерок од познати одговори. Прашајте ја вештачката интелигенција вербално за истата пресметка и споредете ги двата резултати: дали има разлика? Толкувајте ја заплетот на R² и остаток во калибрацијата. Ставете го кодот, излезот и краткиот коментар во документ.

листа за проверка

  • [ ] Ги добивам нумеричките резултати од кодот, а не од вербалното погодување.
  • [ ] Јасно ја посочувам единицата на секоја колона со податоци.
  • [ ] Го тестирам кодот со мал примерок чиј одговор е познат.
  • [ ] Извршувам резидуална/графска анализа до R² при калибрација.
  • [ ] Го одредувам ограничувачкиот реагенс во стехиометријата.
  • [ ] Ги пријавувам резултатите со соодветната значајна цифра.