Eenheid 3 / 12

Functievoorspelling en structuur-proces-eigenschaprelaties (machine learning)

Winst:

  • Mogelijkheid om het machine learning-probleem nauwkeurig te construeren met AI voor het voorspellen van mechanische eigenschappen op basis van samenstelling en procesparameters
  • Vermogen om de output van een model kritisch te lezen door risico's van gegevenskwaliteit, overfitting en extrapolatie te herkennen
  • Mogelijkheid om de resultaten van voorspellingsmodellen te testen met fysieke plausibiliteit, betrouwbaarheidsinterval en verificatie-experiment

De meest fundamentele wet van de metallurgie kan worden samengevat als 'het proces bepaalt de structuur; de structuur bepaalt de eigenschap'. De vloeigrens van staal hangt niet alleen af ​​van de samenstelling; Het komt voort uit de manier waarop het wordt verwerkt (smeden, walsen, warmtebehandeling) en de resulterende microstructuur (korrelgrootte, faseverhouding, neerslag). Kunstmatige intelligentie, en vooral machinaal leren (ML: methoden die leren en voorspellingen doen op basis van patronen in gegevens), zijn krachtig in het extraheren van deze relaties tussen samenstelling, proces en eigenschap uit duizenden datapunten en in het voorspellen van de eigenschappen van een nieuwe legering. Maar deze kracht is volledig afhankelijk van de datakwaliteit en het weten waar het model betrouwbaar is. In dit onderdeel leert u hoe u op ML gebaseerde functievoorspellingen kunt maken en hoe u de uitvoer ervan kritisch kunt lezen.

Het machine learning-probleem correct instellen

Voordat u een functievoorspellingsprobleem in ML dumpt, moet u drie dingen duidelijk maken:

  • Invoer (attributen): variabelen die bij voorspelling moeten worden gebruikt. Bijvoorbeeld samenstellingspercentages (C, Mn, Cr, Ni...), temperatuur en tijd van de warmtebehandeling, korrelgrootte.
  • Output (doel): het kenmerk dat moet worden voorspeld. Bijvoorbeeld vloeigrens, rek, hardheid.
  • Gegevens: een tabel met invoer-uitvoerparen. Elke rij is een voorbeeld, elke kolom is een attribuut of doel.

Het model leert een ‘functie’ uit deze gegevens: het neemt input en voorspelt de output. Methoden zoals lineaire regressie (eenvoudige gewogen som), willekeurige bos- of gradiëntversterking zijn gebruikelijk. AI helpt bij het suggereren welke methode geschikt is, het schrijven van de code en het interpreteren van het resultaat; maar je controleert of het model geldig is of niet.

Gegevenskwaliteit: plafond van het model

Een ML-model kan niet beter zijn dan de gegevens waarop het is getraind. Het principe van ‘garbage in, garbage out’ is zeer sterk in de metallurgie, omdat testgegevens duur en schaars zijn. Pas op voor deze vallen:

  • Weinig gegevens: je kunt geen complexe modellen bouwen met 30 voorbeelden; Het model onthoudt de gegevens.
  • Onevenwichtige gegevens: Als de meeste gegevens betrekking hebben op staal met een laag koolstofgehalte, zal de voorspelling slecht zijn voor een legering met een hoog koolstofgehalte.
  • Meetruis: De hardheid van hetzelfde monster kan variëren bij verschillende operators; Deze ruis wordt weerspiegeld in het model.
  • Ontbrekende variabele: Als je de korrelgrootte niet hebt gemeten, zal het model dat de sterkte probeert te voorspellen op basis van alleen de samenstelling een belangrijke reden over het hoofd zien.
Let op: het feit dat een model veel succes heeft in trainingsgegevens betekent niet dat het ook succesvol zal zijn in nieuwe steekproeven. Dit kan overfitting zijn: het model heeft de ruis in de trainingsgegevens onthouden, niet de werkelijke relatie. Echt succes wordt gemeten op basis van ‘testgegevens’ die het model nog nooit eerder heeft gezien.

Extrapolatie: de gevaarlijkste limiet

ML-modellen werken redelijk binnen het bereik dat door de trainingsgegevens wordt gedekt (interpolatie). Buiten dit bereik (extrapolatie) worden voorspellingen onbetrouwbaar en het model laat dit vaak niet zien; blijft een betrouwbaar aantal opleveren. Een model dat bijvoorbeeld is getraind op staalsoorten met een koolstofgehalte tussen 0,2 en 0,6% kan de waarde voor een legering met 1,2% koolstof als 'veilig' aantonen, maar deze waarde is volkomen ongegrond. Voor elke voorspelling: “valt dit voorbeeld binnen de distributie van trainingsgegevens?” Het is absoluut noodzakelijk om de vraag te stellen.

Stap voor stap: een voorspellingsstroom opbouwen met AI

  1. Definieer het doel en de input: wat ga je voorspellen en op basis van welke variabelen?
  2. Bereid de gegevens voor: reinig, repareer eenheden, markeer ontbrekende waarden. (AI: schrijft Python-code.)
  3. Splits de gegevens: Scheid de trainings- en testsets zodat u het succes nauwkeurig kunt meten.
  4. Model selecteren en trainen: Begin eenvoudig (lineair), ga indien nodig over op boomgebaseerd.
  5. Evalueer: Bekijk de foutstatistieken op de testset (bijvoorbeeld RMSE, R²).
  6. Commentaar: Welke variabele is hoe effectief? Heeft het fysiek zin?
  7. Verifiëren: Test een kritische voorspelling met daadwerkelijke experimenten; Controleer op extrapolatie.

concept

Betekenis

Waarom is het belangrijk in de metallurgie?

Overfitting

Model dat het geluid onthoudt

Het is heel eenvoudig met weinig testgegevens

interpolatie

Voorspelling binnen trainingsbereik

Relatief veilige regio

extrapolatie

Voorspelling buiten trainingsbereik

onbetrouwbaar; experimenteren is vereist

Aandeel van de variantie verklaard door het model

Indicator voor pasvormkwaliteit

Functiebelang

De omvang van de impact van een input

Fysieke redelijkheidscontrole

drie minikoffers

Geval 1 – Model voor het onthouden. Een team bouwt een complex model dat de vloeigrens voorspelt met 45 staalmonsters; De trainingsgegevens blijken R² = 0,99 te zijn en ze zijn blij. In de testgegevens daalt het echter naar R² = 0,42. Het model is overfit. Wanneer ze overstappen naar een eenvoudiger model en de data vergroten, neemt het testsucces toe tot 0,80. Les: succes in het onderwijs is misleidend; De beslissing wordt genomen op basis van testgegevens.

Geval 2 — Extrapolatieval. Een ingenieur past een model toe dat is getraind op laaggelegeerde staalsoorten op een roestvrije samenstelling met een hoog Cr-gehalte. Het model zegt "ongeveer 620 MPa." De daadwerkelijke trekproef komt uit op 410 MPa. De compositie valt volledig buiten de educatieve distributie. Les: vóór het voorspellen is het absoluut noodzakelijk om te controleren of de invoer binnen het trainingsbereik ligt.

Geval 3 — Correct gebruik. Een R&D-team modelleert het effect van de tempertemperatuur op de hardheid met duizenden records in een familie van legeringen. Het model reproduceert de bekende fysieke trend (de hardheid neemt af bij toenemende ontlaattemperatuur) en beperkt het bereik van de samenstelling waarin de beoogde hardheid zal worden bereikt. Het team gebruikt het model om het aantal experimenten terug te dringen: het doel bereiken met 8 experimenten in plaats van 40 en elke stap valideren met metingen. Les: ML beperkt de planning van experimenten op intelligente wijze met goede gegevens en fysieke plausibiliteitscontroles.

Kopieerbare promptsjablonen

ML PROBLEM SETTING SJABLOON "Rol: U bent een assistent op het gebied van de materiaalgegevenswetenschap. Doel: [functie moet worden voorspeld]. Invoer: [attributen]. Ik heb [n] voorbeelden. Voor dit probleem: (1) passende eenvoudige en geavanceerde modelopties voorstellen, (2) de trainings-/testsplitsing en evaluatiemetriek uitleggen, (3) de risico's van overfitting en extrapolatie interpreteren op basis van deze gegevens. Beloof geen definitief succes; schrijf de grenzen duidelijk op."

GEGEVENSKWALITEIT-AUDIT-SJABLOON"Controleer de kwaliteit van de volgende gegevenstabel: [plak kolommen en voorbeeldrijen]. Vlag: ontbrekende waarden, uitschieters, eenheidsinconsistenties, onevenwichtige verdeling. Geef voor elk probleem aan hoe ermee om te gaan. Geef aan welke controles ik moet doen voordat ik ga modelleren."

EXTRAPOLATIE-CONTROLESJABLOON "Het min-max bereik van elke invoer in mijn trainingsopbrengst is: [schrijfbereiken]. Het nieuwe voorbeeld dat ik wil voorspellen is: [schrijfwaarden]. Ligt dit monster binnen of buiten het trainingsbereik in elk attribuut? Als het buiten het trainingsbereik ligt, leg dan uit in welke variabelen en waarom de voorspelling onbetrouwbaar zou zijn. Stel verificatie door experiment voor."

FYSIEKE plausibiliteit SJABLOON "De volgorde waarin de kenmerken van het model belangrijk zijn, is [soort]. Komt deze volgorde overeen met bekende metallurgische relaties (bijv. Hall-Petch, verharding van neerslag, koolstofeffect)? Als er een fysiek onverwacht effect is, markeer dit dan en verklaar het mogelijke gegevens-/modelprobleem."

Zwakke prompt/sterke prompt

ZWAKKE PROMPT: "Voorspel de vloeigrens op basis van deze samenstelling."

STERKE VRAAG: "Rol: Jij bent de materiaalgegevenswetenschapsassistent. Ik heb 800 regels met gegevens over laaggelegeerd staal (C, Mn, Cr, Ni, ontlaattemperatuur -> rekgrens). Nieuw monster: C=0,38, Mn=0,8, Cr=1,0, Ni=0,2, temper = 550 °C. Controleer eerst of dit monster binnen het trainingsbereik ligt. Pas indien nodig de voorspellingsaanpak en onzekerheid aan. Leg uit; indien niet geschikt, stel voor experiment. Controleer de fysieke plausibiliteit met Hall-Petch en het temperatuureffect. Geef geen exacte waarde op één punt.

De sterke prompt vraagt om een extrapolatiecontrole voordat een voorspelling wordt gedaan, neemt de onzekerheid weg en toetst het resultaat aan natuurwetten. Dit geeft een veel betrouwbaardere beslissingsbasis dan een ruw getal.

Veel voorkomende fouten

  • Succes in het onderwijs verwarren met echt succes (overfitting overslaan).
  • Het model evalueren zonder een training/test-splitsing uit te voeren.
  • Het als veilig accepteren van de schatting die in het extrapolatiegebied is gemaakt.
  • Complexe modellen bouwen met weinig en onevenwichtige data.
  • Het belang van kenmerken niet vergelijken met fysieke plausibiliteit.
  • Een kritische inschatting in het ontwerp plaatsen zonder het door middel van experimenten te verifiëren.

Samengevat

Machine learning legt op krachtige wijze de relaties tussen compositie, proces en eigenschap vast met goede gegevens en beperkt de planning van experimenten op intelligente wijze. Maar een model is slechts zo goed als zijn gegevens; De trainingsprestaties kunnen misleidend zijn (overfitting) en schattingen buiten het trainingsbereik (extrapolatie) zijn onbetrouwbaar. Test elke voorspelling met het succes van testgegevens, extrapolatiecontrole, fysieke plausibiliteit en, in kritieke gevallen, daadwerkelijke experimenten.

Applicatie taak

Definieer een eigenschapsvoorspellingsprobleem met een bestaande (of fictieve) materiële gegevensset: noteer het doel en de invoer. Vraag om een ​​aanpak van AI met de template “ML PROBLEM FIGURE”. Definieer vervolgens een "nieuw monster" en controleer met het sjabloon "EXTRAPOLATIE CHECK" of dit monster binnen het trainingsbereik ligt. Beschrijf ten slotte in een paragraaf met welk experiment je een uitkomst van het model gaat verifiëren.

controlelijst

  • [ ] Ik heb het doel en de input duidelijk gedefinieerd.
  • [ ] Ik heb de gegevenskwaliteit gecontroleerd (ontbrekend, uitschieter, eenheid, balans).
  • [ ] Ik heb eerlijk succes gemeten met de training/test-splitsing.
  • [ ] Voor elke schatting heb ik het extrapolatierisico gecontroleerd.
  • [ ] Ik vergeleek het belang van kenmerken met fysieke plausibiliteit.
  • [ ] Ik heb een plan gemaakt om de kritische voorspelling te verifiëren met daadwerkelijke experimenten.