Einheit 1 / 11

Künstliche Intelligenz im ML-Engineering: Rolle, Grenzen, Validierung und Verantwortung

Gewinne:

  • Wir können unterscheiden, wo im ML-Workflow (Code, Daten, Dokument) künstliche Intelligenz bei geringem Risiko Zeit spart und wo Entscheidungen wie Metrik/Daten/Inbetriebnahme dem Menschen überlassen werden, je nach Risikostufe der Aufgabe.
  • Fähigkeit, eine Disziplin anzuwenden, die jede KI-Ausgabe überprüft, indem sie sie mit der Quelle verbindet, erneut ausführt, misst und durch einen technischen Filter leitet.
  • Fähigkeit, sich anzueignen, keine rohen vertraulichen und persönlichen Daten an externe Tools zu senden, vom Unternehmen genehmigte Tools zu verwenden und Sicherheitsprobleme nur zu Verteidigungszwecken zu behandeln.

Künstliche Intelligenz in der maschinellen Lerntechnik: Rolle, Grenzen, Validierung und Verantwortung

Ein Ingenieur für maschinelles Lernen (ML-Ingenieur: ein Softwareprofi, der aus Daten lernende Modelle entwirft, trainiert und in die Produktion bringt) arbeitet heute in jedem Schritt seiner Arbeit mit einem anderen Werkzeug der künstlichen Intelligenz. Beim Schreiben von Code kommt ein Codierungsassistent zum Einsatz, beim Erkunden von Daten ein Konversationsmodell und beim Erstellen von Dokumentationen ein großes Sprachmodell (LLM: ein neuronales Netzwerk mit Milliarden von Parametern, das Text versteht und produziert). Dieses Modul betrachtet künstliche Intelligenz sowohl als das entwickelte Produkt als auch als tägliches Arbeitswerkzeug eines ML-Ingenieurs. Dabei werden die Grenzen der Verantwortung klar abgegrenzt, ohne die beiden Rollen zu vermischen.

In dieser ersten Einheit beantworten wir die grundlegende Frage: Wo im ML-Engineering spart künstliche Intelligenz Echtzeit und wo müssen wir die Entscheidung dem Menschen überlassen? Die Antwort liegt im Herzen der Ingenieursdisziplin: Wer macht, ist schnell, wer prüft, ist verantwortlich.

Wo kommt künstliche Intelligenz im ML-Engineering zum Einsatz?

Ein ML-Projekt durchläuft ungefähr die folgenden Bereiche: Datenerfassung, Datenbereinigung, Feature Engineering (Übersetzung von Rohdaten in digitale Signale, die das Modell verstehen kann), Modelltraining, Bewertung, Bereitstellung (Bereitstellung: Öffnen des Modells für den realen Benutzer) und Überwachung. KI hilft an jeder Haltestelle dieser Linie, ihr Grad an Autorität ist jedoch unterschiedlich.

Bereiche mit hoher Belohnung und geringem Risiko: Erstellen eines Code-Skeletts, Entwurf einer Datentransformationsfunktion, Interpretieren von Protokollnachrichten, Beschreiben eines Stack-Trace, Zusammenfassen von Experimentnotizen, Schreiben von Dokumentation und READMEs, Vorschlagen eines Testfalls. Hier sind die Fehler der künstlichen Intelligenz billig; denn die Ausgabe wird bereits getestet und überprüft.

Bereiche mit hohem Risiko: Entscheidung, welche Daten in das Training einfließen, Bestätigung, ob ein Modell in Produktion gehen soll, Beurteilung einer Metrik als „gut genug“, Entscheidung zur Verarbeitung personenbezogener Daten, Schließen einer Sicherheitslücke als „Junk“. Diese wirken sich auf Geld, Privatsphäre, rechtliche Haftung und das Vertrauen der Benutzer aus. Künstliche Intelligenz gibt hier Anregungen; Die Entscheidung treffen der zuständige Ingenieur und das verantwortliche Team.

Tipp: Bevor Sie eine Aufgabe an KI auslagern, fragen Sie: „Wie hoch sind die Kosten, wenn diese Ausgabe falsch ist, und wie leicht wird jemand den Fehler bemerken?“ Wenn der Preis niedrig ist und die Erfassung einfach ist, geben Sie es weiter. Wenn der Preis hoch ist oder die Erfassung schwierig ist, verwenden Sie KI nur für den Entwurf und Sie entscheiden.

Überprüfungsdisziplin: drei Schritte

In der ML-Technik ist die KI-Ausgabe niemals eine „fertige Arbeit“; Es handelt sich um einen Entwurf. Führen Sie jede Ausgabe durch diese drei Schritte aus:

  1. Verbinden Sie es mit der Quelle. Wenn das Modell eine Zahl, einen Schwellenwert oder eine „Best Practice“ angibt, basieren Sie es auf der offiziellen Dokumentation, dem tatsächlichen Wert in der Codebasis oder einer gemessenen Metrik. Am häufigsten wird hier die „Anpassung des Modells“ (Halluzination: die selbstbewusste Produktion nicht-realer Informationen durch das Sprachmodell) erfasst.
  2. Neu starten und messen. Führen Sie den generierten Code aus, berechnen Sie die von ihm erzeugte Metrik in Ihrem eigenen Testsatz neu und validieren Sie die vorgeschlagene SQL-Abfrage anhand einer kleinen Stichprobe. Code, der nicht funktioniert, ist wertlos, auch wenn er gut aussieht.
  3. Führen Sie es durch einen technischen Filter. Hält die Ausgabe der Skalierung stand? Wurden Grenzfälle (leere Daten, sehr große Eingabe, fehlende Felder) berücksichtigt? Liegt eine Sicherheits- und Datenschutzverletzung vor? Nur eine Person, die sich auf dem Gebiet auskennt, kann diesen Schritt durchführen.

Schwache Eingabeaufforderung / Starke Eingabeaufforderung

Schwache Aufforderung: „Schreiben Sie mir einen Code für das Modelltraining.“

Leistungsstarke Eingabeaufforderung: „Schreiben Sie ein Trainingsskript für die binäre Klassifizierung mit scikit-learn. Eingabe: data/train.parquet, Zielspalte is_churn. Es liegt ein Klassenungleichgewicht vor (positive Rate ~8 %), behandeln Sie es mit class_weight. Verwenden Sie PR-AUC (Fläche unter der Precision-Recall-Kurve) als Bewertungsmetrik, da die Genauigkeit bei unausgeglichenen Daten irreführend ist. Fixieren Sie den Zufallsstartwert auf 42. Testen Sie am Ende des Codes den Drucksatz PR-AUC.“

Unterschied: Die zweite Eingabeaufforderungsaufgabe enthält die Datenwahrheit, die korrekte Metrik, Informationen zum Ungleichgewicht und die Wiederholbarkeitsanforderung. In diesem Kontext ist die Ausgabe überprüfbar und nutzbar.

Datenschutz und Datensicherheit: die erste Verantwortung des Ingenieurs

Der ML-Ingenieur berührt oft die sensibelsten Daten des Unternehmens: Kundendaten, Transaktionshistorie, Gesundheits- oder Finanzdaten, Protokolle von Produktionssystemen. Drei Regeln bei der Weitergabe von Daten an Tools der künstlichen Intelligenz:

  • Senden Sie keine persönlichen und vertraulichen Rohdaten an externe Tools. Anstatt beispielsweise Kunden-E-Mails in die Eingabeaufforderung einzufügen, senden Sie das Schema und Dummy-Beispiele (synthetische Beispiele). Verwenden Sie maskierte Beispiele wie „ex: ahmet@example.com“ anstelle echter Daten.
  • Verwenden Sie vom Unternehmen zugelassene Fahrzeuge. Wählen Sie Tools, bei denen vertraglich klar ist, wo die Daten verarbeitet werden, ob sie gespeichert werden, ob sie für Bildungszwecke verwendet werden oder nicht. Die Verarbeitung von Unternehmensdaten mit einem persönlichen Konto stellt in den meisten Unternehmen einen Verstoß dar.
  • Mindestdatenrichtlinie. Geben Sie den Mindestkontext an, der zur Lösung der Aufgabe erforderlich ist. Nicht die gesamte Tabelle, sondern die relevanten 5 Spalten und das Schema.
Achtung: Gehen Sie davon aus, dass der Text, den Sie einem Sprachmodell zuweisen, nicht rückgängig gemacht werden kann. Senden Sie keine rohen persönlichen Daten mit dem Gedanken „Ich lösche sie später“; Das Risiko trat in dem Moment ein, in dem es verschickt wurde.

Defensiver Einsatz im Sicherheitsbereich

ML-Ingenieure installieren häufig Sicherheitssysteme: Betrugserkennung, Klassifizierung böswilligen Datenverkehrs, Authentifizierung. In diesem Modul behandeln wir Sicherheitsthemen ausschließlich zu Verteidigungszwecken: Erkennen des Angriffs, Absichern des Systems, Schließen der Schwachstelle. Der Einsatz künstlicher Intelligenz für unbefugten Zugriff, Datenverlust oder unbefugten Eingriff in das System eines anderen ist sowohl illegal als auch gegen die Berufsethik. Wenn Sie eine Schwachstelle entdecken, besteht der richtige Weg darin, diese verantwortungsvoll zu melden und zu beheben; nicht ausnutzen.

drei Mini-Koffer

Fall 1 – Zeitersparnis. Ein ML-Ingenieur würde normalerweise einen halben Tag mit der explorativen Datenanalyse (EDA) eines 40-Spalten-Datensatzes verbringen. Er gab die Schema- und df.describe()-Ausgabe an die künstliche Intelligenz weiter und fragte: „Welche Spalten weisen eine hohe Ausreißer- und Fehlquote auf, welche Transformationen empfehlen Sie?“ Innerhalb von 20 Minuten erhielt er eine priorisierte Liste, in der jedes Element mit einem eigenen Code verifiziert wurde. Einsparung: ~3 Stunden, geringes Fehlerrisiko, da jeder Anspruch gemessen wird.

Fall 2 – Abgefangener Fehler. „Die Trainingsgenauigkeit beträgt 99 %, großartig“, ließ das Model einen Chat-Assistenten sagen. Der Ingenieur wandte den dritten Schritt (Engineering-Filter) an und stellte fest: In der Zielspalte wurden versehentlich Attribute verloren (Datenleck: Das Modell sieht Informationen, die es im Training nicht sehen sollte). Die tatsächliche Leistung war viel geringer. Die Skepsis des Ingenieurs, nicht die „großartige“ Interpretation der KI, hat den Job gerettet.

Fall 3 – Verhinderung von Datenschutzverletzungen. Ein Team fügte die Produktionsfehlerprotokolle in ein externes Modell ein und sagte: „Diesen Fehler beheben“. In den Protokollen befanden sich Kundenidentifikationsnummern. Das Team hat sich zur Regel gemacht, ein kleines Skript zu schreiben, das die Protokolle zuerst maskiert (ihre ID-Nummern durch *** ersetzt) ​​und sie dann auf diese Weise sendet. Das Risiko eines Verstoßes ist verschwunden, die Geschwindigkeit der Hilfeleistung hat sich nicht verändert.

Kopierbare Vorlagen

Aufgabe: [was zu tun ist, einzelner Satz]Kontext: [Datenschema, Größe, Einschränkungen; KEINE TATSÄCHLICHEN personenbezogenen Daten]Einschränkungen: [Sprache/Bibliothek, Leistung, Reproduzierbarkeit]Metriken: [wie man den Erfolg misst]Gewünschte Ausgabe: [Code/Beschreibung/Liste] und warum in diesem Format

Schauen Sie sich diesen Code an. Bewerten Sie nicht nur, ob es funktioniert, sondern auch im Hinblick auf: 1) Grenzfälle (leere Eingabe, fehlende Spalte, sehr große Datenmenge) 2) Risiko von Datenlecks 3) Reproduzierbarkeit (Seed, Version) Schlagen Sie Korrekturen für jedes Problem vor, das Sie finden. Markieren Sie „bestätigen“, wenn Sie sich nicht sicher sind. Code: [Code]

Interpretieren Sie das Ergebnis dieser Metrik, aber fragen Sie zuerst: Ist diese Metrik für dieses Problem korrekt?Problem: [ausgeglichene/unausgeglichene Klassifizierung, Regression, Ranking...]Gemeldete Metrik und Wert: [z. B. Genauigkeit 0,99]Welche Metrik würden Sie empfehlen und warum und auf welche Anzeichen sollte ich achten, die mich am aktuellen Ergebnis zweifeln lassen?

Überprüfen Sie, ob in den Daten, die ich an die folgende Eingabeaufforderung weitergebe, personenbezogene/vertrauliche Informationen enthalten sind. Listen Sie die Felder (Name, E-Mail, ID-Nummer, Telefonnummer, Adresse) auf, die im folgenden Text maskiert werden müssen. Text: [Text]

Rollen- und Autoritätstabelle

Suche

Die Rolle der künstlichen Intelligenz

Inhaber der Entscheidung

Code-Skelett-/Transformationsfunktion

Zuggenerator

Ingenieur (Bewertungen)

EDA / Datenzusammenfassung

Beschleuniger

Ingenieur (überprüft durch Messung)

Metrische Interpretation

Vorschlag

Ingenieur

Welche Daten fließen in das Training ein?

Vorschlag

Team + Dateneigentümer

Nehmen Sie das Modell in Produktion

Erinnerung an die Checkliste

Verantwortlicher Ingenieur + Team

Verarbeitung personenbezogener Daten

Keine (nicht verwendet)

Rechtlicher + Datenverantwortlicher

Häufige Fehler

  • Verwenden der Ausgabe ohne Validierung. Der häufigste und teuerste Fehler. Code oder Metrik, die gut aussehen, bedeuten nicht, dass sie korrekt sind.
  • Einfügen vertraulicher Rohdaten in das Tool. Nach dem Absenden ist eine Rücknahme nicht möglich.
  • Sich auf die falsche Metrik verlassen. Inkompatible Metriken wie Genauigkeit bei unausgeglichenen Daten und RMSE bei Rankingproblemen sind irreführend.
  • Künstliche Intelligenz als Entscheidungsträger verwechseln. Er gibt Vorschläge; Die Verantwortung liegt beim Unterzeichner.
  • Kontextlose Eingabeaufforderung. Mehrdeutige Anfragen wie „Schreibe ein Modell“ führen zu einer nicht überprüfbaren Ausgabe.

Zusammenfassend

Künstliche Intelligenz ist sowohl das vom ML-Ingenieur entwickelte Produkt als auch sein täglicher Replikator. Sein Wert ist bei risikoarmen, leicht zu überprüfenden Aufgaben wie Code-Daten-Dokument am höchsten; Entscheidungen, die Geld, Privatsphäre und Sicherheit betreffen, verbleiben bei der Person. Verbinden Sie jeden Ausgang mit der Quelle, messen Sie erneut und passieren Sie den technischen Filter. Schützen Sie vertrauliche Daten, verwenden Sie zugelassene Fahrzeuge und arbeiten Sie im Sicherheitsbereich nur zu Verteidigungszwecken. Diese Disziplin ist die Grundlage für alle weiteren Einheiten.

Anwendungsaufgabe

Wählen Sie eine Aufgabe aus Ihrem eigenen Projekt (z. B. das Schreiben einer Datenbereinigungsfunktion). Schreiben Sie zunächst eine schwache Aufforderung und dann eine starke Aufforderung unter Verwendung der Vorlage in dieser Einheit. Nehmen Sie beide Ausgaben und wenden Sie eine dreistufige Überprüfung an (Link zur Quelle, erneute Ausführung, technischer Filter). Beachten Sie, welche Eingabeaufforderung wie viele Minuten und wie viele Korrekturen spart.

Checkliste

  • [ ] Ich habe den Risikograd (niedrig/hoch) meiner Aufgabe ermittelt.
  • [ ] Ich habe in der Eingabeaufforderung keine tatsächlichen persönlichen/vertraulichen Daten angegeben; Ich habe es maskiert oder eine synthetische Probe verwendet.
  • [ ] Ich habe die Ausgabe mit der Quelle verbunden, sie erneut ausgeführt und aus technischer Sicht gefiltert.
  • [ ] Ich habe überprüft, ob ich die richtige Metrik ausgewählt habe.
  • [ ] Die entscheidende Entscheidung (Produktion, Datenverarbeitung) habe ich selbst/mit dem Team getroffen, ich habe sie nicht der künstlichen Intelligenz überlassen.
  • [ ] Ich habe ein vom Unternehmen zugelassenes Fahrzeug verwendet.