Einheit 11 / 11

Reproduzierbarkeit und das End-to-End-Projekt: Alles kombinieren

Gewinne:

  • Fähigkeit, die Reproduzierbarkeit mit vier Säulen (Seed-Fixierung, Datenversionierung, Medieneinfrieren, Experimentüberwachung) sicherzustellen und bei der Wiederholung desselben Laufs das gleiche Ergebnis zu erzielen
  • Möglichkeit, alle Stationen des Moduls (Metriken, Daten, Modell, LLM-Komponenten, Evaluierung, Fairness, Sicherheit, Verteilung, Überwachung) in einer End-to-End-Kette zu kombinieren
  • Fähigkeit, zu überprüfen, ob die entscheidende Entscheidung bei jedem Stopp beim Menschen verbleibt, und das Projekt auf überprüfbare Weise zu dokumentieren

Der heimtückischste Misserfolg eines ML-Projekts ist kein Absturz; „Ich bekomme nicht noch einmal das gleiche Ergebnis.“ Wenn Sie den Score des Modells, das Sie vor drei Monaten in Produktion genommen haben, heute nicht reproduzieren können, haben Sie dieses Modell nicht wirklich unter Kontrolle. In dieser Abschlusseinheit vertiefen wir die Reproduzierbarkeit: die Fähigkeit, mit den gleichen Eingaben zuverlässig das gleiche Ergebnis zu erzielen und das gesamte Modul in einer End-to-End-Projektdisziplin zu kombinieren.

Warum Reproduzierbarkeit schwierig ist

In gewöhnlicher Software liefert der gleiche Code die gleiche Ausgabe. In ML gibt es viele weitere Variablen, die das Ergebnis bestimmen:

  • Zufälligkeit: Datenmischung, Gewichtsinitialisierung, Datenaufteilung – alle basieren auf Zufälligkeit.
  • Daten: Derselbe Code erzeugt unterschiedliche Modelle mit unterschiedlichen Datenversionen.
  • Umgebung: Bibliotheksversionen, Hardware (CPU/GPU) und sogar das Betriebssystem können das Ergebnis verändern.
  • Versteckter Fall: Ein nicht gespeicherter Hyperparameter, ein manueller Vorverarbeitungsschritt, eine nicht notierte Auswahl.

Reproduzierbarkeit ist kein „nice to have“, sondern eine wissenschaftliche und technische Notwendigkeit. Ein Ergebnis, das nicht reproduziert werden kann, ist eine Behauptung, die nicht bewiesen werden kann.

Vier Säulen der Reproduzierbarkeit

1. Zufälligkeit beheben. Legen Sie alle Zufallsstartwerte an einem Ort fest: Datenaufteilung, Modellinitialisierung, Datenmischung. Der feste Seed ist die Grundlage für die Garantie „dasselbe Ergebnis, wenn Sie den gleichen Lauf wiederholen“.

2. Versionieren Sie die Daten. Notieren Sie, mit welcher Datenversion jedes Experiment durchgeführt wurde (Datenversionierung in Einheit 2). „Neueste Daten“ ist vage; „Datenversion v3, Hash abc123“ ist genau.

3. Das Medium einfrieren. Hängen Sie alle Abhängigkeiten an ihre genauen Versionen an (z. B. genaue Versionen wie numpy==1.26.4 in „requirements.txt“ oder ein Container-Image). Die „neueste Version“ wird eines Tages alles kaputt machen.

4. Verfolgen Sie alles (Experiment-Tracking). Für jedes Experiment automatisch speichern: Codeversion (Git Commit), Datenversion, alle Hyperparameter, Metriken und Ausgabestrukturen. Experiment-Tracking-Tools wie MLflow, Weights & Biases führen dies systematisch durch. Ohne Anmeldung bleibt die Frage „Welche Einstellung war die beste“ unbeantwortet.

Achtung: „Ich erinnere mich später“ ist der teuerste Trugschluss. Zwei Wochen später werden Sie sich nicht mehr erinnern, welchen Seed, welche Daten, welchen Hyperparameter Sie verwendet haben. Die automatische Nachverfolgung macht die Abhängigkeit vom Speicher überflüssig.

Schwacher Ansatz / Starker Ansatz

Schwach: „Ich habe das beste Modell gefunden, es ist auf dem Notebook, ich glaube, die Punktzahl lag bei 89 %.“

Strong: „Führen Sie #147 im Experiment-Tracking-Tool aus: git commit a3f9c, Datenversion v3 (Hash abc123), Seed 42, alle Hyperparameter registriert, testen Sie PR-AUC 0,887. Wenn ich denselben Befehl erneut ausführe, erhalte ich Stück für Stück das gleiche Ergebnis. Das Modell hängt von diesem Lauf in der Registrierung ab.“

Der Unterschied: Beim starken Ansatz basiert das Ergebnis nicht auf einer Erinnerung, sondern auf einer festen und überwachten Kette. Jeder kann jedes Mal das gleiche Ergebnis erzielen.

End-to-End-Projekt: Kombination von Modulen

Lassen Sie uns nun das gesamte Modul zu einem einzigen Projektablauf zusammenfassen. Ein echtes ML-System durchläuft diese Stopps, und jeder Stopp baut auf dem vorherigen auf:

  1. Problemdefinition: Was lösen wir, wie messen wir den Erfolg (Einheit 3: richtige Metrik, Geschäftskontext). Die Metrik und der Schwellenwert sind von Anfang an klar.
  2. Datenpipeline: Sammlung, Validierung, Bereinigung, leckagefreie Partitionierung, Versionierung (Einheit 2).
  3. Modellentwicklung: Training, Basislinienvergleich, Kreuzvalidierung, Hard Seed (Einheit 3 ​​+ diese Einheit).
  4. LLM-Komponenten (falls zutreffend): RAG (Einheit 4) und/oder Agenten (Einheit 5); Feinabstimmung bei Bedarf (Einheit 6).
  5. Evaluierung: Evaluierungscluster mit Edge- und Sicherheitsfällen, mehrschichtige Evaluierung in LLM-Systemen (Einheit 8).
  6. Justiz- und Ethikprüfung: Untergruppenanalyse, Modellkarte, Erklärbarkeit (Einheit 10).
  7. Sicherheitsaudit: Sofortige Injektion, Datenschutz, Lieferkette (Einheit 9).
  8. Verteilung: Verpackung, schrittweise Verteilung, Rollback, Modellregistrierung (Einheit 7).
  9. Überwachung: Dreischichtige Überwachung, Driftalarme (Einheit 8).
  10. Reproduzierbarkeit: Seed-, Datenversions-, Medien- und Experimentverfolgung über die gesamte Kette (diese Einheit).

In diesem Fluss ist die KI bei jedem Stopp ein Beschleuniger und Blaupausengenerator; Aber die Auswahl von Metriken, Datenentscheidungen, Fairness-Priorisierung, Bereitstellungsschwellenwert und Release-Genehmigung – kritische Entscheidungen bleiben beim Menschen. Dies ist die Essenz des Moduls.

Dokumentation: Die Zukunft wird es Ihnen danken

Ein gutes ML-Projekt dokumentiert sich selbst. Zumindest sollte Folgendes geschrieben werden: Problem- und Erfolgskriterien, Datenquelle und -version, Modellauswahl und -begründungen, Bewertungsergebnisse (einschließlich Untergruppen), bekannte Grenzen und Risiken, Bereitstellungs- und Abrufverfahren, Überwachungsplan. Dieses Dokument ist der beste Freund der Person (vielleicht sind Sie es), die nach sechs Monaten zum Projekt zurückkehrt.

drei Mini-Koffer

Fall 1 – Verlorenes Ergebnis. Ein Ingenieur hat ein großartiges Modell trainiert, aber er hat den Seed nicht korrigiert und die Datenversion nicht gespeichert. Als er den Job verließ, konnte niemand dieses Ergebnis reproduzieren; Das Modell wurde zur „Black-Box-Legende“ und wurde schließlich von Grund auf neu gebaut. Wochen wurden verschwendet. Lektion: Ein nicht reproduzierbares Ergebnis ist ein nicht vorhandenes Ergebnis.

Fall 2 – Zusammenbruch der Umwelt. Ein Team hatte die Abhängigkeiten nicht behoben. Wenn eine Bibliothek automatisch aktualisiert wurde, änderten sich die Modellausgaben stillschweigend und die Produktion wurde unterbrochen. Es dauerte Tage, das Problem zu finden. Als die Abhängigkeiten eingefroren und mit den endgültigen Versionen in Containern verpackt wurden, trat das Problem nicht erneut auf. Lektion: Die Umgebung einfrieren.

Fall 3 – Die Macht der Überwachung. Ein Team überwachte jedes Experiment automatisch. Drei Monate später beantworteten sie bei einem behördlichen Audit die Frage „Mit welchen Daten, mit welchen Einstellungen, welche Leistung wurde in welchen Gruppen erzielt?“ mit einer vollständigen Aufnahme innerhalb von Minuten. Die Inspektion verlief reibungslos. Lektion: Überwachung ist ein Compliance-Tool, nicht nur ein technisches.

Kopierbare Vorlagen

Führen Sie eine Reproduzierbarkeitsprüfung für dieses ML-Projekt durch. – Sind alle Zufallsstartwerte festgelegt (aufteilen, initialisieren, mischen)? – Sind die Daten versioniert? – Sind Abhängigkeiten auf exakte Versionen eingefroren? – Wird jedes Experiment (Code-Commit, Daten, Hyperparameter, Metrik) verfolgt? Schreiben Sie für jede fehlende Spalte konkrete Schritte zur Behebung auf. Projektstruktur: [Beschreibung]

Erstellen Sie ein Plangerüst für dieses End-to-End-ML-Projekt. Problem: [Beschreibung] Decken Sie die folgenden Stopps ab und markieren Sie, wo die MENSCHLICHE Entscheidung an jedem Stopp liegt: Problem/Metrik, Pipeline, Modell, (RAG/Agent/Feinabstimmung?), Bewertung, Fairness, Sicherheit, Verteilung, Überwachung, Reproduzierbarkeit. Schreiben Sie das Hauptrisiko und den Verifizierungsschritt für jeden Stopp auf.

Erstellen Sie eine technische Dokumentationsvorlage für dieses Projekt. Abschnitte: Problem+Erfolgskriterien, Daten (Quelle+Version), Modellauswahl+Begründung, Bewertung (einschließlich Untergruppen), bekannte Grenzen+Risiken, Bereitstellung+Rollback, Überwachungsplan. Geben Sie die auszufüllenden Felder für jeden Abschnitt als Fragen an.

Überprüfen Sie die Einrichtung meiner Experimentüberwachung: Wird sie bei jedem Lauf automatisch gespeichert: Git-Commit, Datenversion/Hash, alle Hyperparameter, alle Metriken, Umgebung (Bibliotheksversionen)? Erhalte ich das gleiche Ergebnis, wenn ich denselben Lauf noch einmal durchführe? Einrichtung: [Beschreibung]. Listen Sie die Mängel und Korrekturen auf.

Tabelle der Reproduzierbarkeitsspalten

Spalte

Was ist behoben

Fahrzeugbeispiel

Zufälligkeit

alle Samen

Saatguteinstellung

Daten

Datenversion/Hash

DVC

Umgebung

Bibliotheksversionen

Anforderungspin, Docker

Überwachung

Code+Daten+Einstellung+Metrik

MLflow, W&B

Häufige Fehler

  • Den Samen nicht reparieren. Das Ergebnis kann nicht wiederholt werden.
  • Die Datenversion wird nicht gespeichert. „Mit welchen Daten?“ bleibt unbeantwortet.
  • Süchte nicht einfrieren. Ein Update wird stillschweigend alles kaputt machen.
  • Experimente im Gedächtnis hinterlassen. Zwei Wochen später erinnert man sich an nichts mehr.
  • Kritische Entscheidungen der künstlichen Intelligenz überlassen. Maßstäbe, Gerechtigkeit und Verteilungsentscheidungen sollten bei den Menschen bleiben.
  • Dokumentation verschieben. Das zukünftige Team (und Sie) zahlen den Preis.

Zusammenfassend

Reproduzierbarkeit ist das Markenzeichen ernsthafter ML-Technik: Das nicht reproduzierbare Ergebnis ist die unbeweisbare Behauptung. Es verfügt über vier Spalten: Zufälligkeit korrigieren, Datenversion, Umgebung einfrieren, jedes Experiment verfolgen. Ein End-to-End-Projekt vereint alle Stationen dieses Moduls (Metrik, Daten, Modell, LLM-Komponenten, Bewertung, Fairness, Sicherheit, Verteilung, Überwachung) in einer miteinander verbundenen Kette; Künstliche Intelligenz ist bei jedem Stopp ein Beschleuniger, aber entscheidende Entscheidungen bleiben beim Menschen. Dokumentieren Sie alles – für zukünftige Teams und Audits. Diese Disziplin ist der Rahmen, der alles unterstützt, was Sie im Laufe des Moduls lernen.

Anwendungsaufgabe

Überprüfen Sie ein ML-Projekt anhand von vier Säulen der Reproduzierbarkeit: Sind die Seeds unveränderlich, sind die Daten versioniert, ist die Umgebung eingefroren, werden die Experimente verfolgt? Korrigieren Sie alle fehlenden Spalten und beweisen Sie, dass Sie denselben Lauf zweimal ausführen und das gleiche Ergebnis erhalten können. Geben Sie dann den End-to-End-Ablauf des Projekts (10 Stopps) auf einer Seite aus und markieren Sie an jedem Stopp „wo die menschliche Entscheidung liegt“. Schreiben Sie abschließend einen kurzen Entwurf einer technischen Dokumentation.

Checkliste

  • [ ] Alle Zufalls-Seeds behoben.
  • [ ] Datenversion/Hash wird bei jedem Experiment aufgezeichnet.
  • [ ] Abhängigkeiten werden auf feste Versionen (Pin/Container) eingefroren.
  • [ ] Jedes Experiment wird automatisch überwacht (Code+Daten+Einstellung+Metrik).
  • [ ] Wenn ich denselben Lauf wiederhole, erhalte ich das gleiche Ergebnis.
  • [ ] Ich habe überprüft und dokumentiert, dass kritische Entscheidungen im End-to-End-Prozess von Menschen getroffen werden.

Modulprüfung

1. Was ist als ML-Ingenieur der beste Ansatz bei der Positionierung künstlicher Intelligenz im Workflow?

  • A) KI ist ein Beschleuniger in Unternehmen mit geringem Risiko; Kritische Entscheidungen wie Metriken, Daten und Produktion bleiben validiert und dem Menschen überlassen ✔
  • B) Solange die KI-Ausgaben gut aussehen, ist keine Überprüfung erforderlich
  • C) Die Entscheidung, das Modell in Produktion zu bringen, der künstlichen Intelligenz zu überlassen, spart Zeit.
  • D) Künstliche Intelligenz ist nur zum Schreiben von Texten nützlich, sie hat nichts mit Daten und Modellarbeit zu tun

Beschreibung: KI ist ein leistungsstarker Beschleuniger für risikoarme, leicht verifizierbare Aufgaben wie Code, Datenauszüge und Dokumente; Die Verantwortung für Entscheidungen, die sich auf Geld, Vertraulichkeit und rechtliche Haftung auswirken, wie z. B. die Auswahl der Metriken, die Auswahl der Daten für das Training und die Einführung des Modells in die Produktion, liegt jedoch beim qualifizierten Ingenieur und Team. Jede Ausgabe sollte nicht ohne Überprüfung verwendet werden.

2. Warum wird die Schemavalidierung am Anfang einer Datenpipeline platziert?

  • A) Weil es die Genauigkeit des Modells direkt erhöht
  • B) Weil dadurch eine Datenversionierung überflüssig wird
  • C) Weil es beschädigte Daten zum frühesten und günstigsten Zeitpunkt erkennt und verhindert, dass sie in die nächsten Schritte gelangen ✔
  • D) Weil dadurch die Notwendigkeit einer Kennzeichnung entfällt

Erläuterung: Je früher beschädigte Daten erkannt werden, desto günstiger ist die Reparatur. Die Schemavalidierung verhindert, dass beschädigte Daten stillschweigend in das Training oder die Produktion gelangen, indem sie Daten außerhalb des erwarteten Typs und Bereichs am Anfang der Zeile ablehnt (z. B. Preisverschiebung um das 100-fache bei Einheitenwechsel); Derselbe Fehler, der in der Produktion entdeckt wird, ist um ein Vielfaches teurer.

3. Was ist der richtige Ansatz bei der Aufteilung der Daten in Training und Test bei einem Problem mit Zeit (Zeitreihen)?

  • A) Zufallsaufteilung verwenden, da dies immer die fairste Methode ist
  • B) Verwendung der zeitlichen Aufteilung: Verhindern Sie Lecks, indem Sie mit der Vergangenheit trainieren und in der Zukunft testen ✔
  • C) Nutzung aller Daten sowohl zum Training als auch zum Testen
  • D) Einbindung von Testdaten in Skalierungsparameter vor dem Training

Erläuterung: Die zufällige Aufteilung in Zeitreihen verschafft dem Modell einen „zukunftsorientierten“ Vorteil, der in der Produktion niemals auftreten wird, und bläht die Metriken künstlich auf (zeitlicher Verlust). Die richtige Lösung ist die zeitliche Einteilung: Trainiere mit der Vergangenheit, teste in der Zukunft. Dies misst die tatsächliche Leistung, die es in der Produktion hält.

4. Warum ist die Genauigkeit in einem Betrugserkennungsmodell mit einer positiven Klassenrate von 1,5 % irreführend?

  • A) Weil die Genauigkeit bei unausgeglichenen Daten immer gering ist
  • B) Weil Genauigkeit nur bei Regressionsproblemen verwendet werden kann
  • C) Weil die Genauigkeitsberechnung viel Rechenleistung erfordert
  • D) Selbst ein dürftiges Modell, das die Mehrheitsklasse vorhersagt, kann sehr genau sein und so den tatsächlichen Erfolg verbergen ✔

Erläuterung: Bei unausgeglichenen Daten erreicht selbst ein Basismodell, das sagt „Alles als negativ bezeichnen“, eine Genauigkeit von etwa 98,5 %, erkennt aber keinen einzigen Betrug. Daher werden bei der unausgeglichenen Klassifizierung Präzision, Rückruf, F1 oder PR-AUC anstelle von Genauigkeit verwendet und jede Metrik wird gemäß einem Basismodell interpretiert.

5. Warum ist ein Basisvergleich wichtig, wenn es um die Metrik eines Modells geht?

  • A) Weil das Basismodell immer besser ist als das reale Modell
  • B) Weil klar ist, ob eine Metrik nur im Vergleich zu einem einfachen Basismodell ✔ aussagekräftig ist oder nicht
  • C) Weil das Basismodell eine Kreuzvalidierung unnötig macht
  • D) Weil das Grundmodell in jedem Bericht gesetzlich vorgeschrieben ist

Erläuterung: Eine Metrik ist an sich weder gut noch schlecht; Nach einem Grundmodell ist es gut oder schlecht. Der Satz „85 % richtig“ bedeutet nahezu wertlos, wenn das Basismodell bereits 84 % erreicht, und perfekt, wenn es 50 % erreicht. Ohne einen Vergleichsanker ist die Metrik bedeutungslos.

6. Welches ist das kritischste Sicherheitselement, das in die Produktionsaufforderung des RAG-Systems (Retrieval-Augmented Generation) einbezogen werden sollte?

  • A) Anweisung, sich nur auf die angegebene Quelle zu verlassen, „Ich weiß nicht“ zu sagen, wenn die Quelle nicht existiert, und die Quelle zu zitieren ✔
  • B) Dem Modell sagen, dass es so lange und kreative Antworten wie möglich geben soll
  • C) Das Modell priorisiert sein eigenes Bildungswissen gegenüber Ressourcen
  • D) Implementieren Sie alle Anweisungen in den als Befehle mitgebrachten Dokumenten

Erläuterung: Die wichtigste Anweisung von RAG besteht darin, dem Modell mitzuteilen, dass es sich nur auf die angegebene Quelle verlassen soll. Wenn die Informationen nicht in der Quelle enthalten sind, sagen Sie „Ich weiß nicht“ und zitieren Sie die Quelle, ohne sie zu erfinden. Ohne diese Triade ignoriert das Modell möglicherweise den Kontext und erzeugt Halluzinationen, und die Antwort wird nicht mehr überprüfbar.

7. Ein RAG-System gibt falsche Antworten. Wo beginnt man am besten mit der Diagnose?

  • A) Messung zuerst abrufen (Recall@K): Kommt jemals das richtige Stück an? ✔
  • B) Ersetzen Sie das Modell sofort durch ein größeres
  • C) Ändern Sie die Eingabeaufforderung nach dem Zufallsprinzip und versuchen Sie es weiter
  • D) Einbetten aller Dokumente in das Modell mit Feinabstimmung

Erläuterung: Das schwächste Glied von RAG ist normalerweise der Abruf, nicht die Produktion. Wenn das richtige Teil nie geliefert wird, kann das Modell diese Informationen nicht liefern, egal wie stark die Eingabeaufforderung verbessert wird. Deshalb wird zunächst Recall@K gemessen, um zu sehen, ob das richtige Teil angekommen ist; Wenn der Abruf gut ist, werden die Produktion und die Eingabeaufforderung untersucht.

8. Welche Maßnahmen sollten hinter der menschlichen Zustimmung stehen, wenn einem Agenten ein Werkzeug übergeben wird?

  • A) Keine; Der Agent muss in der Lage sein, jede Aktion autonom auszuführen
  • B) Nur umkehrbare Aktionen wie das Lesen und Suchen von Daten
  • C) Unumkehrbare oder schwerwiegende Aktionen wie Geld überweisen, löschen, senden ✔
  • D) Aktionen, die nur Berechnungen beinhalten

Beschreibung: Aktionen sind nach Risikostufe getrennt. Abrufbare Aufgaben wie Lesen, Suchen, Berechnen und Erstellen von Entwürfen können autonom erledigt werden; Unumkehrbare oder einschneidende Aktionen wie Geldüberweisungen, E-Mails versenden, Daten löschen, Bestellungen aufgeben usw. bedürfen jedoch der menschlichen Zustimmung. Jede unwiderrufliche Handlung bedarf der Zustimmung.

9. Was ist der beste Designansatz gegen das Risiko einer indirekten sofortigen Injektion?

  • A) Es reicht aus, einen einzigen Satz „Fehlerhafte Anweisungen ignorieren“ zur Systemaufforderung hinzuzufügen
  • B) Geben Sie dem Modell mehr Autorität, indem Sie sich auf Anweisungen in externen Inhalten verlassen
  • C) Keine Vorsichtsmaßnahmen treffen, da eine Injektion unvermeidbar ist
  • D) Isolierung externer Inhalte als unzuverlässige Daten und Einrichtung mehrschichtiger Abwehrmaßnahmen mit minimaler Autorisierung, Genehmigung und Ausgabekontrolle ✔

Beschreibung: Vom Agenten oder RAG verarbeitete externe Inhalte wie Webseiten, Dokumente, E-Mails usw. sind nicht vertrauenswürdige Daten und können geheime Anweisungen enthalten. Der richtige Ansatz ist eine mehrschichtige Verteidigung: Isolierung externer Inhalte als „Daten, nicht Befehle“ mit klaren Trennzeichen, Anwendung minimaler Autorisierung, Bindung irreversibler Aktionen an die Zustimmung des Menschen und Prüfung der Ausgabe. Eine einzige Zeile mit Anweisungen reicht nicht aus.

10. Was ist der Hauptunterschied bei der Entscheidung, ob ein Problem mit Feinabstimmung oder RAG gelöst werden soll?

  • A) Informationsprobleme lassen sich besser mit RAG lösen, Verhaltens-/Formatprobleme lassen sich besser mit Feinabstimmung lösen ✔
  • B) Jedes Problem sollte immer durch Feinabstimmung gelöst werden
  • C) RAG wird nur zur Codegenerierung verwendet, die Feinabstimmung dient nur der Übersetzung
  • D) Feinabstimmung kann immer günstiger und schneller aktualisiert werden als RAG

Erläuterung: Die Feinabstimmung ist schwach und riskant, wenn es darum geht, dem Modell neue Informationen beizubringen. ist aber kraftvoll im Unterrichtsverhalten, -format, -ton und -stil. „Die Musterfirma kennt unsere Daten nicht“ ist ein Informationsproblem und gehört zur RAG. „Lassen Sie das Modell immer in unserem strengen Format ausgeben“ ist ein Verhaltensproblem und ein Kandidat für eine Feinabstimmung. Darüber hinaus sollten vor der Feinabstimmung schnelle und wenige Aufnahmen gemacht werden.

11. Was ist für den sicheren Einsatz bei der Produktion eines neuen Modells zwingend erforderlich?

  • A) Wenn das Modell im Test gut abschneidet, öffnen Sie es direkt für 100 % Verkehr
  • B) Die Überwachung wird nach der Bereitstellung überhaupt nicht eingerichtet
  • C) Phasenweise Bereitstellung (Shadow/Canary) und ein vorab getesteter Rollback-Plan ✔
  • D) Veröffentlichung des Modells, auch wenn der Bewertungsschwellenwert nicht erreicht wird

Erläuterung: Das neue Modell direkt für den gesamten Verkehr zu öffnen ist riskant; Wenn es falsch ist, sind alle betroffen. Das Richtige ist, dass es sich um eine schrittweise Verteilung (Shadow, Canary) handelt und jede Verteilung über einen getesteten Rollback-Plan verfügt. Eine Verteilung ist ohne einen Rückforderungsplan nicht vollständig. Die Möglichkeit, innerhalb von Minuten zur vorherigen Version zurückzukehren, schützt den Benutzer, wenn sich das Modell in der Produktion unerwartet verhält.

12. Wie kann ein ML-Modell in der Produktion „stillschweigend“ ausfallen und wie kann man das abfangen?

  • A) Das Modell kollabiert; Serverprotokolle zeigen dies
  • B) Indem wir falsche Vorhersagen treffen, ohne Fehler zu machen; ✔ Es erfasst die Überwachung auf Betriebs-, Eingabe- und Ausgabeebene
  • C) Das Modell kann niemals stillschweigend ausfallen, immer alarmierend
  • D) Die bloße Überwachung der Latenz reicht aus, um etwaige Verschlechterungen zu erkennen

Erläuterung: Das Modell kann einfach dadurch scheitern, dass es falsche Vorhersagen liefert, ohne abzustürzen oder Fehler zu machen; Der Hauptgrund dafür ist Datendrift und Konzeptdrift. Die bloße Überwachung betrieblicher Kennzahlen (Latenz, Fehlerrate) reicht nicht aus; Die Eingabeverteilung und die Ausgabe-/Vorhersageverteilung sollten ebenfalls überwacht werden. Der Eingabedrift warnt frühzeitig, wenn sich das tatsächliche Ergebnis verzögert.

13. Welches Prinzip ist wichtig, wenn LLM als Richter zur Bewertung eines LLM-Systems verwendet wird?

  • A) Der LLM-Schiedsrichter hat immer Recht, eine menschliche Überprüfung ist nicht erforderlich
  • B) Der Schiedsrichter darf eine Entscheidung nur auf der Grundlage der Antwortlänge treffen.
  • C) Auf regelbasierte Kontrollen und menschliche Beurteilung sollte beim Einsatz von Schiedsrichtern gänzlich verzichtet werden
  • D) Die Bewertungen der Richter sollten mit einer von Menschen markierten Probe kalibriert und ihre Voreingenommenheit gemessen werden, bevor man ihnen vertrauen kann ✔

Beschreibung: LLM-Schiedsrichter ist auch ein Model; Es kann halluzinatorisch, voreingenommen (bevorzugt lange, sichere Antworten) und inkonsistent sein. Daher müssen die Schiedsrichterergebnisse anhand einer vom Menschen markierten Stichprobe kalibriert und ihre systematische Verzerrung gemessen werden, bevor die Produktionsentscheidung getroffen wird. Ein ungeprüfter Schiedsrichter vermittelt falsches Vertrauen.

14. Warum ist die Betrachtung der Gesamtgenauigkeit bei der Beurteilung der Modellverzerrung unzureichend?

  • A) Die Gesamtgenauigkeit ist ausreichend, da sie immer die Leistung der schlechtesten Gruppe widerspiegelt
  • B) Die Gesamtgenauigkeit allein reicht nicht aus, da sie systematische Unterschiede (verborgene Unterscheidung) zwischen Untergruppen verschleiern kann ✔
  • C) Weil Genauigkeit eine Metrik ist, die nichts mit Voreingenommenheit zu tun hat
  • D) Die Verzerrung kommt nur vom Modell und hat nichts mit den Daten zu tun.

Erläuterung: Die Gesamtgenauigkeit kann systematische Unterschiede zwischen Untergruppen verschleiern. Während beispielsweise die Gesamtgenauigkeit 88 % beträgt, kann die Erinnerung in einer Gruppe 91 % und in einer anderen Gruppe 67 % betragen; Das Modell verfehlt diese Gruppe systematisch. Daher sollte das Modell auf der Grundlage von Untergruppen (Demografie/Segment) evaluiert werden und welche Definition von Gerechtigkeit priorisiert werden sollte, sollte mit den Interessenvertretern entschieden werden.

15. Welche vier Dinge müssen zusammen festgelegt werden, damit ein ML-Ergebnis reproduzierbar ist?

  • A) Nur Modellname, Größe, Preis und Erscheinungsdatum
  • B) Nur GPU-Marke und Internetgeschwindigkeit
  • C) Nur die endgültige Genauigkeitsbewertung des Modells; Der Rest kann im Gedächtnis behalten werden
  • D) Zufallsstartwert, Datenversion, Umgebung (Abhängigkeitsversionen) und Experimentverfolgung ✔

Beschreibung: Reproduzierbarkeit wird durch vier Säulen erreicht: Fixieren von Zufalls-Seeds, Versionieren von Daten (Version/Hash), Einfrieren der Umgebung (exakte Bibliotheksversionen/Container) und Verfolgen jedes Experiments (Code-Commit, Daten, Hyperparameter, Metrik). Ohne diese Kette ist es nicht möglich, dasselbe Ergebnis zu reproduzieren; Ein nicht reproduzierbares Ergebnis ist eine Behauptung, die nicht bewiesen werden kann.