Einheit 9 / 11

Kontinuierliche Überwachung, Beobachtbarkeit und Drift

Gewinne:

  • Möglichkeit, Metriken zu definieren, die Nutzungs-, Sicherheits-, Qualitäts- und Leistungssignale überwachen
  • Möglichkeit zur Erkennung von Abweichungen der Ausgabequalität anhand von Basislinien und Stichproben
  • Möglichkeit, eine Alarm- und Feedbackschleife für Anomalien und Jailbreak-Wellen einzurichten

Die Inbetriebnahme eines KI-Systems ist der Anfang, nicht das Ende. Auch wenn das Modell dasselbe bleibt, verändert sich die Welt: Benutzerverhalten, eingehende Daten, Angriffstechniken und Geschäftskontext ändern sich ständig. Die richtige Antwort von gestern kann heute falsch sein. Die letzte Säule der Sicherheit ist also die kontinuierliche Überwachung und Beobachtbarkeit – die Fähigkeit, von außen zu sehen, was im System vor sich geht. In dieser Einheit lernen wir, welche Metriken überwacht werden müssen, wie Abweichungen in der Ausgabequalität erfasst werden und wie man bei Anomalien warnt.

Warum kontinuierliche Überwachung?

In klassischer Software ist „Funktioniert es?“ eine binäre Frage: Entweder antwortet es oder nicht. Bei KI scheint das System zwar zu „funktionieren“, es kann sich jedoch stillschweigend verschlechtern: Antworten werden langsam ungenau, die Kosten steigen, Jailbreak-Versuche nehmen zu. Die einzige Möglichkeit, diese zu erfassen, besteht darin, ständig die richtigen Signale zu messen.

Achtung: Die gefährlichste Fehlfunktion ist die leise, nicht die laute. Das System gibt keine Fehler aus, seine Qualität nimmt nur ab. Wenn Sie keine Überwachung einrichten, ist die erste Person, die es bemerkt, Ihr Kunde oder Prüfer, nicht Sie.

Vier Signalfamilien, die es zu beobachten gilt

  • Nutzung und Kosten: Anforderungsvolumen, Token-Verbrauch, Kosten pro Benutzer. Plötzlicher Sprung; Dies könnte ein Anzeichen für Missbrauch, eine fehlerhafte Integration oder ein undichter Schalter sein.
  • Sicherheitssignale: Jailbreak-/Einschleusungsversuche, abgelehnte Fahrzeuganrufe, Autorisierungsfehler. Ein Anstieg kann auf eine aktive Angriffskampagne hinweisen.
  • Qualität und Drift: Abnahme der Ausgabequalität im Laufe der Zeit (Drift). Zum Beispiel die Erfolgsquote der Verifizierung, die Korrekturquote bei der menschlichen Genehmigung und die Benutzerzufriedenheit.
  • Leistung: Latenz, Fehlerrate, Timeout. Es wirkt sich direkt auf die Benutzererfahrung und die Kosten aus.

Was ist Drift und wie fängt man ihn?

Von Drift spricht man, wenn sich die Qualität der Eingaben oder Ausgaben des Modells im Laufe der Zeit unbemerkt ändert. Es gibt zwei Arten: Datendrift (die Verteilung eingehender Anfragen ändert sich – neues Thema, neue Sprache) und Qualitätsdrift (die Ausgabe für denselben Auftrag wird allmählich schlechter). Eine Basislinie ist erforderlich, um Folgendes zu erfassen: den normalen Messwertbereich aufzeichnen, wenn das System fehlerfrei ist; Lassen Sie die Abweichung zum Alarm werden.

Schritt für Schritt: Überwachung einrichten

  1. Messen Sie die Grundlinie. Zeichnen Sie den Normalbereich jedes Signals auf, wenn das System fehlerfrei ist.
  2. Schwellenwert und Alarm definieren. Welche Abweichung wird wen und wie warnen?
  3. Probenahme + menschliche Inspektion. Lassen Sie regelmäßig eine Stichprobe der Ergebnisse von einem Menschen überprüfen (die Qualitätsabweichung ist oft nur sichtbar).
  4. Installieren Sie ein Dashboard. Überwachen Sie vier Signalfamilien auf einem Bildschirm.
  5. Rückkopplungsschleife. Verknüpfen Sie die Erkenntnisse aus der Überwachung mit der sofortigen Verbesserung/Kontrolle.

Vier kopierbare Vorlagen

Eingabeaufforderung zur Bewertung der Qualitätsstichprobe (Drift-Verfolgung mit LLM als Richter):

Nachfolgend finden Sie 20 zufällige Ausdrucke dieser Woche. Bewerten Sie jedes als „gut / akzeptabel / schlecht“ und schreiben Sie eine kurze Begründung. Abschließend vergleiche ich den schlechten Kurs mit dem Kurs der letzten Woche; Wenn es ein Muster gibt (Wiederholung des gleichen Fehlertyps), das diese Woche auffällt, markieren Sie es.<outputs>{{ examples }}</outputs>

Eingabeaufforderung zur Anomaliezusammenfassung:

Untersuchen Sie die folgenden täglichen Kennzahlen: Anzahl der Anfragen, Token, Kosten, abgelehnter Tool-Aufruf, Jailbreak-Versuche, durchschnittliche Latenz. Markieren Sie jede Metrik, die mehr als 30 % vom Ausgangswert abweicht, als „ANOMALIT“ und schätzen Sie die mögliche Ursache (Angriff, Fehler, Missbrauch).<metrics>{{ daily_data }}</metrics>

Definitionsregel für den Alarmschwellenwert:

Definieren Sie Alarme für jedes Signal: - Kosten: wenn mehr als das Zweifache des Tagesdurchschnitts -> Warnung mit hoher Priorität - Jailbreak-Versuche: wenn mehr als 10 pro Stunde -> Sicherheitsteam benachrichtigen - Verifizierungserfolgsrate: wenn unter 90 % fällt -> Qualitätsüberprüfung - Latenz: wenn p95 das Ziel um das Zweifache überschreitet -> Leistungsüberprüfung

Aufforderung zur Driftforschung:

Die Erfolgsquote der Verifizierung ist in den letzten 2 Wochen von 94 % auf 78 % gesunken. Helfen Sie mir, diese Fragen zu beantworten: (1) Ist in den eingehenden Anfragen ein neues Thema/eine neue Sprache/ein neues Format aufgetaucht? (2) Konzentrieren sich Fehler auf eine bestimmte Kategorie? (3) Fällt der Zeitpunkt mit einem Aufforderungs-/Modell-/Werkzeugwechsel zusammen? Benennen Sie jeweils die zu prüfenden Daten.

Schwache Eingabeaufforderung / Starke Eingabeaufforderung

schlechter Ansatz

Starker Ansatz

„Wenn es einen Fehler gibt, werden wir sehen“

Basislinie + Schwellenwert + proaktiver Alarm

Ich schaue nur, ob das System steht.

Überwachung von vier Signalfamilien (Nutzung, Sicherheit, Qualität, Leistung)

Die Ausgabequalität wird überhaupt nicht abgetastet

Regelmäßige menschliche Probenahme + LLM-as-Judge

Keine Erhebung und Betrachtung von Kennzahlen

Dashboard + Feedbackschleife

Drei Mini-Hüllen

Fall 1 – Der Kostenalarm hat den undichten Schlüssel entdeckt. Die täglichen Token-Kosten eines Unternehmens verdreifachten sich über Nacht. Der Schwellenalarm alarmierte das Sicherheitsteam; Die Untersuchung ergab, dass ein Testschlüssel durchgesickert war und von einem Bot verwendet wurde. Der Schlüssel wurde innerhalb von 25 Minuten widerrufen; Hätte es keinen Alarm gegeben, wäre die Rechnung am Monatsende aufgefallen.

Fall 2 – Stille Qualitätsabweichung. Die Erfolgsquote bei der Verifizierung eines Support-Assistenten sank innerhalb von drei Wochen stillschweigend von 95 % auf 80 %. Wöchentliche Probenahmen haben dies erfasst; Der Grund dafür war, dass Kunden nach einer neuen Produktlinie fragten und die Wissensbasis des Modells dazu unvollständig war. Die Rate erholte sich, als die Wissensdatenbank aktualisiert wurde.

Fall 3 – Die Jailbreak-Welle kam früh. Die Zahl der Injektionsversuche bei einem Assistenten stieg an einem Tag von 2 auf 40 pro Stunde. Sicherheitsalarm ausgelöst; Es wurde festgestellt, dass in einem Forum ein „Rezept“ zum Knacken des Systems geteilt wurde. Das Team hat die Verteidigungsaufforderung aktualisiert und verdächtige Konten mit einer Ratenbegrenzung versehen. Die Welle ließ nach, bevor sie zu einem echten Leck wurde.

Tipp: Geben Sie sich nicht nur mit Maschinenmetriken zufrieden. Qualitätsabweichungen werden häufig dadurch erkannt, dass ein Mensch die Beispielausgaben liest. Mit einer kleinen Routine zur Überprüfung von 15 bis 20 zufälligen Ausdrucken pro Woche können Sie die teuersten stillen Ausfälle frühzeitig erkennen.

Häufige Fehler

  • Es nicht in Produktion zu nehmen und eine Überwachung einzurichten („es funktioniert, okay“).
  • Die Anomalie kann nicht identifiziert werden, ohne die Grundlinie zu messen.
  • Den Qualitätsunterschied verfehlt man, wenn man nur auf „hält es stand“ schaut.
  • Die Ausgabequalität wird überhaupt nicht mit menschlichen Augen abgetastet.
  • Kein Alarm auslösen und das Problem nicht vom Kunden/Vorgesetzten erfahren.
  • Überwachungsergebnisse werden nicht mit Verbesserungen verknüpft (keine Feedbackschleife).

Zusammenfassend

  • KI-Systeme können still und leise verfallen; Die gefährlichste Fehlfunktion ist diejenige, die keine Fehler verursacht, sondern nur die Qualität beeinträchtigt.
  • Verfolgen Sie vier Signalfamilien: Nutzung/Kosten, Sicherheit, Qualität/Drift und Leistung.
  • Die Abweichung (die zeitliche Abweichung der Eingabe- oder Ausgabequalität) wird nur im Vergleich zu einer Basislinie erfasst.
  • Regelmäßige menschliche Probenahmen zusätzlich zu Maschinenmetriken erfassen Qualitätsabweichungen.
  • Überwachung an die Alarm- und Rückmeldeschleife anschließen; Messen und nicht schauen ist kein Überwachen.

Anwendungsaufgabe

Wählen Sie mindestens eine Metrik aus jeder der vier Signalfamilien für Ihr eigenes KI-System und notieren Sie deren aktuelle (oder geschätzte) Basislinien. Definieren Sie für jede Metrik einen Alarmschwellenwert. Nehmen Sie dann 15 Ergebnisse Ihres letzten Semesters und bewerten Sie sie mit der oben genannten Stichprobenaufforderung. Beachten Sie die „schlechte“ Quote. Dies sollte Ihre erste Basislinie sein, mit der Sie die Drift in Zukunft vergleichen können.

Checkliste

  • [ ] Ich habe Metriken aus vier Signalfamilien definiert (Nutzung, Sicherheit, Qualität, Leistung).
  • [ ] Ich habe für jede Metrik eine Basislinie und einen Alarmschwellenwert festgelegt.
  • [ ] Ich prüfe regelmäßig die Ausgabequalität mit menschlichen Augen.
  • [ ] Ich überwache die Signale auf einem einzigen Bildschirm mit einem Anzeigefeld.
  • [ ] Alarm geht wegen Anomalien und Jailbreak-Wellen an das Sicherheitsteam.
  • [ ] Ich führe die Überwachungsergebnisse auf die Verbesserung der Schnelligkeit/Kontrolle zurück.