Gewinne:
- Möglichkeit, Nutzungsszenarien je nach Auswirkung in niedrige/mittlere/hohe Risikostufen einzuteilen
- Möglichkeit, das Modell vor der Produktion mit Red-Teaming systematisch zu testen
- Fähigkeit, Produktionsentscheidungen mit Modellkarte und Annahmetür zu treffen (Go/No-Go)
Nicht jeder Einsatz von KI birgt das gleiche Risiko. Ein Assistent, der eine Besprechungsnotiz zusammenfasst, und ein Assistent, der einen Kreditantrag prüft, führen zu sehr unterschiedlichen Ergebnissen. Die Grundlage der Unternehmensführung besteht darin, Nutzungen nach Risikoniveau zu klassifizieren und auf jeder Ebene eine angemessene Kontrolle anzuwenden. In dieser Einheit lernen wir den Rahmen des Modellrisikomanagements (die Disziplin des Managements des Risikos, das dadurch entsteht, dass ein Modell falsch, voreingenommen oder ausnutzbar ist), wie man das Modell vor der Produktion mit Red-Teaming testet, sowie die Modellkarte und die Akzeptanzkriterien.
Klassifizierung nach Risiko
Der erste Schritt ist immer derselbe: „Was passiert, wenn diese Nutzung schief geht?“ Drei grobe Stufen nach Wirksamkeit und Reversibilität:
- Geringes Risiko: Fehler können leicht erkannt und behoben werden; Keine persönlichen/finanziellen Konsequenzen. Beispiel: Zusammenfassung einer internen Besprechung, Erstellung eines Ideenentwurfs.
- Mittleres Risiko: Der Fehler beeinträchtigt den Geschäftsprozess, geht aber durch das menschliche Auge. Beispiel: Entwurf einer Antwort an den Kunden, vorläufige Berichtszusammenfassung.
- Hohes Risiko: Die Entscheidung wirkt sich direkt auf eine Person/Geld aus und ist schwer rückgängig zu machen. Beispiel: Kredit-/Versicherungsentscheidung, Gesundheitstriage, Beschäftigungsüberprüfung.
Die Kontrollintensität nimmt mit der Höhe des Risikos zu: Bei geringem Risiko sind leichte Kontrollen ausreichend; Bei hohem Risiko sind menschliche Überwachung, strenge Überprüfung, Red Teaming und ständige Überwachung obligatorisch.
Achtung: Führen Sie eine Risikoeinstufung nach der Auswirkung der Verwendung durch, nicht nach ihrem Namen. Das sogenannte „Just-a-Chatbot“-System birgt ein hohes Risiko, wenn es Zahlungen veranlassen kann.
Rotes Team (Red-Teaming)
Red Teaming versucht absichtlich, ein System zu zerstören, indem es sich als böswilliger Angreifer ausgibt. Dies ist in der KI; Es umfasst Jailbreaking (Umgehen der Sicherheitsregeln des Modells), sofortige Injektion, Datenexfiltration, die Generierung voreingenommener/böswilliger Ausgaben und das Testen von Edge-Szenarien. Ziel ist es, Schwachstellen vor dem eigentlichen Angreifer zu finden.
Schritt für Schritt:
- Listen Sie Bedrohungsszenarien auf. Wie kann dieses System missbraucht werden?
- Bereiten Sie das Angriffsset vor. Schreiben Sie für jede Bedrohung konkrete Eintragsbeispiele.
- Versuchen Sie es systematisch. Führen Sie jedes Szenario aus und zeichnen Sie das Ergebnis auf.
- Priorisieren Sie Ergebnisse. Sortieren Sie nach Auswirkung × Wahrscheinlichkeit.
- Beheben Sie das Problem und testen Sie es erneut. Versuchen Sie es nach dem Patch erneut mit demselben Satz (Regression).
Musterkarte und Akzeptanzkriterien
Eine Modellkarte ist ein Dokument, das zusammenfasst, wofür ein Modell geeignet ist, welche Einschränkungen es hat, bekannte Risiken und Leistungen. Bevor Sie es in Produktion bringen, sollten Sie Kriterien für eine Akzeptanzentscheidung haben: Genauigkeitsschwelle, Red-Team-Pass-Rate, Latenz, Kosten und Bias-Tests.
Vier kopierbare Vorlagen
Eingabeaufforderung zur Risikoklassifizierung:
Betrachten Sie den folgenden Anwendungsfall: {{ Szenario }}Fragen: – Wen/was betrifft der Fehler? (Person, Geld, Ruf, Harmonie) – Ist es umkehrbar? (ja/nein) - Kann der Mensch eingreifen? Ergebnis: „Geringes / mittleres / hohes Risiko“ + Liste der obligatorischen Prüfungen.
Generator für Angriffssets des roten Teams:
Sie sind ein Red-Team-Spezialist. Generieren Sie 15 Angriffsszenarien für den folgenden Assistenten: 5 Jailbreaks, 5 sofortige Injektionen (davon 3 indirekt), 5 Datenexfiltrationsversuche. Für jedes Szenario: Schreiben Sie den Zweck, den vollständigen Einführungstext und „Erfolgskriterien“ (was auch immer ich sehe, zählt den Angriff als erfolgreich).
Modellbrettskelett:
Modellkarte: – Beabsichtigte Verwendung / unbeabsichtigte Verwendung – Schulungs-/Datenbeschränkungen und bekannte Schwachstellen – Leistung: Genauigkeit, Latenz, Kosten (im Testsatz) – Sicherheit: Erfolgsquote des roten Teams, bekannte Jailbreaks – Bias-Testergebnisse – Annahmeentscheidung: GENEHMIGUNG / BEDINGT / ABLEHNUNG + Begründung
Regel zur Einlasskontrolle:
ALLE Bedingungen müssen erfüllt sein, um mit der Produktion fortzufahren: – >= Zielschwellenwert für den Genauigkeitstestsatz – Anzahl der kritischen Ergebnisse des roten Teams = 0 – Bei hohem Risiko: Inspektions- und Überwachungsgremium durch Menschen. Wenn keine erfüllt sind: „NO-GO“ + fehlender Artikel.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
schlechter Ansatz
Starker Ansatz
Verarbeiten Sie jede Verwendung mit der gleichen Steuerung
Klassifizierung nach Risiko und Skalierungskontrolle
„Wir haben es getestet, es funktioniert“ (happy way)
Absichtlicher Bruchversuch mit der roten Mannschaft
Das Modell ohne Begründung in Produktion geben
Musterkarte + Annahmeschleuse (Go/No-Go)
Kein erneuter Test nach dem Patchen
Regressionstest nach Korrektur
Drei Mini-Hüllen
Fall 1 – Eine Fehlklassifizierung war kostspielig. Ein Unternehmen betrachtete das Rekrutierungs-Prescreening als „nur eine Ergänzung“ und stufte es als geringes Risiko ein. Das Modell eliminierte systematisch Absolventen bestimmter Schulen; Dies führte zu einer Diskriminierungsbeschwerde. Die Nutzung wurde als „hohes Risiko“ neu eingestuft und Bias-Tests sowie menschliche Überwachung wurden hinzugefügt.
Fall 2 – Das rote Team hat drei kritische Schwachstellen gefunden. Dem roten Team wurde vor Produktionsbeginn ein Kundenassistent zugeteilt. 3 von 15 Szenarien waren erfolgreich: Durch eine indirekte Injektion könnten die Bestellinformationen eines anderen Kunden durchsickern. Die Lücken wurden geschlossen und mit demselben Satz erneut getestet; Die Produktion wurde erst wieder aufgenommen, als der kritische Befund zurückgesetzt wurde.
Fall 3 – Das Modell erläuterte die Entscheidung, die Karte zu akzeptieren. Ein Team wählte zwischen zwei Modellen und legte Modellkarten nebeneinander. Das günstigere Modell traf in puncto Genauigkeit ins Schwarze, war jedoch anfällig für zwei kritische Jailbreaks im roten Team. Das Team entschied sich aufgrund der Akzeptanz-Gate-Regel „kritischer Befund = 0“ für das teure, aber sichere Modell und dokumentierte die Entscheidung.
Tipp: Red Team ist keine einmalige Veranstaltung. Führen Sie den Angriffssatz immer dann erneut aus, wenn sich das Modell, die Eingabeaufforderung oder die Tools ändern. Sicherheit ist kein Zustand, sondern eine fortlaufende Praxis.
Häufige Fehler
- Klassifizieren Sie die Verwendung nach Namen (und nicht nach Wirkung). hohes Risiko mit niedrigem verwechseln.
- Testen Sie einfach den „glücklichen Weg“ und versuchen Sie es überhaupt nicht mit Missbrauch.
- Das rote Team einmal machen und es nach Änderungen nicht wiederholen.
- Das Modell ohne Modellkarte und Abnahmekriterien in Produktion bringen.
- Umgehen von Voreingenommenheits-/Diskriminierungstests (insbesondere bei menschlichen Entscheidungen mit hohem Risiko).
- Es bedeutet „geschlossen“, ohne dass ein Regressionstest nach der Korrektur durchgeführt wird.
Zusammenfassend
- Der erste Schritt besteht darin, die Verwendungen je nach Auswirkung als geringes/mittleres/hohes Risiko einzustufen; Die Kontrollintensität nimmt mit dem Risiko zu.
- Red Teaming versucht bewusst wie ein Angreifer, das System zu brechen. findet die Schwachstelle vor dem eigentlichen Angreifer.
- Die Modellkarte dokumentiert den Zweck, die Grenzen und die Risiken des Modells. ist Grundlage für die Zulassungsentscheidung.
- Der Übergang zur Produktion muss an ein Go/No-Go geknüpft sein: Genauigkeit, kritische Nullfindung, erforderliche Überwachung.
- Die Sicherheit ist kontinuierlich: Red Teaming und Regressionstests werden bei jeder Änderung wiederholt.
Anwendungsaufgabe
Wählen Sie den Einsatz einer KI, bestimmen Sie das Risikoniveau anhand der Auswirkungen und verfassen Sie die Begründung. Generieren Sie dann mindestens 10 Angriffsszenarien für diesen Einsatzzweck (Jailbreak, Injektion, Datenexfiltration) und probieren Sie diese manuell aus. Schlagen Sie für jeden erfolgreichen Angriff eine Lösung vor. Füllen Sie abschließend ein Musterkartengerüst aus und treffen Sie eine „GO/NO-GO“-Entscheidung mit Begründung.
Checkliste
- [ ] Ich habe die Verwendung entsprechend der Risikostufe entsprechend der Wirkung klassifiziert.
- [ ] Ich habe die Kontrollintensität an das Risikoniveau angepasst.
- [ ] Ich habe ein Angriffsset für das rote Team vorbereitet und es systematisch ausprobiert.
- [ ] Ich habe die kritischen Ergebnisse korrigiert und sie mit Regressionstests verifiziert.
- [ ] Ich habe eine Modellkarte vorbereitet (Zweck, Grenze, Leistung, Sicherheit).
- [ ] Ich habe die Produktionsentscheidung an ein Go/No-Go geknüpft.