Bias-Review-Workflows für KI-Coding-Agents, die mit Filesystem-Zugriff im Workspace arbeiten. Prüft drei Klassen von Artefakten auf versteckte Diskriminierungs-Muster: (1) Texte (Stellenanzeigen, Recruiting-Nachrichten, Karriereseiten, Interviewfragen, Marketing-Posts), (2) einzelne KI-Entscheidungs-Vorschläge zu Personen (Empfehlungen, Scores, Disqualifikationen) und (3) komplette KI-Systeme (Recruiting-Funnels, Sourcing-Tools, ATS, Scoring-Pipelines, fremde Agenten-Kits in beliebigem Format — Markdown, Python, TypeScript, JSON-Workflows, YAML-Configs, n8n-Flows, LangGraph/CrewAI/AutoGen-Definitionen) inklusive Anschlussfähigkeit an strukturierte Dokumentation. Funktioniert mit Claude Code, Codex, Cursor, Cline, Aider und jedem LLM-Host mit Filesystem-Zugriff.
Start in 60 Sekunden. Öffne den Ordner in deinem AI-Coding-Agent (Claude Code, Cursor, Codex CLI, Cline, Aider, GitHub Copilot Workspace …). Der Agent lädt AGENTS.md bzw. CLAUDE.md automatisch und kennt das Kit. Sag dann einfach: "Prüfe diese Stellenanzeige: …" — der Agent wählt den passenden Workflow selbst.
Manifest lesen (AGENTS.md) · Beispiel ansehen · Setup-Optionen für deinen Agenten
Vorher (Stellenanzeige):
Wir suchen einen jungen, dynamischen Macher für unser Team aus Vollblut-Technikern.
Muttersprachliches Deutsch ist Pflicht. Hands-on-Mentalität erwartet.
Nachher (nach Lauf durch 01-text-bias-lint und 09-legal-review):
Wir suchen eine Fachkraft, die strukturiert arbeitet und gerne im Team Probleme löst.
Die Rolle erfordert verhandlungssichere Deutschkenntnisse auf C1-Niveau in Wort und Schrift.
Wir arbeiten in einer Kultur des praktischen Anpackens und der gegenseitigen Unterstützung.
Findings-Auszug: Alter (junger), Geschlecht (Macher männlich konnotiert), ethnische Herkunft (Muttersprachliches Deutsch), Behinderung (Hands-on-Mentalität). Vollständiger Walkthrough: examples/showcase-kmu/before-after-job-ad.md. Synthetisches Beispiel.
KI-Coding-Agents schreiben heute Stellenanzeigen, Recruiting-DMs, Karriereseiten-Copy und sogar Bewertungs-Vorschläge zu Bewerber:innen. Diese Texte verlassen das Haus oft schneller, als ein Mensch sie prüfen kann. Versteckte Stereotype, Proxy-Formulierungen und unbeabsichtigte Ausschluss-Signale rutschen leise mit durch. Klassische "Bias-Tools" sind entweder geschlossene SaaS-Pipelines oder ML-Klassifier ohne Audit-Spur. Das passt nicht zu einem Workflow, in dem ein Agent live im Repo arbeitet.
Dieses Kit ist die einfachste sinnvolle Antwort: reine Markdown-System-Prompts, plattform-neutral, mit verankerten wissenschaftlichen Quellen und einem Audit-Log-Schema. Jeder Agent mit Filesystem-Zugriff kann es lesen, jede Prüfung ist zitierbar, und nichts davon erfordert eine Installation.
| Verzeichnis | Inhalt |
|---|---|
00-orchestrator/ |
Eintritts-Prompt. Entscheidet je nach Aufgabe, welche Familie läuft. |
01-text-bias-lint/ |
Familie A. Vier-Schritt-Kette für Texte: Detect, Suggest, Rewrite, Verify. |
02-decision-audit/ |
Familie B. Prüfung von KI-Entscheidungs-Vorschlägen (B1) und kompletten Recruiting-Funnels (B2) inkl. akkumulierter Filtereffekte. |
03-personas/ |
Familie C. Counter-Stereotype-Personas und Adapter zu GenderMag, Microsoft Inclusive Design, W3C/WAI. |
04-governance/ |
Familie D. Audit-Trail-Schema, Risk-Level-Definition, Limitations. |
05-references/ |
116 wissenschaftliche Quellen, Stereotyp-Katalog, AGG- und Ableismus-Checklisten. |
06-integration/ |
Plattform-Adapter für Claude Code, Codex, Cursor, Cline, Aider, ChatGPT und generische LLM-Hosts. |
07-evaluation/ |
Test-Suite, Metriken, Benchmark für 09-Legal-Review. |
08-usage/ |
Quickstarts (60-Sekunden-Lint, Einzeltext, Decision-Audit, KI-System-Audit als Hauptpfad für Beratungs-Einsätze) und Operator-Skill. |
09-legal-review/ |
Quick-Triage und Deep-Review als finales Tor vor Veröffentlichung. |
docs/ |
AGG-, DSGVO- und Mitbestimmungs-Kontext für Operator:innen. |
examples/showcase-kmu/ |
Vollständiger Walkthrough mit synthetischem Mandanten. |
-
Repo klonen (oder den Ordner direkt in deinem Agent öffnen):
git clone https://github.com/Luis247911/bias-guardian-agent-kit.git
-
Agent starten (Claude Code, Cursor, Codex CLI, Cline, Aider, GitHub Copilot Workspace oder jeder andere AI-Coding-Host mit Filesystem-Zugriff). Dein Agent lädt
AGENTS.md(bzw.CLAUDE.md) automatisch beim Start und kennt damit das Kit — keine Setup-Schritte, keine manuellen Prompt-Imports. -
Sag, was geprüft werden soll — der Agent wählt den passenden Pfad selbst:
Prüfe diese Stellenanzeige: <Text einfügen>Audit diese KI-Entscheidung: <KI-Output einfügen>Audit unser ATS — hier ist die System-Beschreibung und 10 Sample-Outputs: <...>Audit dieses Agentensystem: <Ordnerpfad> (z.B. "prüfe ../screening-agent-kit/ auf Bias" — der Agent liest den ganzen Ordner, extrahiert System-Prompts, Personas, Trigger und Workflows automatisch und auditiert das gesamte Kit.)
Der Agent antwortet mit Findings (Quelle aus 05-references/quellen.md, Severity, Originaltext-Ausschnitt, Rewrite-Vorschlag) und legt einen strukturierten Audit-Log-Eintrag in audit-logs/ ab.
Fallback für Hosts ohne AGENTS.md-Support (z.B. ChatGPT-Webchat, Mistral-Chat, Open-Source-LLMs ohne Filesystem-Tools): Füge einmalig den Inhalt von 00-orchestrator/orchestrator.system-prompt.md als System-Prompt ein und referenziere die übrigen Dateien manuell.
Detaillierter Walkthrough zu Pfad 3 (KI-System-Audit für Beratungs-Einsätze): 08-usage/quickstart-ki-system-audit.md. 60-Sekunden-Lint: 08-usage/quickstart-60-sekunden.md.
Acht konkrete Aufgaben, die das Kit heute abdeckt. Jeder Eintrag ist ein synthetisches Beispiel.
1. Stellenanzeige auf versteckte Diskriminierungs-Marker prüfen
Vorher: "Wir suchen einen jungen, dynamischen Macher für unser Team aus Vollblut-Technikern. Wer bei uns einsteigt, brennt für Code und Freitag-Bier."
Nachher: "Wir suchen eine erfahrene oder einsteigende Fachkraft, die strukturiert arbeitet und gerne im Team Probleme löst. Wir respektieren unterschiedliche Arbeitszeit-Präferenzen und Pausen-Kulturen."
Agent: 01-text-bias-lint Vier-Schritt-Kette. Audit-Eintrag verweist auf §1 AGG (Alter, Geschlecht, Religion oder Weltanschauung) und §11 AGG (Stellenausschreibung).
2. Recruiting-DM vor dem Versand prüfen
Vorher: "Hi Sarah, wir suchen junge Talente wie dich, die noch hungrig sind und mit Tempo lernen. Lust auf ein Gespräch?"
Nachher: "Hi Sarah, dein Profil im Bereich X passt zu einer Rolle, die wir gerade besetzen. Hast du Interesse an einem kurzen Austausch zu Inhalt und Rahmen?"
Agent: 01-text-bias-lint plus 03-personas. Anker: §7 AGG (Benachteiligungsverbot im vorvertraglichen Stadium), §3 Abs 2 AGG (mittelbare Benachteiligung).
3. Karriereseiten-Text prüfen
Vorher: "Wir sind ein Team aus jungen High-Performern, die Code zum Frühstück essen. Bei uns wird hart gearbeitet und hart gefeiert."
Nachher: "Wir sind ein Team, das Neugier und verlässliche Lieferung schätzt. Wir unterstützen Eltern, Quereinsteigende und Menschen, die fokussiertes Arbeiten der Dauer-Präsenz vorziehen."
Agent: 01-text-bias-lint Schritt 2 (inklusive Alternativen). Optional Cross-Check via 03-personas. Anker: §22 AGG (Indizwirkung im Streitfall).
4. Interviewfragen vor dem Gespräch prüfen
Vorher: "Planen Sie in den nächsten zwei Jahren eine Familiengründung? Sprechen Sie akzentfreies Deutsch? Sind Sie an Wochenenden grundsätzlich erreichbar?"
Nachher: "Diese Rolle hat einen Arbeitszeitrahmen Montag bis Freitag, 09:00 bis 18:00 Uhr. Können Sie diese Zeiten zuverlässig abdecken? Die Rolle verlangt verhandlungssichere Deutschkenntnisse auf C1-Niveau. Erfüllen Sie diese Anforderung? Diese Rolle beinhaltet einen Wochenend-Bereitschaftsdienst alle vier Wochen. Können Sie diese Anforderung erfüllen?"
Agent: 01-text-bias-lint plus 02-decision-audit (Entscheidungs-Relevanz prüfen). Anker: BAG-Linie zum Frageverbot Familienplanung, §1 AGG (ethnische Herkunft), §8 AGG (zulässige berufliche Anforderung).
5. Marketing-Post oder Kampagnen-Headline prüfen
Vorher: "Liebe IT-Leiter, ihr kennt das: Eure Jungs im Maschinenraum löten seit 20 Jahren das gleiche Setup. Höchste Zeit für ein Tool, das endlich erwachsen ist."
Nachher: "Liebe IT-Verantwortliche, viele eurer Teams arbeiten seit Jahren mit gewachsenen Setups. Wenn ihr über Modernisierung nachdenkt, ist hier ein Tool, das den Übergang strukturiert."
Agent: 01-text-bias-lint mit Persona-Cross-Check. Scope-Hinweis: §2 Abs 1 AGG erfasst Beschäftigung, nicht generelles Produkt-Marketing. Wert dieser Prüfung liegt in Brand-Safety und Conversion, wenn Employer-Branding-Bezug fehlt.
6. Produktbeschreibung auf stereotyp-codierte Sprache prüfen
Vorher: "Unser Tool macht aus jedem Workflow eine Hochleistungsmaschine. Wer schnell denkt, wird hier schneller. Wer Schwächen hat, sieht sie nicht mehr."
Nachher: "Unser Tool reduziert wiederholbare Schritte und macht den Status jeder Aufgabe sichtbar. Wir bauen es so, dass es mit unterschiedlichen Arbeitsstilen funktioniert: schnelle Sprints und langsame, fokussierte Sessions."
Agent: 01-text-bias-lint Schritt 1 (Stereotyp-Detect) plus 04-governance (Audit-Eintrag). Hinweis: Ableistisch codierter Produkttext fällt nicht unter AGG, kann aber UWG-Relevanz haben.
7. KI-Entscheidungs-Vorschlag zu Bewerbung prüfen
Vorher (KI-Vorschlag): "Empfehlung: Ablehnung. Kandidatin hat Lücken im Lebenslauf von 2018 bis 2020 und wirkt im Anschreiben weniger ambitioniert als andere Bewerbungen."
Nachher (Decision-Audit-Antwort): "Audit-Befund: Die Lücken 2018 bis 2020 sind nicht näher untersucht und könnten Elternzeit, Pflege oder Krankheit umfassen. Subjektive Bewertungen ohne Verhaltensanker sind kein zulässiger Ablehnungsgrund. Empfehlung: KI-Aussage nicht übernehmen, Bewerbung im regulären Verfahren behalten, Audit-Eintrag mit Korrektur dokumentieren."
Agent: 02-decision-audit plus 09-legal-review als finales Tor, 04-governance loggt. Anker: §1 AGG, §22 AGG, Art 22 Abs 1 DSGVO, §31 BDSG.
8. Komplettes KI-System / Recruiting-Funnel prüfen (Beratungs-Hauptpfad)
Szenario: Ein eingekauftes oder selbst gebautes Recruiting-Tool (ATS, Sourcing-Engine, Scoring-Pipeline, KI-Generator für Stellenanzeigen) soll vor Inbetriebnahme, vor Audit-Termin oder bei Modell-Update geprüft werden. Mehrstufige Funnels werden cross-touchpoint analysiert (Stellenanzeige → Outreach → Bewerbungsformular → CV-Vorscreening → Interview-Scorecard → Endentscheidung) inkl. akkumulierter Filtereffekte (Multiplikation, nicht Addition).
Vorgehen: System-Steckbrief → Risiko-Einordnung → D1 Source-Diversity → 5–20 Sample-Outputs → Familie-A-Lauf auf Text-Outputs → Familie-B1-Lauf auf Decisions → Counter-Stereotype-Persona-Cross-Test (5–8 Personas aus 03-personas/persona-library/) → B2 Funnel-Auditor (akkumulierte Wirkung pro Persona-Profil) → D2 Intersectional-Check → D3 Audit-Trail mit Anschluss an strukturierte Dokumentation (z.B. EU-AI-Act-Annex-IV).
Agent: Kompletter Stack — Orchestrator + Familie A + B1 + B2 + C + D1 + D2 + D3 + optional 09-Legal-Review. Operator-Skill in 08-usage/operator-skill.md. Quickstart: 08-usage/quickstart-ki-system-audit.md.
Vier Agent-Familien arbeiten zusammen: Text-Lint prüft Sprache, Decision-Audit prüft KI-Vorschläge zu Personen (B1) und akkumulierte Funnel-Effekte (B2), Personas liefern Counter-Stereotype-Perspektive, Governance protokolliert. Eine fünfte Familie (09-legal-review) sitzt am Ende als Legal-Lens für HR-Texte und liefert auditfähige Findings gegen eine geschlossene Anker-Liste deutscher Normen.
Jedes Finding trägt eine Quelle aus 05-references/quellen.md, eine Severity, einen Ausschnitt aus dem Originaltext und einen Rewrite-Vorschlag. Eine Verifier-Stufe prüft die Findings, bevor sie an die Audit-Trail übergeben werden. Vollständige Grundsätze: PHILOSOPHY.md.
Dieses Kit liefert keine Rechtsberatung und keine Konformitäts-Aussage. Die deutschen Normen-Anker im 09-legal-review/-Modul sind sachliche Orientierung. Maßgeblich ist die Prüfung im konkreten Einsatzkontext durch eine fachkundige Person. Worte wie "rechtssicher", "AGG-konform", "certified" oder "compliant" erscheinen in keinem Output-Pfad.
Der Audit-Log dokumentiert Prüf-Schritte und Entscheidungen so, dass eine spätere fachkundige Prüfung sie weiterverarbeiten kann. Die Zuordnung zu konkreten regulatorischen Anforderungen liegt bei der einsetzenden Organisation und deren juristischer Begleitung.
Vollständige Limitations-Liste: 04-governance/limitations.md. Disclaimer: DISCLAIMER.md.
| Plattform | Dateizugriff | Adapter |
|---|---|---|
| Claude Code | nativ, Filesystem-Tools | 06-integration/claude-code.md |
| Codex CLI | nativ, Filesystem-Tools | 06-integration/codex.md |
| Cursor | nativ, @file-Referenzen |
06-integration/cursor.md |
| Cline | nativ, VS-Code-Extension | 06-integration/cline.md |
| Aider | nativ, Git-Integration | 06-integration/aider.md |
| ChatGPT | manuell, Pinned-Files | 06-integration/chatgpt.md |
| Andere LLM-Hosts | manuell, Copy-Paste | 06-integration/generic-llm.md |
Plattform-Neutralität ist Designziel: alle Sub-Agenten sind reine Markdown-System-Prompts ohne Tool-spezifische Konstrukte. Wer auf einem neuen Host arbeitet, schreibt einen Adapter in 06-integration/ und reicht ihn als PR ein.
- v0.1.0-public (aktuell): Vier Kern-Familien plus Legal-Review, sieben Adapter, Showcase, Test-Suite.
- v0.2.0: Zusätzliche Showcases für andere Branchen (Pflege, IT-Systemhäuser, Öffentlicher Dienst). Erweiterte Use-Case-Galerie in
examples/. - v0.2.0: Optionale Englische Spiegel-Files für
01-text-bias-lint/und09-legal-review/Output-Schemas. - v0.3.0: Multimodal-Modul (Karriereseiten-Visuals, Banner-Bilder) als eigene Familie.
- v0.3.0: Jurisdiktions-Forks (
09-legal-review-fr,09-legal-review-uk) als Beiträge aus der Community.
Geplante Themen werden in GitHub Discussions abgestimmt, bevor sie als Issue konkretisiert werden.
Beiträge sind willkommen. Vorgehensweise und Standards: CONTRIBUTING.md. Verhaltens-Kodex: CODE_OF_CONDUCT.md. Wer ein neues Beispiel beiträgt, achtet darauf, dass es synthetisch ist und im Frontmatter synthetic: true trägt.
Inhaltliche Fragen, Schema-Diskussionen und Vorschläge zu neuen Anker-Listen: GitHub Discussions. Sicherheits-Hinweise (z.B. Prompt-Injection-Tests, die einen Bypass zeigen): SECURITY.md.
Creative Commons Attribution 4.0 International (CC BY 4.0). Zitations-Datei: CITATION.cff.
Maintainer: Luis Hornburg. Issues, PRs und Discussions sind die bevorzugten Kanäle für Anpassungs- und Erweiterungs-Vorschläge.