Inhaltsmoderation
Zweck und Einsatzkontext
Die Inhaltsmoderation schützt jobsai.cz vor diskriminierenden, illegalen, betrügerischen oder anderweitig schädlichen Inhalten in Stellenanzeigen und Meldungen. Derzeit existieren nur eine regelbasierte Anti-Diskriminierungs-Kontrolle der Anzeigen, Validierungsregeln der Anwendung und ein menschlicher Notice-and-Action-Prozess. Ein eigenständiger allgemeiner Toxicity-Classifier ist weder im Repository noch im Produktionscode eingesetzt.
Klassifizierung nach dem AI Act
Nach der Verordnung (EU) 2024/1689 (AI Act) ist die aktuelle allgemeine Inhaltsmoderation kein eigenständiges System zur rekrutierungsbezogenen Bewertung von Kandidaten nach Anhang III, Nummer 4(a). Im heutigen Umfang handelt es sich um eine regelbasierte und menschliche Kontrolle der Veröffentlichung von Nutzerinhalten; sollte sie beginnen, Kandidaten automatisch zu bewerten oder Bewerbungen zu filtern, muss sie als hochriskant umklassifiziert werden. Der Betreiber führt dennoch eine technische Dokumentation, Logging, Post-Market-Monitoring und einen Vorfallsprozess; schwerwiegende Vorfälle werden den zuständigen Behörden nach dem AI Act und der tschechischen Umsetzungsgesetzgebung gemeldet; nach der endgültigen Bestimmung der Aufsichtsbehörde wird dieser Teil aktualisiert. Die Pflichten für eine etwaige hochriskante Erweiterung würden am 2. August 2026 wirksam.
Eingaben und Ausgaben
Eingabe sind der Titel und die Beschreibung der Stellenanzeige, der Text der Meldung, interne Notizen und weiterer vom Nutzer eingestellter Inhalt. Diese Texte können Kontaktdaten, Firmenidentifikatoren und sensible Daten enthalten, wenn der Nutzer sie in den freien Text einstellt. Ausgabe des aktuellen Systems ist ein Befund einer Anti-Diskriminierungs-Regel, ein Validierungsfehler, eine Warteschlange zur menschlichen Überprüfung oder ein DSA-Notice-and-Action-Eintrag; nicht ein Toxicity-Score aus einem gehosteten Modell.
Verwendete Modelle und Versionen
Zum 2026-05-13 wurde im Code kein eigenständiges gehostetes Toxicity-Modell gefunden. Der produktiv dokumentierte automatisierte Teil verwendet einen regelbasierten Anti-Diskriminierungs-Classifier und die üblichen Regeln der Anwendungsvalidierung von Stellenanzeigen. Ein allgemeiner Toxicity-Classifier ist frühestens für Q1 nach dem Launch geplant; vor der Aktivierung müssen die Einzelheiten des Modells, DPA/SCC, ein Eval-Set, Metriken und eine gesonderte Genehmigung der Modellkarte ergänzt werden. Ein Fine-Tuning ist nicht verzeichnet. Ein Wissens-Cutoff findet beim aktuellen regelbasierten Teil keine Anwendung.
Trainingsdaten
Der regelbasierte Teil verwendet ein internes Eval-Set anti-diskriminierender Sätze und eine rechtliche/Policy-Taxonomie in der Dokumentation. Der allgemeine Toxicity-/Legality-Classifier hat im Repository bislang weder einen Trainingsdatensatz noch einen Prompt. Für menschliche Überprüfungen werden DSA-Gründe, die Meldung des Nutzers und der Kontext der Anzeige verwendet; die vollständigen internen Anweisungen für Moderatoren werden nicht veröffentlicht, damit sie nicht leicht umgangen werden.
Beschränkungen und bekannte Risiken
Die aktuelle regelbasierte Kontrolle erfasst nicht alle Formen von Betrug, Hass, Belästigung, illegalen Angeboten oder toxischen Inhalten. Daher darf die Karte nicht als Behauptung ausgelegt werden, dass jobsai.cz einen allgemeinen Production-Toxicity-Classifier betreibt. Kritische Eingriffe müssen eine menschliche Aufsicht, ein Einspruchsrecht und eine Audit-Spur haben. Wird in Zukunft ein externes LLM oder eine Moderation-API aktiviert, müssen vor dem produktiven Einsatz die Qualität für Tschechisch und die false-positive-Auswirkungen gemessen werden.
Fairness und Anti-Diskriminierung
Die Inhaltsmoderation berücksichtigt die geschützten Kategorien aus dem Gesetz Nr. 198/2009 Slg. und die Pflicht zum nicht diskriminierenden Zugang zur Beschäftigung. Zu den Minderungsmaßnahmen gehören die Trennung der Policy-Gründe, ein Einspruchsrecht, die Auditierung der Eingriffe und die Kontrolle der Auswirkungen nach Kategorie des Verstoßes. Das Pre-Launch-Audit des regelbasierten Anti-Diskriminierungs-Teils ist nach der internen Methodik abgeschlossen. Letztes Audit: 2026-05-14, bestanden.
| Position | Wert |
|---|---|
| Letztes Audit | 2026-05-14, bestanden |
Das Audit des allgemeinen Moderation-Classifiers erfolgt vor seiner etwaigen Aktivierung.
Menschliche Aufsicht
Jede Ausblendung oder Ablehnung von Inhalten muss überprüfbar sein. Der Arbeitgeber erhält den Grund und den Weg des Einspruchs. Trust & Safety kann die Entscheidung rückgängig machen, eine Anpassung verlangen oder einen Vorfall an den rechtlichen Kontakt eskalieren. DSA-Notice-and-Action, Einsprüche und Policy-Streitigkeiten nimmt [email protected] entgegen.
Leistungsmetriken
Für den allgemeinen Moderation-Classifier sind Precision/Recall noch nicht gemessen, weil er nicht eingesetzt ist. Gemessen wird erst vor seinem etwaigen Start: die Anzahl der Meldungen, der Median der Zeit bis zum Eingriff, der Anteil erfolgreicher Einsprüche, die false-positive-Review-Rate und die Kategorie des Eingriffs. Der Anti-Diskriminierungs-Teil hat gesonderte Metriken in der entsprechenden Modellkarte.
Sicherheit und Datenschutz
Der regelbasierte Teil läuft lokal ohne Übermittlung an Dritte. Die Verarbeitung personenbezogener Daten richtet sich nach der Verordnung (EU) 2016/679 (DSGVO); die Rechtsgrundlage für die Moderation, die Verhinderung von Missbrauch und das Audit ist das berechtigte Interesse nach Art. 6 Abs. 1 Buchst. f DSGVO, bei den gesetzlichen Notice-and-Action-Pflichten auch die rechtliche Pflicht nach Art. 6 Abs. 1 Buchst. c DSGVO. Wird eine externe Moderation-API aktiviert, können die Texte der Anzeigen und Meldungen die Grenze von jobsai.cz verlassen; der Betreiber muss vor dem Launch die EU/US-Verarbeitung, das Aufbewahrungsregime und DPA/SCC ergänzen. Die Moderatoren-Warteschlangen müssen unnötige PII maskieren und die Audit-Spur nur für die notwendige Dauer aufbewahren. Einzelheiten finden sich in den Grundsätzen zum Schutz personenbezogener Daten.
Beschwerden und Kontakt
Die Meldung illegaler Inhalte, Einsprüche gegen die Moderation und Beschwerden über das automatisierte Werkzeug senden Sie an [email protected]. Anträge zum Schutz personenbezogener Daten richten Sie an die Grundsätze zum Schutz personenbezogener Daten.
Version der Karte
Version der Karte 1.0.3, letzte Aktualisierung 2026-07-08.