sokrates-qs/README.md
Claude Fable 5 (Sokrates-Team) 01b46b15b1 Weber: Drei-Wege-Konsens-Auswertung + Korrektur-Dateinamen geglättet
- weber/konsens-auswertung.md: Claude/Grok/Kimi-Korrekturen gegenübergestellt
  * A. Konsens (8 Regressionsfälle, alle 3 einig): CDU->SPD, Feb->Juli,
    Dez->Juni, Uni-Hamburg abgeschlossen, 91-Stellen=August, Webers eigene
    Verurteilung, BG-Rückzug, Zitat-Integrität
  * B. Dissens (5, strittig, nicht einbacken): 'Frau Guttenberg', 'dumme Gans',
    ZEIT-Datum 2021-vs-2024 (direkter Widerspruch!), Startjahr, Phantom-FAZ
  * C. 7 Regressionsfakten fürs Eval-Set
  * D. Meta: Konsens bestätigt Grounding-Diagnose; LLM-Konsens != Wahrheit;
    Kimis Spezifität = Lead nicht Beweis
- Korrektur-Dateinamen -> claude-fable.md / grok-4.5.md / kimi-k3.md
- README: konsens-auswertung.md in Struktur ergänzt

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-24 13:54:04 +02:00

1.7 KiB

sokrates-qs — Qualitätssicherung & Bericht-Evals

Vergleichs- und Eval-Lab für Sokrates-Berichte. Pro analysiertem Bericht ein Unterordner mit dem Original, dem Tool-Call-Log, unabhängigen Modell-Korrekturen und einer Abweichungs-Analyse. Ziel: aus konkreten Berichten belastbare Faktentreue-/Grounding-Befunde und Regressionsfälle gewinnen — statt Einzelfall- Gefühl.

Struktur (pro Bericht ein Ordner)

<thema>/
  bericht.md             # der Original-Bericht der Engine
  toolcalls.md           # dokumentierte Tool-Aufrufe (Recherche-Spur)
  abweichungs-analyse.md # Faktentreue/Grounding-Befunde (Typ + Konfidenz) + A/B
  konsens-auswertung.md  # Modell-Korrekturen gegenübergestellt: Konsens vs. Dissens
  korrekturen/           # Korrektur-Fassungen durch mehrere Modelle
    <modell>.md

Enthaltene Analysen

  • weber/ — Stefan Weber (Plagiatsgutachten, Fälle Baerbock/Habeck/ Brosius-Gersdorf). Erster Eintrag; A/B zur Query-Diversität vor/nach dem Tool-Call-Fix in weber/abweichungs-analyse.md.

Methode

  1. Original + Toolcalls ablegen.
  2. Abweichungen gegen die abgerufenen und offenen Quellen kategorisieren (falsches Attribut / Datum / Attribution / Zitat-Integrität / ungegroundeter Fakt), mit Konfidenz.
  3. Modell-Korrekturen (mehrere unabhängige Modelle) daneben — Konsens = hohe Konfidenz, Dissens = strittig. Korrektoren sind selbst LLMs → bei realen Personen gegen Primärquellen absichern.
  4. Bestätigte Fehler werden Regressionsfälle für künftige Läufe.

Alle Quellen sind öffentlich zugängliche Medienberichte; die Berichte geben den Stand der öffentlichen Debatte wieder und stellen keine Rechtsberatung dar.