sokrates-qs/README.md
Claude Fable 5 (Sokrates-Team) 01b46b15b1 Weber: Drei-Wege-Konsens-Auswertung + Korrektur-Dateinamen geglättet
- weber/konsens-auswertung.md: Claude/Grok/Kimi-Korrekturen gegenübergestellt
  * A. Konsens (8 Regressionsfälle, alle 3 einig): CDU->SPD, Feb->Juli,
    Dez->Juni, Uni-Hamburg abgeschlossen, 91-Stellen=August, Webers eigene
    Verurteilung, BG-Rückzug, Zitat-Integrität
  * B. Dissens (5, strittig, nicht einbacken): 'Frau Guttenberg', 'dumme Gans',
    ZEIT-Datum 2021-vs-2024 (direkter Widerspruch!), Startjahr, Phantom-FAZ
  * C. 7 Regressionsfakten fürs Eval-Set
  * D. Meta: Konsens bestätigt Grounding-Diagnose; LLM-Konsens != Wahrheit;
    Kimis Spezifität = Lead nicht Beweis
- Korrektur-Dateinamen -> claude-fable.md / grok-4.5.md / kimi-k3.md
- README: konsens-auswertung.md in Struktur ergänzt

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-24 13:54:04 +02:00

39 lines
1.7 KiB
Markdown

# sokrates-qs — Qualitätssicherung & Bericht-Evals
Vergleichs- und Eval-Lab für Sokrates-Berichte. Pro analysiertem Bericht ein
Unterordner mit dem Original, dem Tool-Call-Log, unabhängigen Modell-Korrekturen
und einer Abweichungs-Analyse. Ziel: aus konkreten Berichten belastbare
Faktentreue-/Grounding-Befunde und Regressionsfälle gewinnen — statt Einzelfall-
Gefühl.
## Struktur (pro Bericht ein Ordner)
```
<thema>/
bericht.md # der Original-Bericht der Engine
toolcalls.md # dokumentierte Tool-Aufrufe (Recherche-Spur)
abweichungs-analyse.md # Faktentreue/Grounding-Befunde (Typ + Konfidenz) + A/B
konsens-auswertung.md # Modell-Korrekturen gegenübergestellt: Konsens vs. Dissens
korrekturen/ # Korrektur-Fassungen durch mehrere Modelle
<modell>.md
```
## Enthaltene Analysen
- [`weber/`](weber/) — Stefan Weber (Plagiatsgutachten, Fälle Baerbock/Habeck/
Brosius-Gersdorf). Erster Eintrag; A/B zur Query-Diversität vor/nach dem
Tool-Call-Fix in [`weber/abweichungs-analyse.md`](weber/abweichungs-analyse.md).
## Methode
1. **Original + Toolcalls** ablegen.
2. **Abweichungen** gegen die abgerufenen und offenen Quellen kategorisieren
(falsches Attribut / Datum / Attribution / Zitat-Integrität / ungegroundeter
Fakt), mit Konfidenz.
3. **Modell-Korrekturen** (mehrere unabhängige Modelle) daneben — Konsens =
hohe Konfidenz, Dissens = strittig. Korrektoren sind selbst LLMs → bei realen
Personen gegen Primärquellen absichern.
4. Bestätigte Fehler werden **Regressionsfälle** für künftige Läufe.
*Alle Quellen sind öffentlich zugängliche Medienberichte; die Berichte geben den
Stand der öffentlichen Debatte wieder und stellen keine Rechtsberatung dar.*