- weber/konsens-auswertung.md: Claude/Grok/Kimi-Korrekturen gegenübergestellt
* A. Konsens (8 Regressionsfälle, alle 3 einig): CDU->SPD, Feb->Juli,
Dez->Juni, Uni-Hamburg abgeschlossen, 91-Stellen=August, Webers eigene
Verurteilung, BG-Rückzug, Zitat-Integrität
* B. Dissens (5, strittig, nicht einbacken): 'Frau Guttenberg', 'dumme Gans',
ZEIT-Datum 2021-vs-2024 (direkter Widerspruch!), Startjahr, Phantom-FAZ
* C. 7 Regressionsfakten fürs Eval-Set
* D. Meta: Konsens bestätigt Grounding-Diagnose; LLM-Konsens != Wahrheit;
Kimis Spezifität = Lead nicht Beweis
- Korrektur-Dateinamen -> claude-fable.md / grok-4.5.md / kimi-k3.md
- README: konsens-auswertung.md in Struktur ergänzt
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
39 lines
1.7 KiB
Markdown
39 lines
1.7 KiB
Markdown
# sokrates-qs — Qualitätssicherung & Bericht-Evals
|
|
|
|
Vergleichs- und Eval-Lab für Sokrates-Berichte. Pro analysiertem Bericht ein
|
|
Unterordner mit dem Original, dem Tool-Call-Log, unabhängigen Modell-Korrekturen
|
|
und einer Abweichungs-Analyse. Ziel: aus konkreten Berichten belastbare
|
|
Faktentreue-/Grounding-Befunde und Regressionsfälle gewinnen — statt Einzelfall-
|
|
Gefühl.
|
|
|
|
## Struktur (pro Bericht ein Ordner)
|
|
|
|
```
|
|
<thema>/
|
|
bericht.md # der Original-Bericht der Engine
|
|
toolcalls.md # dokumentierte Tool-Aufrufe (Recherche-Spur)
|
|
abweichungs-analyse.md # Faktentreue/Grounding-Befunde (Typ + Konfidenz) + A/B
|
|
konsens-auswertung.md # Modell-Korrekturen gegenübergestellt: Konsens vs. Dissens
|
|
korrekturen/ # Korrektur-Fassungen durch mehrere Modelle
|
|
<modell>.md
|
|
```
|
|
|
|
## Enthaltene Analysen
|
|
|
|
- [`weber/`](weber/) — Stefan Weber (Plagiatsgutachten, Fälle Baerbock/Habeck/
|
|
Brosius-Gersdorf). Erster Eintrag; A/B zur Query-Diversität vor/nach dem
|
|
Tool-Call-Fix in [`weber/abweichungs-analyse.md`](weber/abweichungs-analyse.md).
|
|
|
|
## Methode
|
|
|
|
1. **Original + Toolcalls** ablegen.
|
|
2. **Abweichungen** gegen die abgerufenen und offenen Quellen kategorisieren
|
|
(falsches Attribut / Datum / Attribution / Zitat-Integrität / ungegroundeter
|
|
Fakt), mit Konfidenz.
|
|
3. **Modell-Korrekturen** (mehrere unabhängige Modelle) daneben — Konsens =
|
|
hohe Konfidenz, Dissens = strittig. Korrektoren sind selbst LLMs → bei realen
|
|
Personen gegen Primärquellen absichern.
|
|
4. Bestätigte Fehler werden **Regressionsfälle** für künftige Läufe.
|
|
|
|
*Alle Quellen sind öffentlich zugängliche Medienberichte; die Berichte geben den
|
|
Stand der öffentlichen Debatte wieder und stellen keine Rechtsberatung dar.*
|