Von Sokrates erzeugtes Projekt (Coding-Delegation).
- weber/konsens-auswertung.md: Claude/Grok/Kimi-Korrekturen gegenübergestellt
* A. Konsens (8 Regressionsfälle, alle 3 einig): CDU->SPD, Feb->Juli,
Dez->Juni, Uni-Hamburg abgeschlossen, 91-Stellen=August, Webers eigene
Verurteilung, BG-Rückzug, Zitat-Integrität
* B. Dissens (5, strittig, nicht einbacken): 'Frau Guttenberg', 'dumme Gans',
ZEIT-Datum 2021-vs-2024 (direkter Widerspruch!), Startjahr, Phantom-FAZ
* C. 7 Regressionsfakten fürs Eval-Set
* D. Meta: Konsens bestätigt Grounding-Diagnose; LLM-Konsens != Wahrheit;
Kimis Spezifität = Lead nicht Beweis
- Korrektur-Dateinamen -> claude-fable.md / grok-4.5.md / kimi-k3.md
- README: konsens-auswertung.md in Struktur ergänzt
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
||
|---|---|---|
| weber | ||
| README.md | ||
sokrates-qs — Qualitätssicherung & Bericht-Evals
Vergleichs- und Eval-Lab für Sokrates-Berichte. Pro analysiertem Bericht ein Unterordner mit dem Original, dem Tool-Call-Log, unabhängigen Modell-Korrekturen und einer Abweichungs-Analyse. Ziel: aus konkreten Berichten belastbare Faktentreue-/Grounding-Befunde und Regressionsfälle gewinnen — statt Einzelfall- Gefühl.
Struktur (pro Bericht ein Ordner)
<thema>/
bericht.md # der Original-Bericht der Engine
toolcalls.md # dokumentierte Tool-Aufrufe (Recherche-Spur)
abweichungs-analyse.md # Faktentreue/Grounding-Befunde (Typ + Konfidenz) + A/B
konsens-auswertung.md # Modell-Korrekturen gegenübergestellt: Konsens vs. Dissens
korrekturen/ # Korrektur-Fassungen durch mehrere Modelle
<modell>.md
Enthaltene Analysen
weber/— Stefan Weber (Plagiatsgutachten, Fälle Baerbock/Habeck/ Brosius-Gersdorf). Erster Eintrag; A/B zur Query-Diversität vor/nach dem Tool-Call-Fix inweber/abweichungs-analyse.md.
Methode
- Original + Toolcalls ablegen.
- Abweichungen gegen die abgerufenen und offenen Quellen kategorisieren (falsches Attribut / Datum / Attribution / Zitat-Integrität / ungegroundeter Fakt), mit Konfidenz.
- Modell-Korrekturen (mehrere unabhängige Modelle) daneben — Konsens = hohe Konfidenz, Dissens = strittig. Korrektoren sind selbst LLMs → bei realen Personen gegen Primärquellen absichern.
- Bestätigte Fehler werden Regressionsfälle für künftige Läufe.
Alle Quellen sind öffentlich zugängliche Medienberichte; die Berichte geben den Stand der öffentlichen Debatte wieder und stellen keine Rechtsberatung dar.