- weber/konsens-auswertung.md: Claude/Grok/Kimi-Korrekturen gegenübergestellt
* A. Konsens (8 Regressionsfälle, alle 3 einig): CDU->SPD, Feb->Juli,
Dez->Juni, Uni-Hamburg abgeschlossen, 91-Stellen=August, Webers eigene
Verurteilung, BG-Rückzug, Zitat-Integrität
* B. Dissens (5, strittig, nicht einbacken): 'Frau Guttenberg', 'dumme Gans',
ZEIT-Datum 2021-vs-2024 (direkter Widerspruch!), Startjahr, Phantom-FAZ
* C. 7 Regressionsfakten fürs Eval-Set
* D. Meta: Konsens bestätigt Grounding-Diagnose; LLM-Konsens != Wahrheit;
Kimis Spezifität = Lead nicht Beweis
- Korrektur-Dateinamen -> claude-fable.md / grok-4.5.md / kimi-k3.md
- README: konsens-auswertung.md in Struktur ergänzt
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
|
||
|---|---|---|
| .. | ||
| claude-fable.md | ||
| grok-4.5.md | ||
| kimi-k3.md | ||
| README.md | ||
Modell-Korrekturen — Weber-Bericht
Hier liegen die Korrektur-/Faktencheck-Fassungen des Berichts durch mehrere
unabhängige Modelle. Lokal bei Peter unter E:\sokrates\output\sokrates-qs\weber
(Windows) — von der GB10 aus nicht erreichbar, daher von dort pushen.
Erwartete Dateien (Namen anpassen nach Bedarf):
claude-fable.md— Korrektur durch Claude Fablekimi-k3.md— Korrektur durch Kimi K3grok-4.5.md— Korrektur durch Grok 4.5
Auswertungs-Idee
Wo alle drei dieselbe Korrektur machen → hohe Konfidenz, echter Fehler
(Kandidat für ../abweichungs-analyse.md + späteren Regressionsfall). Wo sie
sich uneinig sind → strittiger/ambiger Fakt, NICHT „schärfen". Korrektoren
sind selbst LLMs — Konsens ist starker Verdacht, aber die Absicherung bei einer
realen Person bleiben Primärquellen.