sokrates-qs/weber/konsens-auswertung.md
Claude Fable 5 (Sokrates-Team) 01b46b15b1 Weber: Drei-Wege-Konsens-Auswertung + Korrektur-Dateinamen geglättet
- weber/konsens-auswertung.md: Claude/Grok/Kimi-Korrekturen gegenübergestellt
  * A. Konsens (8 Regressionsfälle, alle 3 einig): CDU->SPD, Feb->Juli,
    Dez->Juni, Uni-Hamburg abgeschlossen, 91-Stellen=August, Webers eigene
    Verurteilung, BG-Rückzug, Zitat-Integrität
  * B. Dissens (5, strittig, nicht einbacken): 'Frau Guttenberg', 'dumme Gans',
    ZEIT-Datum 2021-vs-2024 (direkter Widerspruch!), Startjahr, Phantom-FAZ
  * C. 7 Regressionsfakten fürs Eval-Set
  * D. Meta: Konsens bestätigt Grounding-Diagnose; LLM-Konsens != Wahrheit;
    Kimis Spezifität = Lead nicht Beweis
- Korrektur-Dateinamen -> claude-fable.md / grok-4.5.md / kimi-k3.md
- README: konsens-auswertung.md in Struktur ergänzt

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-24 13:54:04 +02:00

83 lines
6 KiB
Markdown
Raw Permalink Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Konsens-Auswertung — Weber-Bericht
> 24.07.2026. Drei unabhängige Modelle haben den Sokrates-Original­bericht
> korrigiert: [`korrekturen/claude-fable.md`](korrekturen/claude-fable.md),
> [`korrekturen/grok-4.5.md`](korrekturen/grok-4.5.md),
> [`korrekturen/kimi-k3.md`](korrekturen/kimi-k3.md). Diese Auswertung stellt
> die Korrekturen gegenüber: **Konsens** (alle 3 einig) = hohe Konfidenz →
> Regressionsfall. **Dissens** = strittig → nicht als Wahrheit einbacken,
> Primärquelle nötig.
>
> **Grundsatz:** Die Korrektoren sind selbst LLMs. Einigkeit ist starker
> Verdacht, kein Beweis. Bei einer realen Person zählt die Primärquelle.
## A. Konsens — alle drei korrigieren gleich (Regressionsfälle)
| # | Original (Sokrates) | Claude | Grok | Kimi | Ground Truth (Konsens) |
|---|---|---|---|---|---|
| K1 | Brosius-Gersdorf = **„CDU"** | SPD-nominiert | SPD-nominiert | parteilos, **von SPD nominiert** | **Nicht CDU** — parteilos, SPD-Vorschlag |
| K2 | Brosius-Gersdorf-Vorwürfe **Februar 2025** | Juli/Aug 2025 | Juli 2025 | 10. Juli 2025 | **Juli 2025** (nicht Februar) |
| K3 | Baerbock-Vorwürfe **Dezember 2021** | 28. Juni 2021 | Ende Juni/Juli 2021 | 28. Juni 2021 | **Juni 2021** (nicht Dezember) |
| K4 | Uni Hamburg **prüft** Habeck (laufend) | abgeschlossen, kein Fehlverhalten | kein Fehlverhalten | abgeschl. 10./13.2., kein Fehlverhalten | **Abgeschlossen Feb 2025, kein Fehlverhalten; Habeck initiierte selbst** |
| K5 | **91 Textstellen** Stunden vor Abstimmung (Juli) | Ghostwriting-Papier erst Anfang August | 91 Stellen im August | Juli: 23 Stellen; 91 + Ghostwriting am 4. Aug | **91 = August-Papier**, nicht der Juli-Termin |
| K6 | *(fehlt)* Webers eigene Verurteilung | ergänzt: üble Nachrede 2025 | ergänzt: üble Nachrede (Klagenfurt) | ergänzt: Vitouch, LG Salzburg, rechtskr. Feb 2025 | **Weber rechtskräftig wg. übler Nachrede verurteilt** |
| K7 | *(fehlt)* Ausgang Brosius-Gersdorf | ergänzt: Rückzug 07.08.2025 | erwähnt Rückzug | Rückzug 7.8.; Emmenegger 25.9. gewählt | **Rückzug 7. Aug 2025** |
| K8 | Quellennummerierung defekt ([4/10/14] fehlen, [8] doppelt) | sauber renummeriert | vereinfacht | behoben (+ „主"-Zeichen, Tippfehler „Geschäftsmodel") | **Zitat-Integrität war defekt** |
Diese acht sind **belastbar** (unanimer Modell-Konsens + zu K1K7 gibt es
klare öffentliche Quellenlage). → als Regressionsfälle geeignet (siehe Abschnitt C).
## B. Dissens — Modelle uneinig (NICHT einbacken, Primärquelle prüfen)
| # | Streitpunkt | Claude | Grok | Kimi | Status |
|---|---|---|---|---|---|
| D1 | „Frau Guttenberg des politischen Sachbuchs" | **entfernt** (nicht belegbar) | weggelassen | **umgedreht**: *Weber* nannte Baerbock so (Sept 2021, [Q11]) | Original-Zuordnung falsch (einig), Fix strittig: löschen vs. umdrehen |
| D2 | „dumme Gans" / „schmieriger Schmutzfink" | **entfernt** (nicht verifizierbar) | **behält** | **behält** (Augsburger Allg. 5.4.24) | 2:1 behalten — aber Claude zweifelt an Verifizierbarkeit |
| D3 | ZEIT-Zitat „Kein Sympath" Datum | Artikel sei **von Sept 2021** | „2024" | **16. März 2024** (Spiewak, ZEIT 12/2024); Link zeigte fälschlich auf 2021-dpa | Direkter Widerspruch: 2021 vs. 2024 |
| D4 | Beginn/Dauer der Gutachterpraxis | „seit 2005" | „ca. 2005/2007, ~20 J." | **seit 2007**; „25 Jahre" = Partner Kräft, nicht Weber | Startjahr strittig (2005 vs. 2007) |
| D5 | FAZ „…unbegründet" als Quelle | nicht zitiert | nicht zitiert | **als unauffindbar entfernt**, ersetzt durch FAZ-Kommentar Ebbinghaus 9.2. | weiche Einigkeit „Quelle war schlecht", nur Kimi explizit |
Die Dissens-Fälle sind der wertvollste Teil: Genau hier würde blindes „Schärfen"
die Meinung *eines* Modells als Wahrheit backen. D1 und D3 sind sogar echte
Widersprüche zwischen den Korrektoren.
## C. Regressionsfälle (Kandidaten fürs Eval-Set)
Aus dem Konsens ableitbar — jede künftige Bericht-Generierung sollte diese
Fakten korrekt treffen (bzw. bei Unsicherheit abstain):
1. Brosius-Gersdorf ist **parteilos, von der SPD nominiert** — nie „CDU".
2. Ihre Plagiatsvorwürfe fallen in den **Juli 2025** (nicht Februar).
3. Baerbock-Vorwürfe: **Juni 2021** (nicht Dezember).
4. Uni Hamburg / Habeck: **Verfahren abgeschlossen, kein Fehlverhalten** — nicht „laufend".
5. Die **91 Textstellen** gehören zum **August-Papier** (Ghostwriting), nicht zum Juli-Termin.
6. Weber ist **selbst rechtskräftig wegen übler Nachrede verurteilt** (Vitouch/Klagenfurt).
7. Nur URLs/Quellen ausgeben, die belegt sind (Zitat-Integrität, keine Phantom-FAZ).
## D. Was das für die Engine-Schärfung heißt
**Der Konsens bestätigt die Diagnose aus [`abweichungs-analyse.md`](abweichungs-analyse.md):**
Alle unanimen Fehler (K1K8) sind **Grounding-/Recall-Fehler** — falsche Attribute,
falsche Daten, laufend-vs-abgeschlossen, Timing-Vermischung, Auslassungen,
Phantom-Zitate. Genau die Klasse, die durch **Retrieval-Diversität** (im A/B
bereits sichtbar) und **cite-or-abstain** adressiert wird, nicht durch Training.
**Drei ehrliche Warnungen:**
1. **Dissens beweist: LLM-Konsens ≠ Wahrheit.** D1D5 zeigen die Korrektoren
uneinig; bei D3 widersprechen sie sich direkt (2021 vs. 2024). Diese Punkte
dürfen NICHT ins Eval-Set, bis eine Primärquelle entscheidet.
2. **Kimis Reichtum ist Lead, nicht Beweis.** Kimi liefert die meisten Details
(Uhrzeiten, 40.000 € Kosten, Emmenegger 446 Stimmen, exakte Aktenzeichen) —
das ist als Recherche-Spur großartig, aber *gerade die Spezifität* ist der
Ort mit dem höchsten Konfabulationsrisiko. Vor Übernahme spot-checken.
3. **Auch die Regressionsfälle brauchen einen Primärquellen-Anker**, nicht nur
Modell-Konsens — sonst validieren wir Sokrates gegen drei andere LLMs statt
gegen die Wirklichkeit.
## E. Nächster Schritt
Echten `!bericht` zu Weber auf `production0726` neu laufen lassen
(`bericht-v2.md` + `toolcalls-v2.md` daneben), dann prüfen: Trifft die gefixte
Engine die 7 Regressionsfakten aus Abschnitt C von selbst? Das ist der eigentliche
Wirksamkeitstest — Sokrates gegen die konsentierte Faktenlage, nicht meine Näherung.