sokrates-qs/weber/konsens-auswertung.md
Claude Fable 5 (Sokrates-Team) 01b46b15b1 Weber: Drei-Wege-Konsens-Auswertung + Korrektur-Dateinamen geglättet
- weber/konsens-auswertung.md: Claude/Grok/Kimi-Korrekturen gegenübergestellt
  * A. Konsens (8 Regressionsfälle, alle 3 einig): CDU->SPD, Feb->Juli,
    Dez->Juni, Uni-Hamburg abgeschlossen, 91-Stellen=August, Webers eigene
    Verurteilung, BG-Rückzug, Zitat-Integrität
  * B. Dissens (5, strittig, nicht einbacken): 'Frau Guttenberg', 'dumme Gans',
    ZEIT-Datum 2021-vs-2024 (direkter Widerspruch!), Startjahr, Phantom-FAZ
  * C. 7 Regressionsfakten fürs Eval-Set
  * D. Meta: Konsens bestätigt Grounding-Diagnose; LLM-Konsens != Wahrheit;
    Kimis Spezifität = Lead nicht Beweis
- Korrektur-Dateinamen -> claude-fable.md / grok-4.5.md / kimi-k3.md
- README: konsens-auswertung.md in Struktur ergänzt

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-24 13:54:04 +02:00

6 KiB
Raw Permalink Blame History

Konsens-Auswertung — Weber-Bericht

24.07.2026. Drei unabhängige Modelle haben den Sokrates-Original­bericht korrigiert: korrekturen/claude-fable.md, korrekturen/grok-4.5.md, korrekturen/kimi-k3.md. Diese Auswertung stellt die Korrekturen gegenüber: Konsens (alle 3 einig) = hohe Konfidenz → Regressionsfall. Dissens = strittig → nicht als Wahrheit einbacken, Primärquelle nötig.

Grundsatz: Die Korrektoren sind selbst LLMs. Einigkeit ist starker Verdacht, kein Beweis. Bei einer realen Person zählt die Primärquelle.

A. Konsens — alle drei korrigieren gleich (Regressionsfälle)

# Original (Sokrates) Claude Grok Kimi Ground Truth (Konsens)
K1 Brosius-Gersdorf = „CDU" SPD-nominiert SPD-nominiert parteilos, von SPD nominiert Nicht CDU — parteilos, SPD-Vorschlag
K2 Brosius-Gersdorf-Vorwürfe Februar 2025 Juli/Aug 2025 Juli 2025 10. Juli 2025 Juli 2025 (nicht Februar)
K3 Baerbock-Vorwürfe Dezember 2021 28. Juni 2021 Ende Juni/Juli 2021 28. Juni 2021 Juni 2021 (nicht Dezember)
K4 Uni Hamburg prüft Habeck (laufend) abgeschlossen, kein Fehlverhalten kein Fehlverhalten abgeschl. 10./13.2., kein Fehlverhalten Abgeschlossen Feb 2025, kein Fehlverhalten; Habeck initiierte selbst
K5 91 Textstellen Stunden vor Abstimmung (Juli) Ghostwriting-Papier erst Anfang August 91 Stellen im August Juli: 23 Stellen; 91 + Ghostwriting am 4. Aug 91 = August-Papier, nicht der Juli-Termin
K6 (fehlt) Webers eigene Verurteilung ergänzt: üble Nachrede 2025 ergänzt: üble Nachrede (Klagenfurt) ergänzt: Vitouch, LG Salzburg, rechtskr. Feb 2025 Weber rechtskräftig wg. übler Nachrede verurteilt
K7 (fehlt) Ausgang Brosius-Gersdorf ergänzt: Rückzug 07.08.2025 erwähnt Rückzug Rückzug 7.8.; Emmenegger 25.9. gewählt Rückzug 7. Aug 2025
K8 Quellennummerierung defekt ([4/10/14] fehlen, [8] doppelt) sauber renummeriert vereinfacht behoben (+ „主"-Zeichen, Tippfehler „Geschäftsmodel") Zitat-Integrität war defekt

Diese acht sind belastbar (unanimer Modell-Konsens + zu K1K7 gibt es klare öffentliche Quellenlage). → als Regressionsfälle geeignet (siehe Abschnitt C).

B. Dissens — Modelle uneinig (NICHT einbacken, Primärquelle prüfen)

# Streitpunkt Claude Grok Kimi Status
D1 „Frau Guttenberg des politischen Sachbuchs" entfernt (nicht belegbar) weggelassen umgedreht: Weber nannte Baerbock so (Sept 2021, [Q11]) Original-Zuordnung falsch (einig), Fix strittig: löschen vs. umdrehen
D2 „dumme Gans" / „schmieriger Schmutzfink" entfernt (nicht verifizierbar) behält behält (Augsburger Allg. 5.4.24) 2:1 behalten — aber Claude zweifelt an Verifizierbarkeit
D3 ZEIT-Zitat „Kein Sympath" Datum Artikel sei von Sept 2021 „2024" 16. März 2024 (Spiewak, ZEIT 12/2024); Link zeigte fälschlich auf 2021-dpa Direkter Widerspruch: 2021 vs. 2024
D4 Beginn/Dauer der Gutachterpraxis „seit 2005" „ca. 2005/2007, ~20 J." seit 2007; „25 Jahre" = Partner Kräft, nicht Weber Startjahr strittig (2005 vs. 2007)
D5 FAZ „…unbegründet" als Quelle nicht zitiert nicht zitiert als unauffindbar entfernt, ersetzt durch FAZ-Kommentar Ebbinghaus 9.2. weiche Einigkeit „Quelle war schlecht", nur Kimi explizit

Die Dissens-Fälle sind der wertvollste Teil: Genau hier würde blindes „Schärfen" die Meinung eines Modells als Wahrheit backen. D1 und D3 sind sogar echte Widersprüche zwischen den Korrektoren.

C. Regressionsfälle (Kandidaten fürs Eval-Set)

Aus dem Konsens ableitbar — jede künftige Bericht-Generierung sollte diese Fakten korrekt treffen (bzw. bei Unsicherheit abstain):

  1. Brosius-Gersdorf ist parteilos, von der SPD nominiert — nie „CDU".
  2. Ihre Plagiatsvorwürfe fallen in den Juli 2025 (nicht Februar).
  3. Baerbock-Vorwürfe: Juni 2021 (nicht Dezember).
  4. Uni Hamburg / Habeck: Verfahren abgeschlossen, kein Fehlverhalten — nicht „laufend".
  5. Die 91 Textstellen gehören zum August-Papier (Ghostwriting), nicht zum Juli-Termin.
  6. Weber ist selbst rechtskräftig wegen übler Nachrede verurteilt (Vitouch/Klagenfurt).
  7. Nur URLs/Quellen ausgeben, die belegt sind (Zitat-Integrität, keine Phantom-FAZ).

D. Was das für die Engine-Schärfung heißt

Der Konsens bestätigt die Diagnose aus abweichungs-analyse.md: Alle unanimen Fehler (K1K8) sind Grounding-/Recall-Fehler — falsche Attribute, falsche Daten, laufend-vs-abgeschlossen, Timing-Vermischung, Auslassungen, Phantom-Zitate. Genau die Klasse, die durch Retrieval-Diversität (im A/B bereits sichtbar) und cite-or-abstain adressiert wird, nicht durch Training.

Drei ehrliche Warnungen:

  1. Dissens beweist: LLM-Konsens ≠ Wahrheit. D1D5 zeigen die Korrektoren uneinig; bei D3 widersprechen sie sich direkt (2021 vs. 2024). Diese Punkte dürfen NICHT ins Eval-Set, bis eine Primärquelle entscheidet.
  2. Kimis Reichtum ist Lead, nicht Beweis. Kimi liefert die meisten Details (Uhrzeiten, 40.000 € Kosten, Emmenegger 446 Stimmen, exakte Aktenzeichen) — das ist als Recherche-Spur großartig, aber gerade die Spezifität ist der Ort mit dem höchsten Konfabulationsrisiko. Vor Übernahme spot-checken.
  3. Auch die Regressionsfälle brauchen einen Primärquellen-Anker, nicht nur Modell-Konsens — sonst validieren wir Sokrates gegen drei andere LLMs statt gegen die Wirklichkeit.

E. Nächster Schritt

Echten !bericht zu Weber auf production0726 neu laufen lassen (bericht-v2.md + toolcalls-v2.md daneben), dann prüfen: Trifft die gefixte Engine die 7 Regressionsfakten aus Abschnitt C von selbst? Das ist der eigentliche Wirksamkeitstest — Sokrates gegen die konsentierte Faktenlage, nicht meine Näherung.