Weber: Drei-Wege-Konsens-Auswertung + Korrektur-Dateinamen geglättet
- weber/konsens-auswertung.md: Claude/Grok/Kimi-Korrekturen gegenübergestellt
* A. Konsens (8 Regressionsfälle, alle 3 einig): CDU->SPD, Feb->Juli,
Dez->Juni, Uni-Hamburg abgeschlossen, 91-Stellen=August, Webers eigene
Verurteilung, BG-Rückzug, Zitat-Integrität
* B. Dissens (5, strittig, nicht einbacken): 'Frau Guttenberg', 'dumme Gans',
ZEIT-Datum 2021-vs-2024 (direkter Widerspruch!), Startjahr, Phantom-FAZ
* C. 7 Regressionsfakten fürs Eval-Set
* D. Meta: Konsens bestätigt Grounding-Diagnose; LLM-Konsens != Wahrheit;
Kimis Spezifität = Lead nicht Beweis
- Korrektur-Dateinamen -> claude-fable.md / grok-4.5.md / kimi-k3.md
- README: konsens-auswertung.md in Struktur ergänzt
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
parent
52801e17eb
commit
01b46b15b1
4 changed files with 84 additions and 0 deletions
|
|
@ -13,6 +13,7 @@ Gefühl.
|
|||
bericht.md # der Original-Bericht der Engine
|
||||
toolcalls.md # dokumentierte Tool-Aufrufe (Recherche-Spur)
|
||||
abweichungs-analyse.md # Faktentreue/Grounding-Befunde (Typ + Konfidenz) + A/B
|
||||
konsens-auswertung.md # Modell-Korrekturen gegenübergestellt: Konsens vs. Dissens
|
||||
korrekturen/ # Korrektur-Fassungen durch mehrere Modelle
|
||||
<modell>.md
|
||||
```
|
||||
|
|
|
|||
83
weber/konsens-auswertung.md
Normal file
83
weber/konsens-auswertung.md
Normal file
|
|
@ -0,0 +1,83 @@
|
|||
# Konsens-Auswertung — Weber-Bericht
|
||||
|
||||
> 24.07.2026. Drei unabhängige Modelle haben den Sokrates-Originalbericht
|
||||
> korrigiert: [`korrekturen/claude-fable.md`](korrekturen/claude-fable.md),
|
||||
> [`korrekturen/grok-4.5.md`](korrekturen/grok-4.5.md),
|
||||
> [`korrekturen/kimi-k3.md`](korrekturen/kimi-k3.md). Diese Auswertung stellt
|
||||
> die Korrekturen gegenüber: **Konsens** (alle 3 einig) = hohe Konfidenz →
|
||||
> Regressionsfall. **Dissens** = strittig → nicht als Wahrheit einbacken,
|
||||
> Primärquelle nötig.
|
||||
>
|
||||
> **Grundsatz:** Die Korrektoren sind selbst LLMs. Einigkeit ist starker
|
||||
> Verdacht, kein Beweis. Bei einer realen Person zählt die Primärquelle.
|
||||
|
||||
## A. Konsens — alle drei korrigieren gleich (Regressionsfälle)
|
||||
|
||||
| # | Original (Sokrates) | Claude | Grok | Kimi | Ground Truth (Konsens) |
|
||||
|---|---|---|---|---|---|
|
||||
| K1 | Brosius-Gersdorf = **„CDU"** | SPD-nominiert | SPD-nominiert | parteilos, **von SPD nominiert** | **Nicht CDU** — parteilos, SPD-Vorschlag |
|
||||
| K2 | Brosius-Gersdorf-Vorwürfe **Februar 2025** | Juli/Aug 2025 | Juli 2025 | 10. Juli 2025 | **Juli 2025** (nicht Februar) |
|
||||
| K3 | Baerbock-Vorwürfe **Dezember 2021** | 28. Juni 2021 | Ende Juni/Juli 2021 | 28. Juni 2021 | **Juni 2021** (nicht Dezember) |
|
||||
| K4 | Uni Hamburg **prüft** Habeck (laufend) | abgeschlossen, kein Fehlverhalten | kein Fehlverhalten | abgeschl. 10./13.2., kein Fehlverhalten | **Abgeschlossen Feb 2025, kein Fehlverhalten; Habeck initiierte selbst** |
|
||||
| K5 | **91 Textstellen** Stunden vor Abstimmung (Juli) | Ghostwriting-Papier erst Anfang August | 91 Stellen im August | Juli: 23 Stellen; 91 + Ghostwriting am 4. Aug | **91 = August-Papier**, nicht der Juli-Termin |
|
||||
| K6 | *(fehlt)* Webers eigene Verurteilung | ergänzt: üble Nachrede 2025 | ergänzt: üble Nachrede (Klagenfurt) | ergänzt: Vitouch, LG Salzburg, rechtskr. Feb 2025 | **Weber rechtskräftig wg. übler Nachrede verurteilt** |
|
||||
| K7 | *(fehlt)* Ausgang Brosius-Gersdorf | ergänzt: Rückzug 07.08.2025 | erwähnt Rückzug | Rückzug 7.8.; Emmenegger 25.9. gewählt | **Rückzug 7. Aug 2025** |
|
||||
| K8 | Quellennummerierung defekt ([4/10/14] fehlen, [8] doppelt) | sauber renummeriert | vereinfacht | behoben (+ „主"-Zeichen, Tippfehler „Geschäftsmodel") | **Zitat-Integrität war defekt** |
|
||||
|
||||
Diese acht sind **belastbar** (unanimer Modell-Konsens + zu K1–K7 gibt es
|
||||
klare öffentliche Quellenlage). → als Regressionsfälle geeignet (siehe Abschnitt C).
|
||||
|
||||
## B. Dissens — Modelle uneinig (NICHT einbacken, Primärquelle prüfen)
|
||||
|
||||
| # | Streitpunkt | Claude | Grok | Kimi | Status |
|
||||
|---|---|---|---|---|---|
|
||||
| D1 | „Frau Guttenberg des politischen Sachbuchs" | **entfernt** (nicht belegbar) | weggelassen | **umgedreht**: *Weber* nannte Baerbock so (Sept 2021, [Q11]) | Original-Zuordnung falsch (einig), Fix strittig: löschen vs. umdrehen |
|
||||
| D2 | „dumme Gans" / „schmieriger Schmutzfink" | **entfernt** (nicht verifizierbar) | **behält** | **behält** (Augsburger Allg. 5.4.24) | 2:1 behalten — aber Claude zweifelt an Verifizierbarkeit |
|
||||
| D3 | ZEIT-Zitat „Kein Sympath" Datum | Artikel sei **von Sept 2021** | „2024" | **16. März 2024** (Spiewak, ZEIT 12/2024); Link zeigte fälschlich auf 2021-dpa | Direkter Widerspruch: 2021 vs. 2024 |
|
||||
| D4 | Beginn/Dauer der Gutachterpraxis | „seit 2005" | „ca. 2005/2007, ~20 J." | **seit 2007**; „25 Jahre" = Partner Kräft, nicht Weber | Startjahr strittig (2005 vs. 2007) |
|
||||
| D5 | FAZ „…unbegründet" als Quelle | nicht zitiert | nicht zitiert | **als unauffindbar entfernt**, ersetzt durch FAZ-Kommentar Ebbinghaus 9.2. | weiche Einigkeit „Quelle war schlecht", nur Kimi explizit |
|
||||
|
||||
Die Dissens-Fälle sind der wertvollste Teil: Genau hier würde blindes „Schärfen"
|
||||
die Meinung *eines* Modells als Wahrheit backen. D1 und D3 sind sogar echte
|
||||
Widersprüche zwischen den Korrektoren.
|
||||
|
||||
## C. Regressionsfälle (Kandidaten fürs Eval-Set)
|
||||
|
||||
Aus dem Konsens ableitbar — jede künftige Bericht-Generierung sollte diese
|
||||
Fakten korrekt treffen (bzw. bei Unsicherheit abstain):
|
||||
|
||||
1. Brosius-Gersdorf ist **parteilos, von der SPD nominiert** — nie „CDU".
|
||||
2. Ihre Plagiatsvorwürfe fallen in den **Juli 2025** (nicht Februar).
|
||||
3. Baerbock-Vorwürfe: **Juni 2021** (nicht Dezember).
|
||||
4. Uni Hamburg / Habeck: **Verfahren abgeschlossen, kein Fehlverhalten** — nicht „laufend".
|
||||
5. Die **91 Textstellen** gehören zum **August-Papier** (Ghostwriting), nicht zum Juli-Termin.
|
||||
6. Weber ist **selbst rechtskräftig wegen übler Nachrede verurteilt** (Vitouch/Klagenfurt).
|
||||
7. Nur URLs/Quellen ausgeben, die belegt sind (Zitat-Integrität, keine Phantom-FAZ).
|
||||
|
||||
## D. Was das für die Engine-Schärfung heißt
|
||||
|
||||
**Der Konsens bestätigt die Diagnose aus [`abweichungs-analyse.md`](abweichungs-analyse.md):**
|
||||
Alle unanimen Fehler (K1–K8) sind **Grounding-/Recall-Fehler** — falsche Attribute,
|
||||
falsche Daten, laufend-vs-abgeschlossen, Timing-Vermischung, Auslassungen,
|
||||
Phantom-Zitate. Genau die Klasse, die durch **Retrieval-Diversität** (im A/B
|
||||
bereits sichtbar) und **cite-or-abstain** adressiert wird, nicht durch Training.
|
||||
|
||||
**Drei ehrliche Warnungen:**
|
||||
|
||||
1. **Dissens beweist: LLM-Konsens ≠ Wahrheit.** D1–D5 zeigen die Korrektoren
|
||||
uneinig; bei D3 widersprechen sie sich direkt (2021 vs. 2024). Diese Punkte
|
||||
dürfen NICHT ins Eval-Set, bis eine Primärquelle entscheidet.
|
||||
2. **Kimis Reichtum ist Lead, nicht Beweis.** Kimi liefert die meisten Details
|
||||
(Uhrzeiten, 40.000 € Kosten, Emmenegger 446 Stimmen, exakte Aktenzeichen) —
|
||||
das ist als Recherche-Spur großartig, aber *gerade die Spezifität* ist der
|
||||
Ort mit dem höchsten Konfabulationsrisiko. Vor Übernahme spot-checken.
|
||||
3. **Auch die Regressionsfälle brauchen einen Primärquellen-Anker**, nicht nur
|
||||
Modell-Konsens — sonst validieren wir Sokrates gegen drei andere LLMs statt
|
||||
gegen die Wirklichkeit.
|
||||
|
||||
## E. Nächster Schritt
|
||||
|
||||
Echten `!bericht` zu Weber auf `production0726` neu laufen lassen
|
||||
(`bericht-v2.md` + `toolcalls-v2.md` daneben), dann prüfen: Trifft die gefixte
|
||||
Engine die 7 Regressionsfakten aus Abschnitt C von selbst? Das ist der eigentliche
|
||||
Wirksamkeitstest — Sokrates gegen die konsentierte Faktenlage, nicht meine Näherung.
|
||||
Loading…
Reference in a new issue