Thema:
KI: So kann die Genauigkeit der KI durch den Fragesteller massiv erhöht werden
Am: 20.09.2026 09:57:17
Gelesen: 722
# 1
Ich habe der Google KI (Gemeni) die Frage gestellt:
Wie gut und sicher arbeitet eine KI qualitativ, wenn gute und ausreichend umfassende Fragen gestellt werden?
Antwort: Dazu gibt es mittlerweile zahlreiche wissenschaftliche Studien und empirische Belege. Die eindeutige Kernbotschaft der Forschung lautet: Die Qualität, Genauigkeit und sachliche Sicherheit von KI-Antworten steigt drastisch, wenn die Fragen (Prompts) präzise, kontextreich und strukturiert formuliert sind.
Dennoch bleibt selbst bei perfekten Fragen ein technologisches Restrisiko für Fehler bestehen.
Wissenschaftliche Untersuchungen und Frameworks zeigen, wie stark die Fragequalität das Ergebnis beeinflusst:
1. Massive Steigerung der Genauigkeit durch Struktur
• Präzise vs. vage Fragen: Eine Studie zu akademischen Lernaufgaben zeigte, dass vage, explorative Fragen nur in 26 % der Fälle Klarheit und Relevanz brachten. Präzise und umfassende Prompts erzielten hingegen eine Klarheitsrate von 84 % und lieferten exakte, fehlerfreie Schritt-für-Schritt-Anleitungen.
• Schrittweises Denken (Chain-of-Thought): Wenn man einer KI in der Frage vorgibt, „schrittweise zu denken“ und den Lösungsweg zu begründen, steigt die Logik- und Antwortqualität bei komplexen Aufgaben (z. B. in der Medizin oder Statistik) nachweislich an. In medizinischen Diagnosetests erreichte die KI mit solchen logisch aufgebauten Prompts eine Top-3-Genauigkeit von 82 %.
2. Warum umfassende Fragen die „Sicherheit“ erhöhen
Große Sprachmodelle (LLMs) arbeiten mit statistischen Wahrscheinlichkeiten. Fehlt Kontext, fängt die KI an zu „raten“ (halluzinieren), um den Satz sinnvoll zu vervollständigen.
• Kontext blockiert Fehler: Wenn Sie eine Frage mit ausreichend Hintergrundwissen, der genauen Zielgruppe und dem gewünschten Ausgabeformat füttern, engen Sie den mathematischen Spielraum der KI ein. Sie hat weniger Platz für Fehlinterpretationen.
• Quellen-Anker: Studien zeigen: Wenn Sie die KI im Prompt explizit anweisen, sich nur auf mitgelieferte Dokumente oder verifizierte Fakten zu stützen und vorab Zitate zu extrahieren, sinkt die Halluzinationsrate gegen Null.
3. Die Grenzen: Warum es keine 100%ige Sicherheit gibt
Auch bei perfekter Fragestellung warnen Experten vor blindem Vertrauen:
• Die 95%-Regel: In der Praxis geht man bei hochentwickelten Systemen von einer maximalen Genauigkeit von rund 95 % aus. Die restlichen 5 % können trotz exzellentem Prompt Fehler, veraltete Daten oder Logikdreher enthalten.
• Sprachliche Verzerrung: Studien zeigen, dass die KI-Sicherheit auch von der Sprache abhängt. Prompts in fehlerfreiem US-Englisch liefern global betrachtet noch immer die statistisch stabilsten und präzisesten Ergebnisse.
Fazit: Ein umfassender, guter Prompt ist wie eine präzise Arbeitsanweisung an einen fähigen Assistenten. Er hebt die Qualität von „brauchbar“ auf „exzellent“. Dennoch ist ein abschließender menschlicher Qualitätscheck (Faktenprüfung) bei wichtigen Themen unerlässlich.
Am: 20.09.2026 14:18:52
Gelesen: 618
# 2
Hallo Richard,
bei den inzwischen zahlreichen KI-Threads muss ich immer öfter an die Diskussionen über die Entwicklung neuer Kraftfahrzeuge bzw. Komponenten während meiner aktiven Zeit als Kfz-Techniker und Konstrukteur denken.
Die einen diskutieren noch ausführlich über Motorleistung, Verbrauch, Bremsweg und mögliche technische Grenzen, während andere längst mit den Erlkönigen unterwegs sind und dabei ihre eigenen praktischen Erfahrungen sammeln. Die dabei gewonnenen Erkenntnisse werden nach jeder Fahrt genauestens unter die Lupe genommen, ausgewertet und überprüft - einschließlich einer anschließenden Qualitätskontrolle.
Natürlich sind theoretische Überlegungen interessant und wichtig. Aber irgendwann wird ebenso interessant, was sich bei der tatsächlichen Anwendung beobachten lässt.
Und genau da kann ich inzwischen auf eigene Erfahrungen zurückgreifen. Ich habe für mich festgestellt, dass sich die Qualität und Nutzbarkeit der Ergebnisse durch klare Vorgaben, ausreichend Kontext und eine anschließende fachliche Kontrolle tatsächlich deutlich beeinflussen lassen.
Insofern finde ich den von Dir eingestellten Gemini-Text durchaus interessant. Die grundsätzliche Aussage deckt sich jedenfalls mit dem, was ich selbst in der praktischen Arbeit mit KI beobachtet habe.
Die konkreten Prozentangaben und insbesondere die erwähnte „95-%-Regel“ würde ich allerdings mit einer gewissen Vorsicht betrachten, solange dafür keine nachvollziehbaren Quellen genannt werden.
Besonders treffend finde ich deshalb folgenden Gedanken:
„Ein LLM beantwortet nicht nur die Frage, sondern auch die Interpretation der Frage. Je besser Aufgabe, Kontext, Quellen, Randbedingungen und gewünschtes Ergebnis spezifiziert sind, desto weniger Interpretationsarbeit muss das Modell selbst übernehmen.“
Das entspricht ziemlich genau meiner bisherigen praktischen Erfahrung.
Viele Grüße Post-Bote
Am: 21.09.2026 09:39:11
Gelesen: 478
# 3
Nur so als Beispiel die sinngemäßen Antworten der Google-KI bezüglich einer Firmenlochung in einer DR-Marke(!):
- Die Lochung ist im niederländischen Perfin-Katalog (sogar mit Link dazu) dem Unternehmen xy aus Amsterdam zugeordnet.
Auf meine Ergänzung, dass ich den Katalog besitze, diese Lochung aber genausowenig enthalten ist wie das Unternehmen, kam Folgendes retour:
Das stimmt, es gibt die Lochung gar nicht, da habe ich falsche Schlüsse gezogen.
Nächste Frage: Aber für das Unternehmen hast du doch sicher Quellen.
Nein, das von mir genannte Unternehmen ist in keinem Verzeichnis zu finden.
Solange die KI dermaßen halluziniert und mögliche bzw. sogar unmögliche Ergebnisse als verlässliche Wahrheit präsentiert, sollte man sie mit absoluter Vorsicht genießen.
Am: 21.09.2026 10:27:05
Gelesen: 448
# 4
@ Perfin Fan [#3]
Du hast etwas vergessen: Den exakten Text in Deiner Fragestellung und welche KI Du verwendest. Da die meisten KI Frage und Antwort den Text speichern, kannst Du das vermutlich nachholen.
Noch besser wäre, den gesamten Dialog mit der KI zu zeigen.
Grüsse, Richard
Am: 21.09.2026 13:16:46
Gelesen: 400
# 5
@ Richard [#4]
Es wurde ein Bild mit der Bitte um Identifizierung in der KI-Funktion bei Google hochgeladen.
Und hier sollte die KI so weit sein, zuzugeben, dass ihr das zu schwer oder es prinzipiell nicht möglich ist, anstatt zu halluzinieren und sich irgendwas komplett Sinnbefreites zusammenzureimen.
Ich arbeite täglich mit KI und dieses Halluzinieren hat leider System, ebenso wie das Ignorieren von User-Vorgaben. Man darf sich - wie exakt auch immer die Fragestellung ist - zurzeit noch nie auf die Antwort verlassen.
Am: 21.09.2026 14:07:55
Gelesen: 386
# 6
@ Perfin Fan [#5]
"Man darf sich - wie exakt auch immer die Fragestellung ist - zurzeit noch nie auf die Antwort verlassen."
Hallo liebe "KI-Freunde",
diese Aussage ist leider zu 100 % richtig und die sollte man jedem KI-Fan "eintätowieren". ;-)
Es gibt da ein schon etwas älteres, noch aus der analogen Zeit stammendes Sprichwort "Trau keiner Statistik die du nicht selbst gefälscht hast". Sinngemäß kann man das durchaus auf die KI übertragen: "Trau nur dem von dir selbst entwickelten KI-System - und habe den Kill-Switch immer griffbereit". Auch bei einer kontrollierten KI kann es vorkommen, besser ist es schon passiert, dass sich diese selbständig macht und z.B. ihre eigenen Weisheiten ins Netz stellt um damit später eigene, erfundene (halluzinierte) Antworten zu belegen. Nur sind sich dessen leider immer mehr Nutzer nicht bewusst. Viele heutige, junge und aufstrebende Techniker, Analysten, ITler usw. kennen nur noch die KI und vertrauen ihr. Dies ist fatal und kann böse Folgen haben. Manchmal kommt dazu etwas ans Tagelicht, an die Öffentlichkeit wie kürzlich ein fast kriegsaulösender Zwischenfall USA-China durch Vertrauen auf KI. Ein erfahrener Geheimdienstanalyst meinte dazu nur "KI ermöglicht es einem schneller zu einer schlechten Idee zu gelangen."
Was wirklich noch alles passiert und wie oft auch durch KI ausgelöste Verfahren schief gehen, darüber erfährt die Öffentlichkeit nur sehr wenig. Aber vielleicht wachen endlich auch die Verantwortlichen auf und beginnen diese Systeme verantwortungsvoll zu kontrollieren. Aber ich fürchte, insbesondere mit Blick auf "Trump-USA" und vor allem China, dass es bereits zu spät ist.
Natürlich kann die KI viel Arbeit schneller erledigen und bis zu einem gewissen Mass auch ersetzen. Aber wer garantiert mir denn, dass dies alles auch richtig ist? Weiß ich ob das Endprodukt, wenn ich selbst keine oder nur wenig Ahnung davon habe, richtig ist und zum Erfolg führt?
In Bezug auf die Philatelie zweifle ich jedes KI-Ergebnis erst mal an. Ich kenne nur einen einzigen Menschen, der selbst dabei ist eine philatelistische KI aufzubauen und die ist nicht öffentlich zugänglich.
Dies nur ein paar kritische Gedanken zum immer mehr ausufernden KI-Hype.
Nachdenkliche Grüße,
Peter
Am: 21.09.2026 14:44:51
Gelesen: 369
# 7
@ Post-Bote [#2]
Das ist doch hier ganz genau der Punkt bzw. das "Problem". Für einen "Wissenden", der das Thema gut kennt, präzise genug Fragen stellen kann - mit Kontext - und Antworten auch entsprechend korrekt einordnen kann, ist die KI bereits jetzt schon ein relativ gutes Tool, um eine "unterstützende Hilfe" zu erhalten. Ja.
Insbesondere, wenn die KI als Datengrundlage auf ein komplett "geschlossenes" System zugreift (siehe TeeKays-Beispielanwendung, in dem er die KI nur seine eigene "gute Literatur" nutzen lässt), d.h. die Datengrundlage ist "gut" inhaltlich vorgefiltert und entsprechend ausreichend verifiziert (bzw. diese kann entsprechend vom User eingeordnet werden) - im Gegensatz zu einem "offenen" System aus dem Netz, bei dem die KI durch irgendwelche, mehr oder weniger "gute" Quellen, durch wahllos ausgewählte Texte aus dem Internet und Sonstwo angelernt wurde. Je kleiner dann hier die Themen-Nische ist, desto weniger ein schwarmwissenähnliches, allgemein-breites, gut bearbeitetes Wissen abgedeckt wird, desto sinnbefreiter sind Antworten.
Problematisch wird es halt dann, wenn ein "Aussenstehender" etwas zu etwas eigentlich (für den Fragesteller) Unbekannten wissen will. Der kann naturgemäß keine präzise Fragen mit entsprechendem Kontext stellen. Wenn dann die Nische bzw. die Anlernbasis problematisch ist, der Fragesteller die Antwort auch nicht korrekt beurteilen kann: Problem bis Volksverdummung. Wenn dann die KI auch noch die Fragen/Antworten für spätere Anfragen speichert, buddelt sich die KI immer stärker in ihre Halluzinationsblase ein.
Das Problem ist der User und der Mensch ist nun mal gerne faul, heißt er lässt sich nur all zu gerne Arbeit abnehmen und übernimmt dann auch ohne wirklich Nachzudenken - viel zu schnell - was die KI liefert, besonders wenn es "gut" wirkt. Wenn dann der User auch 'nur' noch KI kennt, mit KI groß wird, die Welt davor nicht mehr kannte, dann wird die KI zum "Social Media-Problem" Zwei Punkt Null.
Das gilt zumindest (hier im Thema) für den KI-Einsatz als "Googleersatz". Google war selbst für Unwissende hier im Vergleich ja noch ein richtig ideales Tool. Hier musste der Fragesteller immer noch die Suchergebnisse aufrufen, selbst (!) durchlesen und selbst (!) einordnen, im Idealfall lag man dann mit der Beurteilung relativ richtig. Mit entsprechend ausreichender Erfahrung vieler Jahre des Googlens konnte man so eigentlich immer recht gut die Qualität der "Quelle" erkennen, selbst bei Unbekannten. Im Gegensatz zu KI-Antworten, die ja üblicherweise immer gleichartig glaubwürdig und seriös klingen, insbesondere da selbst die in den Antworten verlinkten URL-Quellen 'nach Jahren' oftmals keinen unmittelbaren Bezug mehr auf die Antworten haben. Und ganz schlimm wird es, wenn der Wissensstand zum Zeitpunkt der Anlernung inzwischen disktutiert oder gar bereits überholt ist - und man dann keine entsprechenden Googleergebnisse zum Diskurs angeboten bekommt.
Wie auch TeeKays Beispiel gezeigt hat, die KI ist - als Werkzeug - technisch inzwischen relativ gut, inzwischen auch für Frage/Antwort-Spielchen, entscheidend ist hier aber die Anlernbasis bzw. der Datenpool auf dem zugegriffen wird. Wenn dann der User weiss, was er tut und das Thema gut genug kennt: Supi...
Ansonsten gilt hier (außer zur Unterstützung bei der Quellensuche) immer noch "Finger weg", es sei denn ich frage nach durchgesetztem Allgemeinwissen, à la 'Wieviel Zentimeter hat ein Meter?'. Dann darf man der KI ausnahmsweise auch mal Glauben schenken ;-)
Und zum Thema Zeitersparnis: Ich erinnere mich noch an einen KI-Beitrag auf ARTE vor ein paar Wochen, da sagte ein interviewter, wichtiger Mathematiker, KI kostet mehr Zeit, als sie einspart, denn er muss jeden Schritt im Nachgang zusätzlich "händisch" verifizieren ... ;-)
Beste Grüße
Thomas
Am: 21.09.2026 16:52:49
Gelesen: 317
# 8
@ DL8AAM [#7]
Genau aus diesem Grund setze ich KI fast ausschließlich zur Katalogisierung meiner eigenen Belege ein.
Ich arbeite dabei nicht mit einer einfachen Frage an ein frei arbeitendes System, sondern mit einer selbst entwickelten MASTER-VORLAGE, die mittlerweile rund 800 feste Regelzeilen umfasst.
Vereinfacht gesagt versuche ich den Interpretationsspielraum der KI möglichst stark einzuschränken. Nutzerangaben haben Vorrang vor der KI-Interpretation, nicht sichtbare Informationen dürfen nicht ergänzt werden und jede Auswertung wird anschließend kontrolliert.
Die KI ist in meinem Fall kein Prüfer, sondern ein strukturierender Katalogisierer.
Insofern deckt sich Deine Einschätzung durchaus mit meinen praktischen Erfahrungen. Je besser Fachwissen, Datengrundlage und Regelwerk sind, desto brauchbarer werden die Ergebnisse.
Grüße Post-Bote
Am: 21.09.2026 18:41:04
Gelesen: 283
# 9
Ein wesentliches Problem - und das habe ich auch erst in den vergangenen Wochen gelernt - ist der Irrglaube, ein LLM (= KI nach heutiger Lesart) wäre für alles zu gebrauchen, für alles nützlich und könnte Probleme lösen, die bisher unlösbar waren. Da ich zu Lochungen kein Material habe, würd ich das Beispiel abwandeln zu Briefmarken-Attesten. Diese zu lesen, zu katalogisieren, zu gruppieren und systematisch nutzbar zu machen, ist ebenso wenig eine originäre KI-Aufgabe wie die Identifikation von Lochungen. Ja, es gibt LLMs, die visuelle Encoder besitzen. Aber die erkennen, dass ein Foto einen Berg statt einen Hund zeigt - die erkennen weder Atteste noch Lochungen.
Wofür man KI nun einsetzen kann: Ein System entwickeln, das Atteste automatisch erkennt, gruppiert, systematisiert und sich selbst korrigiert. Und dabei sagt dann ein gutes KI-System selbst, dass man für die meisten Arbeitsschritte nicht nur kein LLM braucht, sondern sogar explizit keines einsetzen sollte. Weil es dafür einfach ungeeignet ist. Was das KI-System (in dem Fall Anthropic Opus 5) macht, ist mir einen Workflow zu bauen, das verschiedene Programme und LLM verknüpft, damit am Ende aus einem sowohl für einzelne Texterkennungsprogramme als auch einzelne Vision LLMs unlesbares Attest zu einem maschinenlesbaren Textkorpus wird, der dann von selbigem Workflow automatisch weiterverarbeitet wird, die extrahierten Informationen in eine Datenbank schreibt und auf Logikfehler prüft. Beim ganzen Prozess sind 2 Vision LLM beteiligt, die die von einer Texterkennung erkannten Texte verifizieren. Der ganze Rest ist keine KI-Arbeit, kein LLM.
Bei Lochungen würde man vermutlich genauso vorgehen. Für das Erkennen der Lochung ist ein LLM mMn absolut ungeeignet. Man kann vielleicht (!) ein Modell trainieren, um Lochungen zu erkennen. Aber andere Methoden sind mMn geeigneter und schneller. Die Lochung kann durch ihren immensen Kontrast zur umgebenden Marke sehr gut und einfach erkannt werden. Sie ist ein für den Computer deutlich sichtbares Punktraster. Wenn man dann eine Datenbank hat, in der schon bekannte Punktraster verzeichnet sind, ist das ein schneller Abgleich, der gänzlich ohne KI und LLM auskommt.
KI wurde also hier für etwas genutzt, wofür sie nicht genutzt werden kann - statt sie zu fragen, wie sie das Problem allein lösen würde.
Wie würde man KI für das Lochungs-Problem richtig einsetzen?
Frage:
" Ich würde gern ein Programm/Workflow bauen, mit dem ich Lochungen von Briefmarken erkennen kann, siehe Beispiel.
https://de.wikipedia.org/wiki/Lochung_(Philatelie)
Wie würdest du vorgehen, um die Lochungen zu erkennen und mit einer Datenbank bekannter Lochmuster abzugleichen? im Beispiel ist nicht eine Briefmarken zu sehen, sondern 12 Stück in 4 Reihen und 3 Spalten. Wir dürfen im Beispielbild also nicht die Zähnung zwischen den 12 Briefmarken mit der Lochung auf einer der Briefmarken verwechseln"
Dazu dann als Beispielbild das Bild aus Wikipedia.
Binnen 2,5 min kam von Claude Opus 5 folgende Ausgabe, nachdem Claude zunächst prüfte, welche Programme auf meinem Computer installiert sind oder installiert werden könnten:
Kurz vorweg, weil du das gerade nachgeschoben hast: ja, das Beispiel ist ein Viererblock-Verband mit 12 Marken (4 Reihen × 3 Spalten, darin zwei 5-Cent-Werte zwischen den 2-Cent-Marken). Das ist für den Entwurf sogar wichtig — und zwar aus zwei Gründen:
- Die Lochung wurde auf den **Bogen** gestanzt, nicht auf die Einzelmarke. Das Muster sitzt deshalb pro Marke unterschiedlich versetzt und ist am Markenrand teilweise abgeschnitten (siehe unten links). Deine Pipeline darf also nicht „zentriertes, vollständiges Muster" annehmen.
- Umgekehrt hast du bei einem Verband **12 Instanzen desselben Musters** — das ist geschenkte Redundanz: erkennen, aufeinander registrieren, per Voting mitteln. Aus 12 lückenhaften Beobachtungen wird ein sauberes Muster.
Ich habe das Beispielbild kurz angeschaut: [United_States_perfin_stamps.jpg](United_States_perfin_stamps.jpg) ist 472 × 721 px, also ~6–7 px/mm (≈170 dpi). Ein Lochdurchmesser von ~0,8 mm sind damit **5 Pixel**. Detektion geht gerade so, Gitteranpassung wird wackelig. Das ist direkt der wichtigste Hebel:
## 1. Aufnahme — hier entscheidet sich 80 %
- **Durchlicht statt Auflicht.** Flachbettscanner mit Durchlichteinheit oder ein LED-Leuchtpanel: dann sind die Löcher hell und das Markenbild verschwindet fast. Damit reduziert sich das schwere Problem („Punktmuster in einem gedruckten Porträt finden") auf das leichte („helle Punkte finden"). Zweitbeste Lösung: Auflicht auf mattschwarzer Unterlage, dann sind Löcher tiefschwarz.
- **1200 dpi, Graustufen, feste DPI protokollieren.** Bei 1200 dpi ist ein Loch ~40 px — Rundheit, Radius und Gitterabstand werden damit messbar statt geschätzt. Und du hast eine echte mm-Skala, ohne aus der Markengröße zurückrechnen zu müssen.
- Rückseiten-Scan ist auch eine Option (kein Motiv), liefert aber ein **gespiegeltes** Muster — muss im Matching abgefangen werden (siehe unten, 8 Orientierungen).
## 2. Segmentierung: Block → Einzelmarken
Die Zähnungslöcher am Rand sind dein Raster. Zeilen-/Spaltenprojektion der Kantenbilder (oder 2D-FFT / Autokorrelation) liefert die Periode und damit die Schnittlinien. Alternativ Vordergrund-Segmentierung gegen die Unterlage plus Hough-Linien.
Kritisch dabei: **Zähnung ≠ Firmenlochung.** Zähnungslöcher liegen auf geraden Linien mit konstantem Abstand am Markenrand, Perfin-Löcher liegen unregelmäßig innen. Erkenne die Zähnungsreihen explizit als kollineare, äquidistante Punktketten und entferne sie — pauschal „Randstreifen abschneiden" verlierst du sonst abgeschnittene Musteranteile.
## 3. Lochdetektion ( hier ist 0 LLM/KI mit bei, alles reine Bildbearbeitung)
- Beleuchtungskorrektur (großer Median-/Rolling-Ball-Hintergrund subtrahieren)
- Kandidaten per **Top-Hat mit lochgroßem Strukturelement** oder LoG-Blob-Detektion (`skimage.feature.blob_log`); Hough-Kreise sind bei der Größe zu unzuverlässig
- Filtern nach Radius, Rundheit, Kontrast
- Nützlicher Trick im Auflicht: Ein Loch zeigt die **Unterlagenfarbe in allen Kanälen gleich**, helle Motivstellen nicht. Sättigung bzw. Kanaldifferenz als Zusatzmerkmal schlägt reine Helligkeit deutlich.
Ergebnis: eine Punktliste in mm, nicht in Pixeln.
## 4. Gitteranpassung — das ist der eigentliche Kniff
Perfin-Löcher liegen auf einem regelmäßigen Nadelraster (Teilung typisch um 1 mm), und genau so werden Muster auch katalogisiert. Wenn du die Punktwolke auf ein Integer-Gitter quantisierst, wird aus dem unscharfen Bildproblem ein **exakter, diskreter Vergleich**:
1. Paar-Differenzvektoren naher Nachbarn sammeln → Clustern/Histogramm → zwei Basisvektoren (inkl. kleiner Rotation)
2. Verfeinern per RANSAC über eine Ähnlichkeitstransformation
3. Punkte auf `(Zeile, Spalte)` runden → **binäre Matrix**
Diese Matrix ist dein Fingerabdruck: unabhängig von Scanauflösung, Papierschrumpfung und leichter Schieflage. Wenn zu wenige Punkte für ein stabiles Gitter da sind, fällst du auf direktes Punktwolken-Matching zurück (unten).
## 5. Datenbank
Schema etwa: `pattern_id, katalog, katalog_code, firma, land, zeitraum, gitter (Zeilenstrings "01101…"), loch_anzahl, bbox_zeilen, bbox_spalten, belegbilder, quelle, lizenz`. SQLite reicht bis weit über 100.000 Muster.
Zur Datenbeschaffung, ehrlich gesagt der heikelste Punkt: **Perfin-Kataloge sind urheberrechtlich geschützt**, Scrapen ist keine tragfähige Grundlage. Realistisch ist, die DB aus deinen eigenen Belegen aufzubauen und mit Arbeitsgemeinschaften / der Perfin Society über Datennutzung zu sprechen. Das heißt: Das **Erfassungswerkzeug ist Teil des Programms**, nicht nachgelagert — Bild rein, Gitter raus, Mensch vergibt Code und Firma.
## 6. Matching wieder keine KI dabei
Zweistufig, damit es auch bei großer DB schnell bleibt:
- **Vorfilter** über billige Invarianten: Lochanzahl (±Toleranz), Gitter-Bounding-Box, Löcher-pro-Zeile-Profil → invertierter Index
- **Feinscore**: über alle **8 Dieder-Transformationen** (4 Rotationen × Spiegelung — entspricht den philatelistischen Lesepositionen und deckt Rückseiten-Scans ab) und alle plausiblen Verschiebungen das Maximum aus IoU/F1 der Lochmengen. Fehlende Löcher (Blindstanzung, nicht ganz durchgestoßen) milder bestrafen als überzählige.
- **Teilmuster**: Score nur über den tatsächlich beobachteten Ausschnitt rechnen, plus separat ausgewiesene Abdeckung. So bleibt die abgeschnittene Marke unten links matchbar, ohne dass du die Trefferqualität schönst.
- **Fallback ohne Gitter**: RANSAC über Punktpaare + Chamfer-/Hausdorff-Distanz. Langsamer, aber unabhängig von der Gitterschätzung.
Ausgabe immer **Top-5 mit Score und Overlay-Bild**, nie ein einzelnes „das ist es". Perfins mit gleichen Initialen unterscheiden sich oft nur in ein, zwei Lochpositionen — die letzte Entscheidung gehört an den Menschen.
## 7. Wo ML wirklich hilft (einziger Punkt mit LLM-Nutzung)
Nicht beim Matching — der Gittervergleich ist exakter, schneller und erklärbar. Sondern bei **Schritt 3 im Auflicht**: ein kleines U-Net, das eine Lochwahrscheinlichkeits-Heatmap ausgibt, schlägt klassische Filter über störendem Motiv deutlich. Der Clou: Trainingsdaten kannst du **synthetisch erzeugen** — Muster aus der DB rechnerisch in gescannte Markenbilder „stanzen", dazu Rotation, Rauschen, Unschärfe, Teilausschnitte. Unbegrenzt Labels, kostenlos. Aber erst bauen, wenn die klassische Pipeline steht und du weißt, wo sie versagt.
## 8. Stack & Vorgehen (wieder keine KI)
Python + OpenCV + scikit-image + numpy + SQLite; erst CLI, dann eine kleine FastAPI-Oberfläche mit Overlay und der Möglichkeit, Löcher manuell zu setzen/löschen. Jede Pipeline-Stufe schreibt Zwischenergebnis als JSON **plus Debug-PNG** — ohne das wird die Fehlersuche zäh.
Praktischer Hinweis: `cv2` ist auf keinem deiner drei Interpreter installiert (python3.12, python3.13, miniconda). Ich würde ein venv auf python3.12 mit `opencv-python-headless`, `scikit-image`, `numpy`, `pillow` anlegen.
Meilensteine in der Reihenfolge, in der sie Risiko abbauen:
1. Scan-Setup + 20 Referenzmarken bei 1200 dpi Durchlicht
2. Block → Einzelmarke
3. Lochdetektion mit Debug-Overlay
4. Gitterfitting → Matrix
5. Erfassungswerkzeug für die DB
6. Matcher + Evaluation (Top-1/Top-5 auf einem gelabelten Testset)
## Was ich von dir bräuchte
- Hast du einen Scanner mit **Durchlichteinheit**? Das verschiebt den Aufwand massiv.
- Einzelmarken oder auch **Briefe/Belege**? Bei Belegen kommt Umschlaghintergrund und fehlendes Durchlicht dazu.
- Welche **Katalog-/Datenquelle** schwebt dir vor — eigene Sammlung, oder hast du Zugang zu einer AG-Datenbank?
- Größenordnung: Hunderte Marken oder Zehntausende? Das entscheidet, ob Batch-Verarbeitung von Anfang an mitgedacht werden muss.
Wenn du magst, baue ich als nächstes den Prototyp für Schritt 2+3 direkt an deinem Beispielbild — auch bei den 170 dpi sieht man dann realistisch, wo die Grenze liegt.
_________________________
Ich sagte dann, dass er den Prototypen bauen und das Bild von Wikipedia als Muster nutzen soll. Sofort wurde dieses Bild produziert und automatisch einige Programme auf meinem Macbook installiert.
Nach wenigen Minuten kam dieses erste Bild heraus.
Ich gab dann unaufgefordert zwei weitere Beispielscans hinein.
Nach rund 30 min stellt Claude fest, es iteriere im Blindflug. Was stimmte. Denn ein Computer sieht nicht wie ein Mensch Löcher in Briefmarken. Für den Computer ist das einfach nur eine regelmäßige Anordnung von Pixeln in Reihen und Spalten, die alle einen unterschiedlichen Farbcode aus rund 4,4 Mrd verschiedenen Codes tragen. Das Konzept "Loch" existiert für einen Computer nicht.
Nach 40 min kam Claude auf die Idee, die ich oben als erstes hatte: Den Kontrast der Löcher zur umgebenden Marke suchen. Nach zwei weiteren Minuten bittet mich Claude, ich möge auf zwei Marken die Löcher farbig markieren und mit einem Rechteck den Bereich mit Löchern kennzeichnen.
Nach 51 min ist ein Prototyp fertig, der bei den 3 Beispielscans die Lochung perfekt erkennt. Nun müsste man weitere Scans mit markierter Lochung hineingeben, damit die Erkennungsroutine verfeinert und für möglichst viele verschiedene Grenzfälle optimiert werden kann. Und eine angeschlossene Lochmusterdatenbank, mit der verglichen werden kann, fehlt natürlich auch noch.
Die vom BDPh verkaufte Lochungssammlung wäre wunderbares Material gewesen, um so eine computerlesbare Datenbank anzulegen. Aber dafür fehlen dem BDPh ja Weitblick und Ideen.
Fazit: Fragt ein LLM nicht nach Dingen, die es erwartbar nicht beantwortet kann. Fragt es, wie es ein Problem lösen würde, das ihr habt und das mit vorhandenen oder beschaffbaren Datenbeständen automatisiert lösbar wäre.
Ich gab dann unaufgefordert zwei weitere Beispielscans hinein.
Nach rund 30 min stellt Claude fest, es iteriere im Blindflug. Was stimmte. Denn ein Computer sieht nicht wie ein Mensch Löcher in Briefmarken. Für den Computer ist das einfach nur eine regelmäßige Anordnung von Pixeln in Reihen und Spalten, die alle einen unterschiedlichen Farbcode aus rund 4,4 Mrd verschiedenen Codes tragen. Das Konzept "Loch" existiert für einen Computer nicht.
Nach 40 min kam Claude auf die Idee, die ich oben als erstes hatte: Den Kontrast der Löcher zur umgebenden Marke suchen. Nach zwei weiteren Minuten bittet mich Claude, ich möge auf zwei Marken die Löcher farbig markieren und mit einem Rechteck den Bereich mit Löchern kennzeichnen.
Nach 51 min ist ein Prototyp fertig, der bei den 3 Beispielscans die Lochung perfekt erkennt. Nun müsste man weitere Scans mit markierter Lochung hineingeben, damit die Erkennungsroutine verfeinert und für möglichst viele verschiedene Grenzfälle optimiert werden kann. Und eine angeschlossene Lochmusterdatenbank, mit der verglichen werden kann, fehlt natürlich auch noch.
Die vom BDPh verkaufte Lochungssammlung wäre wunderbares Material gewesen, um so eine computerlesbare Datenbank anzulegen. Aber dafür fehlen dem BDPh ja Weitblick und Ideen.
Fazit: Fragt ein LLM nicht nach Dingen, die es erwartbar nicht beantwortet kann. Fragt es, wie es ein Problem lösen würde, das ihr habt und das mit vorhandenen oder beschaffbaren Datenbeständen automatisiert lösbar wäre.