KI-Sichtbarkeits-Gap-Assessment · audit.phibel.app

Guideline für externe Evaluationen Search & AI Visibility Gap Assessment — Stand v2.0 · 07.07.2026. Diese Seite ist die Arbeitsgrundlage für Reviewer:innen: was zu prüfen ist, was sich seit dem letzten Review geändert hat, und was bewusst noch offen ist.

Wie wir mit externem Feedback umgehen: Externe Reviews sind ausdrücklich erwünscht und werden als Experten-Input behandelt — jede Empfehlung wird gegen unsere Messdaten und dokumentierten Entscheidungen geprüft; die Entscheidung trifft der Betreiber und wird im Konzept-Log festgehalten. Das letzte externe Review (07.07.2026) hat u. a. einen echten Berechnungsfehler gefunden — genau dafür ist dieser Kanal da. Danke!

1 · Was seit dem letzten Review (07.07.2026) passiert ist

Für ein Re-Audit zuerst der Abgleich: die 7 Befunde des letzten Reviews und ihr Status.

BefundStatus
Drei inkonsistente Modelle sichtbar (8 vs. 7 Dimensionen)GELÖST — Ein Modell überall: 7 Kern-Dimensionen, „Knowledge-Catalog" ist jetzt optionales Agentic-Modul (intern wird 8-achsig weitergemessen, transparent dokumentiert). Alte Reports tragen einen „Archiviert — Methodik v2"-Banner.
„ARD" kollidiert mit Googles Agentic Resource DiscoveryGELÖST — Außen-Titel jetzt „KI-Sichtbarkeits-Gap-Assessment" (EN: Search & AI Visibility Gap Assessment); ARD nur noch in der Methodik mit Disambiguierungs-Hinweis.
llms.txt / ai-catalog / H1 / og:type als KI-Hebel gescoredENTSCHIEDEN, wirkt ab nächstem Messzyklus — De-Scoring-Rubrik ist spezifiziert; scharf geschaltet wird je Gruppe erst bei der nächsten regulären Messung, damit keine Mess-Serien gemischt werden.
Single Engine als Multi-Engine verkauftGELÖST — Reports sagen jetzt überall: „explorative Stichprobe über eine dokumentierte Engine (Claude + WebSearch), kein Multi-Engine-Zensus". Ein echter Multi-Engine-„Verified Benchmark" ist als eigener Tier in Arbeit (s. Roadmap W5).
Rechenfehler: Leader-Label widersprach der eigenen TabelleGELÖST + TEST-GESICHERT — Der Leader wird jetzt aus derselben Tabelle inklusive des Subjekts berechnet (vorher: argmax nur über Wettbewerber). 3 Regressionstests in der Suite.
Veraltete „Sitelinks-Suchfeld"-MetrikGELÖST — stammte aus einem Alt-Report, der jetzt archiv-gebannert ist.
Spider mit Null-Achsen verwirrend; Kacheln + Prioritätenmatrix fehlenGELÖST (angepasst) — Two-Spider-Modell bewusst beibehalten, aber: nicht gewertete Achsen werden grau gepunktet mit Rohwert gezeigt (kein Null-Kollaps), plus neue Ergebnis-Kacheln und Prioritätenmatrix in jedem Report. Der zeitgewichtete Overall-Wert ist zur Szenario-Projektion (HYPOTHESIS) herabgestuft.

2 · Zu evaluierende Ressourcen

  1. Startseite — Positionierung, Landschafts-Daten, Audit-Portfolio (16 Audits / 4 Gruppen, Mess-Verläufe).
  2. Engine & Methodik — das Modell (7 Kern + Modul), Pipeline, Selbst-Optimierung, Begriffs-Disambiguierung.
  3. Connected-Audit-Methodik — Datenschutz-Linie und der geplante Confidence-A-Pfad.
  4. Beispiel-Reports (v2.0-Layout, echte Messungen):
    • LECKER — Fall „Subjekt führt" (hier war der Leader-Bug sichtbar; bitte nachprüfen).
    • EAT SMARTER — das Re-Audit des im letzten Review geprüften Falls, jetzt v3/v2.0.
    • sun matters — Fall „Lücke + Wette" (datierte, falsifizierbare Wette am Report-Ende).
  5. Die 16 av-Skills (die Prompt-/Regelwerke hinter der Assessment-Engine) — einzeln lesbar, siehe §3. Alternativ als ZIP.
  6. Archivierte v2-Reports — bewusst online mit Banner (Methodik-Historie, z. B. EAT SMARTER v2); bitte nicht als aktuellen Stand bewerten.

3 · Die 16 Skills als zu evaluierende Ressource

Jeder Skill ist eine eigenständige Datei (Markdown, im Browser lesbar). Evaluations-relevante Fragen: Sind die Bewertungsregeln eindeutig? Gibt es Redundanz oder Widersprüche zwischen Skills? Sind die Guardrails (keine Garantien, ehrliche Labels) konsequent? Wo würde ein anderes Bewertungs-Modell zu anderen Scores kommen?

SkillAufgabe
av-actionabilityBewertet die Readiness-Dimension „Actionability & Agentic Viability" — kann ein Mensch UND ein browser-/tool-nutzendes System den nächsten Schritt verstehen und
av-benchmark-analystOptionaler Wettbewerber-Benchmark des KI-Sichtbarkeits-/ARD-Audits — erweitert das Gap Assessment je Achse um FELD (Wettbewerber-Schnitt) und BEST (stärkster We
av-eval-calibratorMeta-Skill des AI-Visibility/ARD-Readiness-Audits. Bewertet nach JEDEM Audit-Lauf die Outputs der 8 Phasen-Skills anhand gratis abfallender Ground-Truth-Signale
av-evidence-trustBewertet die Readiness-Dimension „Evidence & Trust" — verdient sich das Unternehmen sichtbar Vertrauen für seine Behauptungen (Autorschaft, Quellen, Aktualität,
av-gap-strategistÜbersetzt in Kapitel B des KI-Sichtbarkeits-/ARD-Audits die Soll-Ist-Lücken je Achse in priorisierte, quick-win-sortierte Maßnahmen samt Projektion.
av-guardrailsMeta-Skill des 7-Dimensionen-Readiness-Audits, der jeden Output ehrlich hält — vergibt die Evidenz-Labels MEASURED/VERIFIED/HYPOTHESIS/MISSING_DATA, erzwingt di
av-intakeBaut das Client-Intake-Schema des 7-Dimensionen-Readiness-Audits — sammelt Domain, Zielmarkt, Geschäftsmodell, Conversion, Angebote, Wettbewerber, Access-Flags,
av-knowledge-catalogBewertet die Readiness-Dimension „Knowledge-Catalog Readiness" — stellt das Unternehmen einen verifizierten, maschinenlesbaren Datensatz bereit, den KI-/Agent-S
av-mention-detectorErkennt in jeder KI-Antwort Marken-/Wettbewerber-Nennungen und zitierte Quell-Domains und trennt Mention Rate ⟂ Share of Voice (SoV nur mit Peer-Set/Connected-A
av-organic-reachBewertet die Readiness-Dimension „Organic Search Reach" — fängt das Unternehmen heute relevante unbezahlte Suchnachfrage ein? Nutzen im 7-Dimensionen-Readiness-
av-profilerBaut Phase 1 des KI-Sichtbarkeits-/ARD-Readiness-Audits — extrahiert aus dem rohen Startseiten-Text einer Marke ein strukturiertes JSON-Markenprofil. Nutzen, we
av-prompt-designerErzeugt in Phase 2 realistische, journey-verteilte Test-Such-Prompts für KI-Suchmaschinen aus dem BrandProfile — nutzen, wenn ein AI-Visibility-/ARD-Readiness-A
av-report-narratorLetzte Phase des KI-Sichtbarkeits-/ARD-Audits — rendert die Audit-Ergebnisse zu einem lesbaren HTML-Report im Holocron-Stil (Spiderdiagramm, Soll-Ist-Lücken, pr
av-search-framingLiefert die Phase-3-Präambel, die eine Such-Engine im KI-Sichtbarkeits-/ARD-Audit so rahmt, dass Claude faktenbasiert, mit namentlichen Anbietern + URL und eine
av-tech-discoverabilityBewertet die Readiness-Dimension „Technical Discoverability" — können Suchsysteme die wichtigen Seiten zuverlässig crawlen, rendern, indexieren und interpretier
av-website-scorerBewertet die 6 website-basierten Achsen der KI-Sichtbarkeit (Technical Discoverability, Offer & Entity Clarity, Evidence & Trust, Content & Journey Coverage, Ac

4 · Leitfragen für die Evaluation

5 · Offene Roadmap (transparent — bitte nicht als Mangel doppelt melden)

WocheInhaltStatus
W1Modell-Freeze, ein konsistentes Modell auf allen Flächen, neue Report-Elemente, UmbenennungFERTIG (07.07.)
W2Doku je Dimension (Definition, Datenquelle, Gewichtung, Confidence, Testfälle) + De-Scoring-RubrikFERTIG (07.07.)
W3–4Validierung an 3 Bestands-Gruppen (Rezept-Portale, Sonnenschutz, Vitalpilze): Messungen vervollständigen, jedes Ergebnis manuell gegenprüfenab 14.07. (Mess-Läufe bewusst pausiert)
W5Multi-Engine „Verified Benchmark"-Protokoll (ChatGPT, Gemini, Claude — mit Prompt/Land/Sprache/Zeit/Engine/Antwort-Protokoll je Abfrage)Harness fertig, Pilotlauf offen
W6Connected-Audit-MVP (Google Search Console, read-only, eigene Property) → Confidence A + „rankt-aber-wird-nicht-zitiert"-ListeAuth-Unterbau fertig, Anbindung offen
W73 Pilotreports mit Wetten + Verlaufs-Sektion; menschliche Schlussprüfung vor jeder Weitergabeoffen
W8Übergabe-Paket (Methodik-Onepager DE/EN, Beispielreport, Bausteine) — keine eigene PreisseiteEntwürfe fertig, Abnahme offen

Bekannte Grenzen (by design, Stand heute): Cold Audit = explorative Stichprobe über eine Engine · Rezept- und Sonnenschutz-Gruppe haben teils erst 1–2 von 3 Tageszeit-Messungen · Spielzeug/Narayana bewusst auf Methodik v2 belassen (Banner) bis zum regulären Zyklus · Methodik-Doku aktuell DE (EN-Onepager folgt mit W8).

6 · Feedback-Weg

Feedback bitte direkt an Frank (persönlich/Telegram) — gern strukturiert als 🔴 kritisch / 🟡 sollte / 🔵 Anmerkung je Befund, mit Link auf die betroffene Stelle. Besonders wertvoll: konkrete Widersprüche zwischen zwei Flächen, Rechenwege, die nicht aufgehen, und Formulierungen, die mehr versprechen als gemessen wurde.

Stand v2.0 · 07.07.2026 · Diese Seite ist Teil des Assessments selbst — Fehler hier zählen auch. · Zurück zur Startseite