Visibility Coach · Assessment Engine

Wie das Assessment funktioniertKI-Sichtbarkeits-Gap-Assessment (Search & AI Visibility Gap Assessment) v3.0 — Cold Audit · Architektur, Skills, Selbst-Optimierung

Begriffs-Hinweis (Disambiguierung): Unsere frühere Eigenprägung „ARD Readiness" (Agentic Retrieval & Discovery) kollidiert seit 17.06.2026 mit Googles offizieller Agentic Resource Discovery-Spezifikation (ai-catalog.json — die Discovery aufrufbarer Ressourcen, kein Nachweis von Sichtbarkeit in KI-Antworten). Das Assessment heißt deshalb außen KI-Sichtbarkeits-Gap-Assessment (EN: Search & AI Visibility Gap Assessment); „Agentic Viability" ist darin das Zukunftsmodul für Firmen, deren Leistungen künftig durch Agenten gefunden und genutzt werden sollen.
← zurück zu audit.phibel.app
Eigenschaft
Stellhebel
7 Kern-Dimensionen + Agentic-Modul
Vorteil
Sichtbarkeit
OVI · AVI · Overall
Nutzen
Auffindbarkeit
vom Kunden gefunden werden

Die Stellhebel (7 Kern-Dimensionen + Agentic-Modul) erzeugen den Vorteil Sichtbarkeit — und damit den Nutzen Auffindbarkeit.

1 · Das Modell — 7 Kern-Dimensionen + Agentic-Modul, 2 Linsen

Präsentations-Hybrid (v2.0, 2026-07-07): intern wird 8-achsig gemessen (Instrument unverändert, Messkontinuität); alle Kunden-Oberflächen weisen 7 Kern-Dimensionen aus — „Knowledge-Catalog Readiness" erscheint als optionales Agentic-Modul innerhalb von Actionability & Agentic Viability. Der zeitgewichtete Overall-Wert ist eine Szenario-Projektion (Hypothese), kein Hauptscore.

Das Assessment misst die Auffindbarkeit einer Marke über sieben Kern-Dimensionen plus ein optionales Agentic-Modul (Knowledge-Catalog, emerging) — je 0–100, gewichtete Sub-Signale. Wettbewerbs-Benchmarking ist kein zusätzlicher Speichen-Wert, sondern eine Vergleichs-Ebene (Peer-Median + Leader), die über jede Dimension gelegt wird.

Die 7 Kern-Dimensionen + Agentic-Modul

  • Organic Search Reach
  • AI Answer Presence
  • Technical Discoverability
  • Offer & Entity Clarity
  • Evidence & Trust
  • Content & Journey Coverage
  • Actionability & Agentic Viability
  • Knowledge-Catalog Readiness Agentic-Modul · emerging

Zwei Checks / zwei Linsen

OVI Organic SEO Benchmark — klassische Google-Suche, heute (Organic Visibility Index).

AVI KI-Mode Readiness Check — Readiness für KI-Suchsysteme wie Googles KI-Modus, ChatGPT, Perplexity, Gemini (Agentic Visibility Index). Gemessen wird aktuell über eine dokumentierte Engine: Claude + WebSearch (explorative Stichprobe, kein Multi-Engine-Zensus); der Verified Multi-Engine-Benchmark ist geplant und wird erst ausgewiesen, wenn er wirklich gemessen ist.

Overall Visibility(t) = α(t)·OVI + (1−α(t))·AVI

Beide werden als zwei getrennte Spider dargestellt: der OVI-Spider mit Wettbewerbsfeld-Overlay (Peer-Median + Leader), der AVI-Spider mit dem eigenen OVI-heute als Referenz-Polygon — die Fläche dazwischen ist die Organisch→Agentisch-Readiness-Lücke. Kein generisches „Soll 2027"-Polygon mehr.

α (Gewicht organisch) sinkt über die Jahre — pro Branche konfigurierbar und im Report als HYPOTHESIS ausgewiesen. Der Report lässt sich mit anderer Branche/α ohne erneutes Audit neu erzeugen.

1d · Kampagnen-Sicht — kleines Feld & Big Enemies NEU 2026-07-19

Gruppen-Audits werden als Kampagne gelesen: 7–10 direkte Wettbewerber bilden das Wettbewerbsfeld (interner Rang in der Vergleichstabelle — jeder misst sich an jedem, „small enemies"). Zusätzlich benennt jede Kampagne die Big Enemies des Feldes: den Goliath (die Kanal-/Plattform-Übermacht, die dem gesamten Feld die Kunden-Schnittstelle wegnimmt) und den AI-nativen Schatten (KI-native Angebote, die die Kaufberatung der Kategorie übernehmen).

Die Big-Enemy-Box ist eine Interpretations-Schicht über dem Peer-Benchmark — sie verändert keine Scores. Kennzeichnung HYPOTHESIS (redaktionell hergeleitet, mit Belegen) oder VERIFIED (kuratiert bestätigt). Gemessen wird weiterhin ausschließlich je Anbieter (Cold Audit, zwei Linsen); der Peer-Median/Leader bleibt die Benchmark-Referenz.

1c · Die 8. Dimension — Knowledge-Catalog Readiness NEU v3

Der nächste Schritt nach der Crawl-Ära ist die Daten-Ära: Such- und Agenten-Systeme konsumieren zunehmend nicht die gerenderte Seite, sondern einen verifizierten, maschinenlesbaren Datensatz über das Unternehmen (Knowledge-Catalog) — und Agenten reden im A2A-Protokoll direkt miteinander. Diese Dimension misst, wie agenten-konsumierbar eine Marke heute schon ist.

Vier Sub-Checks (deterministische Code-Signale als Faktenbasis)

Sub-CheckGewichtGeprüfte Signale
a · JSON-LD-Vielfalt & -Vollständigkeit30 % Organization/LocalBusiness, Product/Service/Offer, FAQPage, sameAs — Anzahl & Abdeckung der @type-Entitäten.
b · Maschinenlesbare Endpoints25 % llms.txt, RSS/Atom-Feed, sichtbare API/OpenAPI, ai-plugin/ai-catalog-Hinweise.
c · Transactability / Agentic Booking25 % schema.org potentialAction, Online-Scheduling-/Booking-Integration — kann ein Agent abschließen? (Code-Signal; echter A2A-Probelauf = Backlog).
d · Maschinenlesbare Preis-/FAQ-/Policy-Daten20 % Offer.price/priceCurrency, FAQPage, Policy-Markup — branchen-gewichtet (Shop/Service hoch, Verlag/Medien niedrig).

Guardrail: Vorhandensein eines Knowledge-Catalogs / potentialAction ist ein Readiness-Sub-Signalkeine Garantie für KI-Inklusion oder eine erfolgreiche A2A-Transaktion. Bewertet werden Vollständigkeit & Qualität, nicht bloße Existenz.

Linsen-Gewicht: stark agentisch (AVI 0,20), schwach organisch (OVI 0,05) — abgegeben von Technical Discoverability (AVI 0,10→0,05) und Actionability (AVI 0,20→0,10), deren maschinenlesbarer Anteil hierher wandert. OVI/AVI-Summen bleiben normiert.

AVI sichtbar getrennt: Mention Rate ⟂ Share of Voice

Die KI-Antwort-Achse trägt jetzt zwei eigenständige Kennzahlen statt einer vermischten Zahl:

Cold vs Connected/Paid — zwei Tiers, dasselbe Modell

Die 8. Dimension wird in beiden Tiers bewertet, nur die Datentiefe unterscheidet sich:

AspektCold Audit (kostenlos, Sales)Connected / Paid Audit
Knowledge-Catalog Deterministische öffentliche Signale (JSON-LD/potentialAction/Feed/llms.txt) — Confidence B. + Search-Console-verifizierte Domain, Discoverability-API, First-Party-Katalog — Confidence A.
Share of Voice Solo nur Mention Rate; SoV erst im Gruppen-Vergleich. SoV aus echtem Peer-Set / First-Party-Impressionen (AI-Mode).
Transactability Code-Signal (potentialAction/Booking-Detektion). Code-Signal + First-Party-Conversion-/Booking-Insights (GA4/GBP). A2A-Probelauf = Backlog.
Pro Achse Confidence-Ampel B/C + Mini-CTA „🔌 Daten verbinden für verifizierten Score (A)". Confidence A statt CTA.

Der Cold Audit ist damit zugleich ein eingebauter Upgrade-Pfad: jede directional bewertete Achse zeigt sichtbar, welcher Score sich mit Datenanbindung verifizieren ließe. Details: Methodenübersicht „Connected Audit".

1b · Cold Audit — Grenzen & was GSC/GA4 ergänzen würden

Dieses Assessment ist ein Cold Audit: es nutzt ausschließlich öffentlich beobachtbare Signale — Web-Crawl der Website + Stichproben echter KI-Suchantworten — und hat keinen Zugriff auf First-Party-Daten. Echte Klicks, Impressionen, Rankings je Query und Conversions werden daher directional geschätzt, nicht gemessen. Das ist bewusst so: bewertet werden die kontrollierbaren On-Site-/Content-Hebel, die ein Unternehmen selbst verändern kann.

+ Google Search Console (GSC)

  • Echte Impressionen, Klicks, CTR & Position je Query (nach Seite/Land/Gerät/Datum)
  • Reale Index-Abdeckung statt nur Crawlbarkeit
  • Seit Juni 2026: „Search Generative AI"-Reports (Impressionen in AI Overviews / AI Mode)
  • Striking-Distance-Queries (Position 5–20)
  • Vorbehalt: GSC anonymisiert/filtert je nach Property ~38–75 % der Queries

+ Google Analytics 4 (GA4)

  • Echte Conversions & Umsatz pro Kanal
  • KI-Referral-Attribution (chatgpt.com, perplexity.ai, gemini — teils GA4-Kanal „AI Assistant")
  • Belegt höheren Geschäftswert von KI-Traffic (~4,4× Conversion vs. klassisch organisch)
  • Engagement-Tiefe & Multi-Touch-Journey je Quelle
  • Vorbehalt: Standard-Channel-Grouping unterzählt KI-Traffic ~30–40 % ohne Custom-Setup

GSC/GA4 ergänzen die First-Party-Performance und sind selbst lücken-/filterbehaftet. Sie ändern nicht, welche On-Site-Hebel der Cold Audit aufdeckt — wohl aber deren Priorisierung nach echtem Geschäftswert.

Diagnose vs. Maßnahmen: Der Cold Audit ist stark in der Diagnose — er zeigt directional zuverlässig, dass eine KI-Sichtbarkeitslücke besteht (reicht meist für die Go/No-Go-Entscheidung) — aber schwach in der Priorisierung der Maßnahmen. Der Grenznutzen der Datenanbindung steckt daher fast vollständig in den Maßnahmen, nicht im „Ob überhaupt". Wann welche Aussage gilt, zeigt der Entscheidungsbaum in der Methodenübersicht „Connected Audit" §0b. Im Report ist deshalb jede einzelne Maßnahme markiert: ✓ ohne Datenanbindung belastbar (crawl-deterministisch, z. B. technische Auffindbarkeit) oder 🔌 mit Kundendaten schärfer beurteilbar (datenabhängige Achsen wie Organic Reach, Conversion/Actionability — Quelle je Achse genannt).

Welche Dimensionen die Anbindung am ehesten braucht — gereiht nach Grenznutzen (drei Achsen sind weitgehend crawl-deterministisch, fünf werden erst durch eine First-Party-Quelle scharf):

#DimensionBedarfQuelle · warum
1Actionability & Agentic Viability HOCH GA4 — ob ein realer Conversion-/Handlungspfad trägt & welcher Euro-Wert je Quelle dranhängt; Erfolgsmetrik rein First-Party.
2Organic Search Reach HOCH GSC — echte Klicks/CTR/Position je Query statt directionaler SERP-Stichprobe; Kernzahlen liegen nur in GSC.
3Content & Journey Coverage MITTEL GA4 + Ads — reale Funnel-Abbrüche, konvertierender Intent & CPC-Geschäftswert; macht Struktur-Lücken geldwert-priorisierbar.
4AI Answer Presence MITTEL GSC (AI-Mode) — schärft die per Test-Prompts schon belastbare Linse um die „rankt-aber-nicht-zitiert"-Lücke; additiv.
5Offer & Entity Clarity MITTEL · bedingt GBP — lokale Sichtbarkeit/Bewertungen/Map-Pack; Mehrwert v. a. bei lokalen Geschäften, sonst gering.
6Evidence & Trust KEINER — Autorschaft, Quellen, Aktualität, Transparenz sind on-page/öffentlich; Cold voll belastbar.
7Technical Discoverability KEINER — Crawl/Render/Index/Schema sind crawl-deterministisch & ohne Kundendaten abschließend prüfbar.
8Knowledge-Catalog Readiness NEU GERING — JSON-LD/potentialAction/Feed/llms.txt sind crawl-deterministisch (Confidence B); nur Search-Console-verifizierte Domain & Discoverability-API heben die Achse auf Confidence A (Paid).

Volle Begründung je Achse: Methodenübersicht „Connected Audit" §4. Deckt sich mit den Per-Maßnahme-Markern (🔌 vs. ✓) und der §0b-These „der Hebel sitzt in den Maßnahmen".

Stand & Selbst-Optimierung (auto, 2026-07-20)

Modell v3.0 · zwei Checks: Organic SEO Benchmark (OVI) & KI-Mode Readiness Check (AVI) · Cold Audit (ohne GSC/GA4). Methodik: 7 Kern-Dimensionen + Agentic-Modul (Knowledge-Catalog, emerging), zwei gewichtete Spider, Benchmark als Overlay, kein „Soll 2027“-Polygon. Website-Achsen deterministisch (Code-Signale, Cold-Obergrenze 80); geteilter Kategorie-Kern-Pool.

Skill-Telemetrie (Ø Rolling-Score über 8 av-Skills): 80/100 · letzte Eval 2026-07-20 21:29. Re-Audit-Schwelle: Δ≥10 Pkt oder Version-Bump → alte Audits werden als „veraltet“ markiert und neu gemessen.

Letzter Re-Audit-Trigger: av-prompt-designer: Δ11.7pkt; av-gap-strategist: Δ-25.0pkt; av-report-narrator: Δ-25.0pkt.

2 · Die Pipeline

Jeder Lauf durchläuft eine feste Kette. Die „Suche" wird über die Claude Max Subscription ausgeführt (kein metered API-Key), mit server-seitigem Web-Search-Tool.

av-intake Stammdaten av-profiler Markenprofil av-prompt-designer 18 Prompts (6/6/6) av-search-framing Engine-Präambel Engine claude_cli + WebSearch av-mention-detector Nennungen/Quellen Scorer (5×) + av-organic-reach av-benchmark-analyst Overlay av-gap-strategist Priorities av-report-narrator Report

AI Answer Presence wird über N Wiederholungen gemessen (Mention 35 % / Owned-Source-Link 40 % / Recommendation 25 %), mit Volatilitäts-Badge — ausgewiesen als zwei Kennzahlen: Mention Rate (genannt/zitiert) und Share of Voice (empfohlen, relativ zum Wettbewerbsfeld; nur mit Vergleichsfeld, sonst solo nur Mention Rate). Die Website-Dimensionen + Organic Reach werden einmalig aus dem gecrawlten HTML bewertet — Signal-Erkennung (H1/Tabellen/Schema/JSON-LD) läuft über das vollständige Dokument, der LLM-Scorer erhält einen boilerplate-bereinigten Inhaltsauszug (Body statt Kopf/Nav). av-guardrails liegt quer über allem.

3 · Die Skills (16)

Jede Phase ist ein eigener, versionierter Skill. Prompt-tragende Skills lesen ihren aktiven Prompt aus dem prompt_store (Seed == Code, kein Drift).

SkillRolle im Assessment
av-intakeClient-Intake-Schema: Domain, Markt, Geschäftsmodell, Conversion, Wettbewerber, Access-Flags (GSC/GA4/Ads), Regulated-Flag.
av-profilerExtrahiert aus der Startseite ein strukturiertes Markenprofil.
av-prompt-designerErzeugt 18 journey-verteilte Test-Prompts (6 Discovery / 6 Comparison / 6 Decision).
av-search-framingRahmt die Such-Engine faktenbasiert + erzwingt auswertbare „Sources:"-Liste.
av-mention-detectorErkennt Marken-/Wettbewerber-Nennungen und zitierte Quell-Domains; trennt Mention Rate (genannt/zitiert) von Share of Voice (empfohlen, relativ zum Peer-Set — nur Gruppe/Paid).
av-organic-reachDimension Organic Search Reach — directional (Confidence C), ohne GSC keine erfundenen Klicks.
av-tech-discoverabilityDimension Technical Discoverability — Crawl/Render/Index/Schema-Validität (maschinenlesbarer Katalog-Anteil → av-knowledge-catalog; AVI-Gewicht 0,10→0,05).
av-evidence-trustDimension Evidence & Trust — E-E-A-T-Trust-Audit (kein Ranking-Faktor).
av-actionabilityDimension Actionability & Agentic Viability — Mensch-/Browser-Next-Step, CTA, Formular-/Booking-Usability (maschinenlesbare potentialActionav-knowledge-catalog; AVI 0,20→0,10).
av-website-scorerBewertet die website-basierten Dimensionen aus dem HTML + deterministischen Signalen (Ganz-Dokument-Crawl + Body-Inhaltsauszug) und erzeugt das deterministische SEO-Grundpräsenz-Gate.
av-knowledge-catalog NEUDimension Knowledge-Catalog Readiness — verifizierter, maschinenlesbarer Datensatz (JSON-LD-Vielfalt, Endpoints/llms.txt/Feed/API, Transactability/potentialAction, Preis-/FAQ-/Policy-Daten). Cold = Public-Signale (B), Paid = + verified-domain/Discoverability-API (A).
av-benchmark-analystWettbewerber-Overlay: Peer-Median + Leader (argmax), Lücken-Berechnung.
av-gap-strategistPriorisierte Maßnahmen via Priority Score (35/25/20/10/10), „erwarteter Beitrag" statt Versprechen.
av-report-narratorRendert den Report (Radar, Linsen, Overall-Trend, Tabellen).
av-guardrailsQuer-Meta: MEASURED/VERIFIED/HYPOTHESIS/MISSING_DATA + Truth-Rules + Review-Gates G1–G5.
av-eval-calibratorMeta-Skill: bewertet alle Phasen nach jedem Lauf, optimiert Prompts (s. §5).
⬇ Skills herunterladen (ZIP, 16 Skills)

4 · MCP / CLI & Engines

Subscription-CLI als Engine. Die auditierte „Suche" ist claude -p --allowedTools WebSearch über die Claude Max Subscription — kein metered API-Key. Die fünf Analyse-Module laufen über einen get_client()-Shim, der messages.create() nachbildet, intern aber claude -p aufruft.

Tools/MCP. Server-seitiges Web-Search-Tool liefert Antworten und Quell-Citations (Grundlage für Mention-/Source-Link-Rate). Die Engine-Registry ist erweiterbar — weitere KI-Suchsysteme (Perplexity, Gemini, OpenAI) lassen sich als zusätzliche Engines andocken, um aus einer Single-Engine- Stichprobe einen breiteren Benchmark zu machen.

Parallelität: ThreadPool (Concurrency 5) über die 18 Prompts × N Wiederholungen. Ehrliche Rahmung: ein Single-Engine-3-Rep-Lauf ist eine beobachtete Stichprobe, kein Markt-Zensus.

5 · Wie sich die Engine selbst optimiert

Es braucht keinen menschlichen Bewerter: jeder Lauf liefert gratis abfallende Ground-Truth-Signale je Skill-Phase — z. B. ob die vermuteten Wettbewerber real in Antworten auftauchten (Profiler), der Anteil Prompts mit verwertbarem Signal (Prompt-Designer), die Parsebarkeit der Quellen (Search-Framing), die Konsistenz des Mention-Detektors gegen einen strikten Recheck, die Plausibilität der Website-Scores gegen deterministische Signale.

Lauf skill_signals misst je Skill 0–1 skill_log → JSONL + Postgres av-eval-calibrator aggregiert rollenden Score Prompt-Variante via Subscription A/B

Der av-eval-calibrator generiert verbesserte Prompt-Varianten und entscheidet im Modus c: Auto-Übernahme nur bei gemessenem Live-A/B-Gewinn (für die messbar A/B-fähigen Skills search-framing & prompt-designer), sonst landet die Variante als Vorschlag im Change-Board (+ Telegram). Ein Guard (MIN_RUNS_TO_TUNE=2) verhindert verfrühtes Tunen. Versionierte Prompts liegen im prompt_store (<skill>.active.txt + versions/).

Ehrlich: profiler / website-scorer / gap-strategist erzeugen nur Vorschläge; mention-detector / benchmark-analyst / report-narrator sind Logik-Skills (bewertet, nicht auto-mutiert).

6 · Validitäts-Schicht (Crawl-Fidelity & Aussagekraft)

Eine Ehrlichkeits-Schicht vor der Interpretation der Radarfläche — entstanden aus einem realen Befund: Eine 18-KB-Frühtruncation der HTML ließ den Crawler nur <head>+Navigation sehen (auf modernen Seiten steht der erste Body-<h1> oft erst bei Byte 190k–540k) → H1/Tabellen wurden systematisch als „0" erkannt, auch bei Profi-SEO-Seiten, und der Score wurde dadurch fälschlich gedrückt. Fünf Härtungen:

7 · Guardrails (nicht verhandelbar)