Die Stellhebel (7 Kern-Dimensionen + Agentic-Modul) erzeugen den Vorteil Sichtbarkeit — und damit den Nutzen Auffindbarkeit.
Präsentations-Hybrid (v2.0, 2026-07-07): intern wird 8-achsig gemessen (Instrument unverändert, Messkontinuität); alle Kunden-Oberflächen weisen 7 Kern-Dimensionen aus — „Knowledge-Catalog Readiness" erscheint als optionales Agentic-Modul innerhalb von Actionability & Agentic Viability. Der zeitgewichtete Overall-Wert ist eine Szenario-Projektion (Hypothese), kein Hauptscore.
Das Assessment misst die Auffindbarkeit einer Marke über sieben Kern-Dimensionen plus ein optionales Agentic-Modul (Knowledge-Catalog, emerging) — je 0–100, gewichtete Sub-Signale. Wettbewerbs-Benchmarking ist kein zusätzlicher Speichen-Wert, sondern eine Vergleichs-Ebene (Peer-Median + Leader), die über jede Dimension gelegt wird.
OVI Organic SEO Benchmark — klassische Google-Suche, heute (Organic Visibility Index).
AVI KI-Mode Readiness Check — Readiness für KI-Suchsysteme wie Googles KI-Modus, ChatGPT, Perplexity, Gemini (Agentic Visibility Index). Gemessen wird aktuell über eine dokumentierte Engine: Claude + WebSearch (explorative Stichprobe, kein Multi-Engine-Zensus); der Verified Multi-Engine-Benchmark ist geplant und wird erst ausgewiesen, wenn er wirklich gemessen ist.
Overall Visibility(t) = α(t)·OVI + (1−α(t))·AVI
Beide werden als zwei getrennte Spider dargestellt: der OVI-Spider mit Wettbewerbsfeld-Overlay (Peer-Median + Leader), der AVI-Spider mit dem eigenen OVI-heute als Referenz-Polygon — die Fläche dazwischen ist die Organisch→Agentisch-Readiness-Lücke. Kein generisches „Soll 2027"-Polygon mehr.
α (Gewicht organisch) sinkt über die Jahre — pro Branche konfigurierbar und im Report als HYPOTHESIS ausgewiesen. Der Report lässt sich mit anderer Branche/α ohne erneutes Audit neu erzeugen.
Gruppen-Audits werden als Kampagne gelesen: 7–10 direkte Wettbewerber bilden das Wettbewerbsfeld (interner Rang in der Vergleichstabelle — jeder misst sich an jedem, „small enemies"). Zusätzlich benennt jede Kampagne die Big Enemies des Feldes: den Goliath (die Kanal-/Plattform-Übermacht, die dem gesamten Feld die Kunden-Schnittstelle wegnimmt) und den AI-nativen Schatten (KI-native Angebote, die die Kaufberatung der Kategorie übernehmen).
Die Big-Enemy-Box ist eine Interpretations-Schicht über dem Peer-Benchmark — sie verändert keine Scores. Kennzeichnung HYPOTHESIS (redaktionell hergeleitet, mit Belegen) oder VERIFIED (kuratiert bestätigt). Gemessen wird weiterhin ausschließlich je Anbieter (Cold Audit, zwei Linsen); der Peer-Median/Leader bleibt die Benchmark-Referenz.
Der nächste Schritt nach der Crawl-Ära ist die Daten-Ära: Such- und Agenten-Systeme konsumieren zunehmend nicht die gerenderte Seite, sondern einen verifizierten, maschinenlesbaren Datensatz über das Unternehmen (Knowledge-Catalog) — und Agenten reden im A2A-Protokoll direkt miteinander. Diese Dimension misst, wie agenten-konsumierbar eine Marke heute schon ist.
| Sub-Check | Gewicht | Geprüfte Signale |
|---|---|---|
| a · JSON-LD-Vielfalt & -Vollständigkeit | 30 % | Organization/LocalBusiness, Product/Service/Offer, FAQPage, sameAs — Anzahl & Abdeckung der @type-Entitäten. |
| b · Maschinenlesbare Endpoints | 25 % | llms.txt, RSS/Atom-Feed, sichtbare API/OpenAPI, ai-plugin/ai-catalog-Hinweise. |
| c · Transactability / Agentic Booking | 25 % | schema.org potentialAction, Online-Scheduling-/Booking-Integration — kann ein Agent abschließen? (Code-Signal; echter A2A-Probelauf = Backlog). |
| d · Maschinenlesbare Preis-/FAQ-/Policy-Daten | 20 % | Offer.price/priceCurrency, FAQPage, Policy-Markup — branchen-gewichtet (Shop/Service hoch, Verlag/Medien niedrig). |
Guardrail: Vorhandensein eines Knowledge-Catalogs / potentialAction
ist ein Readiness-Sub-Signal — keine Garantie für KI-Inklusion oder eine erfolgreiche
A2A-Transaktion. Bewertet werden Vollständigkeit & Qualität, nicht bloße Existenz.
Linsen-Gewicht: stark agentisch (AVI 0,20), schwach organisch (OVI 0,05) — abgegeben von Technical Discoverability (AVI 0,10→0,05) und Actionability (AVI 0,20→0,10), deren maschinenlesbarer Anteil hierher wandert. OVI/AVI-Summen bleiben normiert.
Die KI-Antwort-Achse trägt jetzt zwei eigenständige Kennzahlen statt einer vermischten Zahl:
Die 8. Dimension wird in beiden Tiers bewertet, nur die Datentiefe unterscheidet sich:
| Aspekt | Cold Audit (kostenlos, Sales) | Connected / Paid Audit |
|---|---|---|
| Knowledge-Catalog | Deterministische öffentliche Signale (JSON-LD/potentialAction/Feed/llms.txt) — Confidence B. | + Search-Console-verifizierte Domain, Discoverability-API, First-Party-Katalog — Confidence A. |
| Share of Voice | Solo nur Mention Rate; SoV erst im Gruppen-Vergleich. | SoV aus echtem Peer-Set / First-Party-Impressionen (AI-Mode). |
| Transactability | Code-Signal (potentialAction/Booking-Detektion). | Code-Signal + First-Party-Conversion-/Booking-Insights (GA4/GBP). A2A-Probelauf = Backlog. |
| Pro Achse | Confidence-Ampel B/C + Mini-CTA „🔌 Daten verbinden für verifizierten Score (A)". | Confidence A statt CTA. |
Der Cold Audit ist damit zugleich ein eingebauter Upgrade-Pfad: jede directional bewertete Achse zeigt sichtbar, welcher Score sich mit Datenanbindung verifizieren ließe. Details: Methodenübersicht „Connected Audit".
Dieses Assessment ist ein Cold Audit: es nutzt ausschließlich öffentlich beobachtbare Signale — Web-Crawl der Website + Stichproben echter KI-Suchantworten — und hat keinen Zugriff auf First-Party-Daten. Echte Klicks, Impressionen, Rankings je Query und Conversions werden daher directional geschätzt, nicht gemessen. Das ist bewusst so: bewertet werden die kontrollierbaren On-Site-/Content-Hebel, die ein Unternehmen selbst verändern kann.
GSC/GA4 ergänzen die First-Party-Performance und sind selbst lücken-/filterbehaftet. Sie ändern nicht, welche On-Site-Hebel der Cold Audit aufdeckt — wohl aber deren Priorisierung nach echtem Geschäftswert.
Diagnose vs. Maßnahmen: Der Cold Audit ist stark in der Diagnose — er zeigt directional zuverlässig, dass eine KI-Sichtbarkeitslücke besteht (reicht meist für die Go/No-Go-Entscheidung) — aber schwach in der Priorisierung der Maßnahmen. Der Grenznutzen der Datenanbindung steckt daher fast vollständig in den Maßnahmen, nicht im „Ob überhaupt". Wann welche Aussage gilt, zeigt der Entscheidungsbaum in der Methodenübersicht „Connected Audit" §0b. Im Report ist deshalb jede einzelne Maßnahme markiert: ✓ ohne Datenanbindung belastbar (crawl-deterministisch, z. B. technische Auffindbarkeit) oder 🔌 mit Kundendaten schärfer beurteilbar (datenabhängige Achsen wie Organic Reach, Conversion/Actionability — Quelle je Achse genannt).
Welche Dimensionen die Anbindung am ehesten braucht — gereiht nach Grenznutzen (drei Achsen sind weitgehend crawl-deterministisch, fünf werden erst durch eine First-Party-Quelle scharf):
| # | Dimension | Bedarf | Quelle · warum |
|---|---|---|---|
| 1 | Actionability & Agentic Viability | HOCH | GA4 — ob ein realer Conversion-/Handlungspfad trägt & welcher Euro-Wert je Quelle dranhängt; Erfolgsmetrik rein First-Party. |
| 2 | Organic Search Reach | HOCH | GSC — echte Klicks/CTR/Position je Query statt directionaler SERP-Stichprobe; Kernzahlen liegen nur in GSC. |
| 3 | Content & Journey Coverage | MITTEL | GA4 + Ads — reale Funnel-Abbrüche, konvertierender Intent & CPC-Geschäftswert; macht Struktur-Lücken geldwert-priorisierbar. |
| 4 | AI Answer Presence | MITTEL | GSC (AI-Mode) — schärft die per Test-Prompts schon belastbare Linse um die „rankt-aber-nicht-zitiert"-Lücke; additiv. |
| 5 | Offer & Entity Clarity | MITTEL · bedingt | GBP — lokale Sichtbarkeit/Bewertungen/Map-Pack; Mehrwert v. a. bei lokalen Geschäften, sonst gering. |
| 6 | Evidence & Trust | KEINER | — Autorschaft, Quellen, Aktualität, Transparenz sind on-page/öffentlich; Cold voll belastbar. |
| 7 | Technical Discoverability | KEINER | — Crawl/Render/Index/Schema sind crawl-deterministisch & ohne Kundendaten abschließend prüfbar. |
| 8 | Knowledge-Catalog Readiness NEU | GERING | — JSON-LD/potentialAction/Feed/llms.txt sind crawl-deterministisch (Confidence B); nur Search-Console-verifizierte Domain & Discoverability-API heben die Achse auf Confidence A (Paid). |
Volle Begründung je Achse: Methodenübersicht „Connected Audit" §4. Deckt sich mit den Per-Maßnahme-Markern (🔌 vs. ✓) und der §0b-These „der Hebel sitzt in den Maßnahmen".
Modell v3.0 · zwei Checks: Organic SEO Benchmark (OVI) & KI-Mode Readiness Check (AVI) · Cold Audit (ohne GSC/GA4). Methodik: 7 Kern-Dimensionen + Agentic-Modul (Knowledge-Catalog, emerging), zwei gewichtete Spider, Benchmark als Overlay, kein „Soll 2027“-Polygon. Website-Achsen deterministisch (Code-Signale, Cold-Obergrenze 80); geteilter Kategorie-Kern-Pool.
Skill-Telemetrie (Ø Rolling-Score über 8 av-Skills): 80/100 · letzte Eval 2026-07-20 21:29. Re-Audit-Schwelle: Δ≥10 Pkt oder Version-Bump → alte Audits werden als „veraltet“ markiert und neu gemessen.
Letzter Re-Audit-Trigger: av-prompt-designer: Δ11.7pkt; av-gap-strategist: Δ-25.0pkt; av-report-narrator: Δ-25.0pkt.
Jeder Lauf durchläuft eine feste Kette. Die „Suche" wird über die Claude Max Subscription ausgeführt (kein metered API-Key), mit server-seitigem Web-Search-Tool.
AI Answer Presence wird über N Wiederholungen gemessen (Mention 35 % / Owned-Source-Link 40 % /
Recommendation 25 %), mit Volatilitäts-Badge — ausgewiesen als zwei Kennzahlen: Mention Rate
(genannt/zitiert) und Share of Voice (empfohlen, relativ zum Wettbewerbsfeld; nur mit Vergleichsfeld,
sonst solo nur Mention Rate). Die Website-Dimensionen + Organic Reach werden einmalig
aus dem gecrawlten HTML bewertet — Signal-Erkennung (H1/Tabellen/Schema/JSON-LD) läuft über das
vollständige Dokument, der LLM-Scorer erhält einen boilerplate-bereinigten Inhaltsauszug
(Body statt Kopf/Nav). av-guardrails liegt quer über allem.
Jede Phase ist ein eigener, versionierter Skill. Prompt-tragende Skills lesen ihren aktiven Prompt
aus dem prompt_store (Seed == Code, kein Drift).
| Skill | Rolle im Assessment |
|---|---|
av-intake | Client-Intake-Schema: Domain, Markt, Geschäftsmodell, Conversion, Wettbewerber, Access-Flags (GSC/GA4/Ads), Regulated-Flag. |
av-profiler | Extrahiert aus der Startseite ein strukturiertes Markenprofil. |
av-prompt-designer | Erzeugt 18 journey-verteilte Test-Prompts (6 Discovery / 6 Comparison / 6 Decision). |
av-search-framing | Rahmt die Such-Engine faktenbasiert + erzwingt auswertbare „Sources:"-Liste. |
av-mention-detector | Erkennt Marken-/Wettbewerber-Nennungen und zitierte Quell-Domains; trennt Mention Rate (genannt/zitiert) von Share of Voice (empfohlen, relativ zum Peer-Set — nur Gruppe/Paid). |
av-organic-reach | Dimension Organic Search Reach — directional (Confidence C), ohne GSC keine erfundenen Klicks. |
av-tech-discoverability | Dimension Technical Discoverability — Crawl/Render/Index/Schema-Validität (maschinenlesbarer Katalog-Anteil → av-knowledge-catalog; AVI-Gewicht 0,10→0,05). |
av-evidence-trust | Dimension Evidence & Trust — E-E-A-T-Trust-Audit (kein Ranking-Faktor). |
av-actionability | Dimension Actionability & Agentic Viability — Mensch-/Browser-Next-Step, CTA, Formular-/Booking-Usability (maschinenlesbare potentialAction → av-knowledge-catalog; AVI 0,20→0,10). |
av-website-scorer | Bewertet die website-basierten Dimensionen aus dem HTML + deterministischen Signalen (Ganz-Dokument-Crawl + Body-Inhaltsauszug) und erzeugt das deterministische SEO-Grundpräsenz-Gate. |
av-knowledge-catalog NEU | Dimension Knowledge-Catalog Readiness — verifizierter, maschinenlesbarer Datensatz (JSON-LD-Vielfalt, Endpoints/llms.txt/Feed/API, Transactability/potentialAction, Preis-/FAQ-/Policy-Daten). Cold = Public-Signale (B), Paid = + verified-domain/Discoverability-API (A). |
av-benchmark-analyst | Wettbewerber-Overlay: Peer-Median + Leader (argmax), Lücken-Berechnung. |
av-gap-strategist | Priorisierte Maßnahmen via Priority Score (35/25/20/10/10), „erwarteter Beitrag" statt Versprechen. |
av-report-narrator | Rendert den Report (Radar, Linsen, Overall-Trend, Tabellen). |
av-guardrails | Quer-Meta: MEASURED/VERIFIED/HYPOTHESIS/MISSING_DATA + Truth-Rules + Review-Gates G1–G5. |
av-eval-calibrator | Meta-Skill: bewertet alle Phasen nach jedem Lauf, optimiert Prompts (s. §5). |
Subscription-CLI als Engine. Die auditierte „Suche" ist claude -p --allowedTools WebSearch
über die Claude Max Subscription — kein metered API-Key. Die fünf Analyse-Module laufen über
einen get_client()-Shim, der messages.create() nachbildet,
intern aber claude -p aufruft.
Tools/MCP. Server-seitiges Web-Search-Tool liefert Antworten und Quell-Citations (Grundlage für Mention-/Source-Link-Rate). Die Engine-Registry ist erweiterbar — weitere KI-Suchsysteme (Perplexity, Gemini, OpenAI) lassen sich als zusätzliche Engines andocken, um aus einer Single-Engine- Stichprobe einen breiteren Benchmark zu machen.
Parallelität: ThreadPool (Concurrency 5) über die 18 Prompts × N Wiederholungen. Ehrliche Rahmung: ein Single-Engine-3-Rep-Lauf ist eine beobachtete Stichprobe, kein Markt-Zensus.
Es braucht keinen menschlichen Bewerter: jeder Lauf liefert gratis abfallende Ground-Truth-Signale je Skill-Phase — z. B. ob die vermuteten Wettbewerber real in Antworten auftauchten (Profiler), der Anteil Prompts mit verwertbarem Signal (Prompt-Designer), die Parsebarkeit der Quellen (Search-Framing), die Konsistenz des Mention-Detektors gegen einen strikten Recheck, die Plausibilität der Website-Scores gegen deterministische Signale.
Der av-eval-calibrator generiert verbesserte Prompt-Varianten und entscheidet
im Modus c: Auto-Übernahme nur bei gemessenem Live-A/B-Gewinn (für die messbar
A/B-fähigen Skills search-framing & prompt-designer), sonst landet die Variante als
Vorschlag im Change-Board (+ Telegram). Ein Guard (MIN_RUNS_TO_TUNE=2)
verhindert verfrühtes Tunen. Versionierte Prompts liegen im prompt_store
(<skill>.active.txt + versions/).
Ehrlich: profiler / website-scorer / gap-strategist erzeugen nur Vorschläge; mention-detector / benchmark-analyst / report-narrator sind Logik-Skills (bewertet, nicht auto-mutiert).
Eine Ehrlichkeits-Schicht vor der Interpretation der Radarfläche — entstanden aus einem realen Befund:
Eine 18-KB-Frühtruncation der HTML ließ den Crawler nur <head>+Navigation sehen
(auf modernen Seiten steht der erste Body-<h1> oft erst bei Byte 190k–540k) →
H1/Tabellen wurden systematisch als „0" erkannt, auch bei Profi-SEO-Seiten, und der Score wurde dadurch
fälschlich gedrückt. Fünf Härtungen: