Für ein Re-Audit zuerst der Abgleich: die 7 Befunde des letzten Reviews und ihr Status.
| Befund | Status |
|---|---|
| Drei inkonsistente Modelle sichtbar (8 vs. 7 Dimensionen) | GELÖST — Ein Modell überall: 7 Kern-Dimensionen, „Knowledge-Catalog" ist jetzt optionales Agentic-Modul (intern wird 8-achsig weitergemessen, transparent dokumentiert). Alte Reports tragen einen „Archiviert — Methodik v2"-Banner. |
| „ARD" kollidiert mit Googles Agentic Resource Discovery | GELÖST — Außen-Titel jetzt „KI-Sichtbarkeits-Gap-Assessment" (EN: Search & AI Visibility Gap Assessment); ARD nur noch in der Methodik mit Disambiguierungs-Hinweis. |
| llms.txt / ai-catalog / H1 / og:type als KI-Hebel gescored | ENTSCHIEDEN, wirkt ab nächstem Messzyklus — De-Scoring-Rubrik ist spezifiziert; scharf geschaltet wird je Gruppe erst bei der nächsten regulären Messung, damit keine Mess-Serien gemischt werden. |
| Single Engine als Multi-Engine verkauft | GELÖST — Reports sagen jetzt überall: „explorative Stichprobe über eine dokumentierte Engine (Claude + WebSearch), kein Multi-Engine-Zensus". Ein echter Multi-Engine-„Verified Benchmark" ist als eigener Tier in Arbeit (s. Roadmap W5). |
| Rechenfehler: Leader-Label widersprach der eigenen Tabelle | GELÖST + TEST-GESICHERT — Der Leader wird jetzt aus derselben Tabelle inklusive des Subjekts berechnet (vorher: argmax nur über Wettbewerber). 3 Regressionstests in der Suite. |
| Veraltete „Sitelinks-Suchfeld"-Metrik | GELÖST — stammte aus einem Alt-Report, der jetzt archiv-gebannert ist. |
| Spider mit Null-Achsen verwirrend; Kacheln + Prioritätenmatrix fehlen | GELÖST (angepasst) — Two-Spider-Modell bewusst beibehalten, aber: nicht gewertete Achsen werden grau gepunktet mit Rohwert gezeigt (kein Null-Kollaps), plus neue Ergebnis-Kacheln und Prioritätenmatrix in jedem Report. Der zeitgewichtete Overall-Wert ist zur Szenario-Projektion (HYPOTHESIS) herabgestuft. |
Jeder Skill ist eine eigenständige Datei (Markdown, im Browser lesbar). Evaluations-relevante Fragen: Sind die Bewertungsregeln eindeutig? Gibt es Redundanz oder Widersprüche zwischen Skills? Sind die Guardrails (keine Garantien, ehrliche Labels) konsequent? Wo würde ein anderes Bewertungs-Modell zu anderen Scores kommen?
| Skill | Aufgabe |
|---|---|
av-actionability | Bewertet die Readiness-Dimension „Actionability & Agentic Viability" — kann ein Mensch UND ein browser-/tool-nutzendes System den nächsten Schritt verstehen und |
av-benchmark-analyst | Optionaler Wettbewerber-Benchmark des KI-Sichtbarkeits-/ARD-Audits — erweitert das Gap Assessment je Achse um FELD (Wettbewerber-Schnitt) und BEST (stärkster We |
av-eval-calibrator | Meta-Skill des AI-Visibility/ARD-Readiness-Audits. Bewertet nach JEDEM Audit-Lauf die Outputs der 8 Phasen-Skills anhand gratis abfallender Ground-Truth-Signale |
av-evidence-trust | Bewertet die Readiness-Dimension „Evidence & Trust" — verdient sich das Unternehmen sichtbar Vertrauen für seine Behauptungen (Autorschaft, Quellen, Aktualität, |
av-gap-strategist | Übersetzt in Kapitel B des KI-Sichtbarkeits-/ARD-Audits die Soll-Ist-Lücken je Achse in priorisierte, quick-win-sortierte Maßnahmen samt Projektion. |
av-guardrails | Meta-Skill des 7-Dimensionen-Readiness-Audits, der jeden Output ehrlich hält — vergibt die Evidenz-Labels MEASURED/VERIFIED/HYPOTHESIS/MISSING_DATA, erzwingt di |
av-intake | Baut das Client-Intake-Schema des 7-Dimensionen-Readiness-Audits — sammelt Domain, Zielmarkt, Geschäftsmodell, Conversion, Angebote, Wettbewerber, Access-Flags, |
av-knowledge-catalog | Bewertet die Readiness-Dimension „Knowledge-Catalog Readiness" — stellt das Unternehmen einen verifizierten, maschinenlesbaren Datensatz bereit, den KI-/Agent-S |
av-mention-detector | Erkennt in jeder KI-Antwort Marken-/Wettbewerber-Nennungen und zitierte Quell-Domains und trennt Mention Rate ⟂ Share of Voice (SoV nur mit Peer-Set/Connected-A |
av-organic-reach | Bewertet die Readiness-Dimension „Organic Search Reach" — fängt das Unternehmen heute relevante unbezahlte Suchnachfrage ein? Nutzen im 7-Dimensionen-Readiness- |
av-profiler | Baut Phase 1 des KI-Sichtbarkeits-/ARD-Readiness-Audits — extrahiert aus dem rohen Startseiten-Text einer Marke ein strukturiertes JSON-Markenprofil. Nutzen, we |
av-prompt-designer | Erzeugt in Phase 2 realistische, journey-verteilte Test-Such-Prompts für KI-Suchmaschinen aus dem BrandProfile — nutzen, wenn ein AI-Visibility-/ARD-Readiness-A |
av-report-narrator | Letzte Phase des KI-Sichtbarkeits-/ARD-Audits — rendert die Audit-Ergebnisse zu einem lesbaren HTML-Report im Holocron-Stil (Spiderdiagramm, Soll-Ist-Lücken, pr |
av-search-framing | Liefert die Phase-3-Präambel, die eine Such-Engine im KI-Sichtbarkeits-/ARD-Audit so rahmt, dass Claude faktenbasiert, mit namentlichen Anbietern + URL und eine |
av-tech-discoverability | Bewertet die Readiness-Dimension „Technical Discoverability" — können Suchsysteme die wichtigen Seiten zuverlässig crawlen, rendern, indexieren und interpretier |
av-website-scorer | Bewertet die 6 website-basierten Achsen der KI-Sichtbarkeit (Technical Discoverability, Offer & Entity Clarity, Evidence & Trust, Content & Journey Coverage, Ac |
| Woche | Inhalt | Status |
|---|---|---|
| W1 | Modell-Freeze, ein konsistentes Modell auf allen Flächen, neue Report-Elemente, Umbenennung | FERTIG (07.07.) |
| W2 | Doku je Dimension (Definition, Datenquelle, Gewichtung, Confidence, Testfälle) + De-Scoring-Rubrik | FERTIG (07.07.) |
| W3–4 | Validierung an 3 Bestands-Gruppen (Rezept-Portale, Sonnenschutz, Vitalpilze): Messungen vervollständigen, jedes Ergebnis manuell gegenprüfen | ab 14.07. (Mess-Läufe bewusst pausiert) |
| W5 | Multi-Engine „Verified Benchmark"-Protokoll (ChatGPT, Gemini, Claude — mit Prompt/Land/Sprache/Zeit/Engine/Antwort-Protokoll je Abfrage) | Harness fertig, Pilotlauf offen |
| W6 | Connected-Audit-MVP (Google Search Console, read-only, eigene Property) → Confidence A + „rankt-aber-wird-nicht-zitiert"-Liste | Auth-Unterbau fertig, Anbindung offen |
| W7 | 3 Pilotreports mit Wetten + Verlaufs-Sektion; menschliche Schlussprüfung vor jeder Weitergabe | offen |
| W8 | Übergabe-Paket (Methodik-Onepager DE/EN, Beispielreport, Bausteine) — keine eigene Preisseite | Entwürfe fertig, Abnahme offen |
Bekannte Grenzen (by design, Stand heute): Cold Audit = explorative Stichprobe über eine Engine · Rezept- und Sonnenschutz-Gruppe haben teils erst 1–2 von 3 Tageszeit-Messungen · Spielzeug/Narayana bewusst auf Methodik v2 belassen (Banner) bis zum regulären Zyklus · Methodik-Doku aktuell DE (EN-Onepager folgt mit W8).
Feedback bitte direkt an Frank (persönlich/Telegram) — gern strukturiert als 🔴 kritisch / 🟡 sollte / 🔵 Anmerkung je Befund, mit Link auf die betroffene Stelle. Besonders wertvoll: konkrete Widersprüche zwischen zwei Flächen, Rechenwege, die nicht aufgehen, und Formulierungen, die mehr versprechen als gemessen wurde.