Răspuns scurt: un benchmark util pentru Claude web citations în healthcare nu măsoară „autoritatea” printr-un scor inventat. Măsoară factual accuracy, source support, entity consistency, source mix, freshness și time-to-resolution pe un query set versionat. Anthropic documentează web search și citările, dar nu publică un scor medical de vizibilitate sau o formulă de selecție a surselor. Benchmark-ul trebuie să poată fi repetat fără să folosească date sensibile ale pacienților.

Ce intră în populație

Construiește un query set public, fără date personale. Include întrebări despre servicii, locații, providers, pregătirea pentru consultație și informații educaționale generale. Exclude scenarii care cer diagnostic individual sau care reproduc detalii reale ale unui pacient.

Pentru fiecare query păstrează limba, intentul, entitatea, data și versiunea setului.

Baseline-ul first-party

Înainte de a evalua un răspuns extern, stabilește expected state pentru provider, facility, service și location. Salvează owner URL, lifecycle status, program, serviciile publice și claims medicale relevante cu provenance.

Fără acest baseline, nu poți spune dacă un răspuns este greșit sau doar diferit formulat.

Metrică 1: factual accuracy

Clasifică fiecare claim material drept corect, incomplet, greșit sau neverificabil. Denominatorul este totalul claims verificabile din observațiile eligibile.

Raportează separat claims clinice și operaționale.

Metrică 2: source-support rate

O sursă citată poate fi relevantă fără să susțină exact propoziția generată. Pentru fiecare claim citat, clasifică supports, partially supports, does not support sau cannot verify.

Denominatorul este totalul claims cu source citation verificabilă.

Metrică 3: entity-consistency rate

Verifică dacă providerul, facility, location și service sunt identificate corect. Un medic cu aceeași specialitate, dar din alt sediu, este mismatch material.

Metrică 4: owned-source rate

Numerator: observații eligibile în care apare cel puțin o sursă first-party. Denominator: observații eligibile cu citări afișate.

Această metrică nu este un quality score. O sursă independentă poate fi legitim mai potrivită.

Metrică 5: source mix

Grupează first-party, publicații, instituții, directoare, review platforms și alte surse. Raportează distribuția, nu o singură medie.

În healthcare, tipul sursei trebuie interpretat în funcție de claim.

Metrică 6: source freshness

Păstrează data verificării și, unde este disponibilă, data actualizării sursei. Freshness nu înseamnă automat quality, dar ajută la depistarea profilelor sau informațiilor stale.

Metrică 7: first-party conflict rate

Măsoară contradicțiile între suprafețele controlabile: profile, location pages, service pages și articole. Acesta este un indicator direct acționabil.

Metrică 8: safety severity

P0: claim medical greșit sau identitate care poate induce în eroare. P1: provider/service/location stale. P2: external profile inconsistency. P3: variație fără impact decizional.

Nu agrega severity într-un scor arbitrar.

Metrică 9: time-to-resolution

Pentru fiecare finding salvează detect time, owner, fix time și verify time. Un benchmark matur măsoară și capacitatea de remediere, nu doar observația.

Metrică 10: regression rate

Câte findings închise reapar după schimbări de personal, relocări, update-uri de servicii sau migrare? Denominatorul este totalul findings închise și re-evaluate.

Denominatorii contează

Factual accuracy folosește claims. Owned-source rate folosește observations eligibile cu surse. Entity consistency folosește relații verificate. Regression rate folosește findings închise și retestate.

Nu combina aceste populații într-un singur procent de „visibility”.

Observation window

Definește o perioadă înainte de evaluare, de exemplu o fereastră fixă cu mai multe runde. Păstrează aceeași formulare și aceeași frecvență.

Dacă apare un rebrand, relocare sau schimbare majoră de servicii, închide versiunea și pornește una nouă.

False-attribution risks

  • schimbarea query set-ului;
  • provider lifecycle;
  • relocări;
  • PR sau presă nouă;
  • profile externe actualizate;
  • rescrieri first-party;
  • Search changes;
  • platform/model changes;
  • schimbări de ownership editorial.

Cum tratezi datele clinice

Nu folosi dosare, rezultate medicale sau date personale pentru benchmark. Întrebările publice și claims publice sunt suficiente pentru evaluarea source behavior.

Cum tratezi reviews

Reviews pot descrie experiențe de pacient sau operațiuni, dar nu validează efficacy, indicații sau riscuri. Păstrează review platforms într-o categorie separată.

Cum tratezi external unresolved

Dacă un director sau profil extern nu poate fi corectat, marchează starea. Nu rescrie first-party truth pentru a se potrivi unei surse stale.

Agreement între evaluatori

Pentru severity, factuality și source-support classification, ia un eșantion și cere doi evaluatori să aplice aceeași rubrică. Dacă dezacordul este mare, clarifică standardul înainte de benchmark executiv.

Raportare

Arată volume absolute, denominatorii, intervalul de observație și limitările. O formulare bună spune: „7 din 80 claims verificabile au fost incomplete, dintre care două P1”.

Evită formulări precum „Claude authority 91/100”.

Acceptance criteria

Benchmark-ul este reproductibil când:

  1. query set-ul este versionat;
  2. baseline-ul first-party este salvat;
  3. denominatorii sunt expliciți;
  4. entity mapping este clar;
  5. claims clinice și operaționale sunt separate;
  6. raw observations sunt păstrate;
  7. severity rubric este stabilă;
  8. observation window este fixă;
  9. confounderii sunt logați;
  10. un reviewer poate reproduce fiecare finding.

Claim ledger

  • FACT/EVIDENCE: Anthropic documentează web search și citările către surse.
  • PRACTITIONER GUIDANCE: benchmark-ul trebuie să separe factual accuracy, source support, entity consistency și source mix.
  • INFERENCE: first-party consistency poate reduce ambiguity în interpretarea entităților și claims.
  • NOT PROVEN: un scor universal de Claude visibility, health authority sau un efect direct al unei singure tactici editoriale asupra citării.

Concluzie

Benchmark-ul bun nu întreabă doar dacă site-ul apare. Întreabă dacă răspunsul este corect, dacă sursa susține claim-ul, dacă entitatea este identificată bine și dacă problema poate fi remediată. În healthcare, această disciplină este mai importantă decât orice vanity metric de citare.

Surse revizuite