Operational Excellence for Agentic Enterprise

Operational Excellence for Agentic Enterprise

Operasjonell ekspertise for agentiske systemer utvider tradisjonelle DevOps-rutiner for å løse de unike egenskapene til AI-agenter: ikke-deterministisk virkemåte, kontekstuelt avhengig tenkning og minne, målkompleksitet og variable utledingskostnader. Konvensjonelle programmer følger forutsigbare kodebaner, men agenter genererer nye svar basert på kontekst. Tradisjonell overvåking sporer kjente målinger, mens agentobservasjon krever forståelse av språkmodellbegrunnelser og beslutningsmønstre. Standard testing validerer deterministiske utdata, men agentvalidering vurderer svarkvalitet på tvers av flere dimensjoner, inkludert nøyaktighet, relevans, sikkerhet og rettferdighet.

Produkter og systemer endres over tid, så bruk disse fem utformingsprinsippene for å bygge inn operasjonell dyktighet i måten du kjører dem på: utvikle med observabilitet, standardiser driftsprosedyrer, ta i bruk en DevOps-kultur, automatiser for effektivitet og lær fra alle driftshendelser. Nøkkelprinsippet for operasjonell ekspertise, "Evolution with observability", blir avgjørende for agentiske systemer fordi agentvirkemåte kommer ut fra komplekse interaksjoner mellom ledetekster, hentet kontekst, modellvirkemåte og samtalehistorikk i stedet for fra deterministisk kodeutføring. Arkitekter kan ikke forutsi alle agentsvar på utformingstidspunktet, da svar formes av modellen, ledeteksten og direktekonteksten, så utform for observabilitet og vakthull. Omfattende observabilitet viser hvordan agenter faktisk oppfører seg under virkelige forhold. Denne synligheten aktiverer datadrevne forbedringer og rask problemdiagnose når agenter produserer uventede utdata.

Operations as Code (Operasjoner som kode) tar på seg nye dimensjoner for agenter. Tradisjonell infrastruktur som kode omfatter versjonsbehandling med ledetekster, behandling av modellkonfigurasjoner og automatisering av agentdistribusjon. Agentoperative prosedyrer håndterer modellversjonsendringer, ledetekstutvikling og oppdateringer av Knowledge, og konvensjonelle distribusjons- og tilbakeføringsoperasjoner.

"Lær fra alle driftshendelser" blir enda mer verdifullt med agentiske systemer. Agenthendelser viser ofte små tekniske problemer med ledetekster, skript- og orkestreringsfeil, gap i Knowledge eller uventede brukerinteraksjonsmønstre. Postmortems kombinert med systematisk analyse av agent telemetry transformerer operasjonell opplevelse til organisasjonsfunksjonalitet som sammensettes over tid.

Fullstendig samtalelogging danner grunnlaget for agentobservasjon. Registrer hver samtale, inkludert brukerinndata, agentsvar, årsakstrinn, handlinger kalt opp, data hentet og endelige utfall. Denne telemetrien tjener flere formål: feilsøke spesifikke hendelser, kvalitetsanalyse på tvers av mange interaksjoner, samsvarsrevisjon, modellforbedring og analyse av bruksmønstre.

Bruk den innebygde øktsporingsmodellen over tilpasset logging. Agentforce øktsporing fanger opp agentinteraksjonsdata i en forent datamodell på Data 360 i stedet for å kreve at du bygger et parallelt telemetersystem. STDM (Session Tracking Data Model) registrerer samtalen som et sporingshierarki. Hver økt inneholder interaksjoner (svinger), hver interaksjon inneholder trinn (UserInputStep, LLMExecutionStep, FunctionStep), og trinn inneholder meldinger (bruker- og agentkommunikasjon). STDM bruker standard Data 360-objekter som AIAgentSession, AIAgentSessionParticipant, AIAgentInteraction, AIAgentInteractionStep og AIAgentInteractionMessage. Interaksjoner bærer identifikatorer for distribuert sporing (TelemetryTraceId og TelemetryTraceSpanId), og trinn bærer en span-identifikator (TelemetryTraceSpanId), som gjenspeiler en OpenTelemetry-stil span-modell.

Modellering av agentsamtaler som sporer og omfatter er bransjestandardtilnærmingen til agentobservasjon, og gjenbruk av den innebygde modellen unngår skaleringsproblemer som håndlagde objekter kjører i: lagring av samtaler med flere omgange, store JSON-belastninger og rask datavekst. Å bygge tilpassede transaksjonsobjekter for å logge samtaler er et bevisst unntak – for eksempel et lett tilpasset objekt som korrelerer agentvirkemåte med forretningsutfall og ikke det primære loggingsubstratet.

Metadata for økter og samtaler fanger opp viktig kontekst, inkludert økt- og interaksjonsidentifikatorer, brukeridentitet, agentidentitet, starttidspunkt og sluttidspunkt. STDMalso kobler hvert interaksjonstrinn til sine store språkmodell (LLM)-kallposter (via GenerationId- og GenAiGatewayRequest/Response-referanser). Detaljer om tokenbruk, modell og ledetekst er tilgjengelig via disse koblingene i stedet for lagret som øktfelt. Metadata aktiverer filtrering og aggregering av samtaler for mønsteranalyse.

Interaksjons- og trinnnivådetaljer fanger opp hver omgang, inkludert brukerinndata, agentsvar, årsaksforklaring (når tilgjengelig), konfidensscore, hentet kontekst, handlinger som er forsøkt og feil som oppstår. Sporing på trinnnivå muliggjør detaljert hendelsesundersøkelse som rekonstruerer nøyaktig hva som skjedde på hvert punkt i vurderingskjeden.

Handlingstrinn registrerer hver handling en agent utfører, inkludert API-kall, dataendringer, interaksjoner mellom eksterne systemer og integrasjoner som kalles opp. Handlingsposter besvarer spørsmål som "hva endret denne agenten?" og "Hvilke systemer fikk denne agenten tilgang til?" Disse svarene støtter sikkerhetsundersøkelser og krav til samsvar. STDM fanger opp handlinger som innebygd som interaksjonstrinn.

Årsaksspor fra Atlas Reasoning Engine avdekker agentbeslutningsprosesser og bidrar til å diagnostisere hvorfor agenter valgte bestemte handlinger eller genererte bestemte svar. Øktsporing registrerer planleggingens trinn som en del av hver interaksjon. Dybden av eksponerte vurderinger avhenger av modellen og planleggeren, men når disse sporene er tilgjengelig, forbedres feilsøking dramatisk.

Den generative AI-revisjonssporet i Einstein Trust Layer fanger opp hver generative AI-interaksjon, meldings- og svarteksten – inkludert personlig identifiserbar informasjon (PII)-maskerte versjoner – hentede jordingsdata, svarsikkerhets- og toksisitetsscore og LLM-modelldetaljer – alt strømmet til og lagret i Data 360. Slå på Einstein Generative AI og Tilbakemeldingsdatainnsamling og lagring slik at revisjons- og tilbakemeldingsdata fanges opp i Data 360 – der du kan spørre og analysere dem med Data 360-rapportering for langsiktig oppbevaring.

Eksempel:

Bra: Samtalelogger lagret i tilpassede Salesforce-objekter med felt for brukerinndata, agentsvar, handlinger som utføres, tokenforbruk og samtaleutfall. Kontrollpanelet viser suksessfrekvenser for samtaler etter agent og bruksområde. Bedre: Omfattende logging inkluderer resonansspor som viser agentbeslutningsprosess, hentet kontekst som viser hvilken informasjon som grunnlegger svar, og konfidensscore som indikerer usikkerhet. Best: Samtaleanalyse korrelerer agentvirkemåte med forretningsutfall, identifiserer forbedringsmuligheter gjennom mønsteranalyse og leverer kontinuerlig opplæring under behandling med kvalitetsmerkede eksempler.

Overvåk operasjonell ytelse for å sikre at agenter oppfyller tjenestenivåer og opererer innenfor forventede parametere.

Svarlatens sporer slutt-til-slutt-tiden fra brukerinndata til agentrespons. Latens påvirker brukeropplevelsen direkte. Mål latens ved prosentiler (p50, p95, p99) som viser typisk ytelse og opplevelser i verste tilfelle. Varsle når p95-latens overskrider terskler som indikerer nedgang i ytelsen.

Latensfaktorer for agenter inkluderer modellutledningstid, varighet for data og kontekst henting, utføring av eksterne verktøy og handlinger og nettverkslatens. Instrumenter hver fase separat for å aktivere målrettet optimalisering når den generelle latensen overskrider målene.

Tokenforbruk måler tokener som brukes per samtale, per agent og per bruksområde. Tokenforbruk driver utledingskostnader og påvirker responstiden (flere tokener krever mer utledingsberegning). Spor tokenfordeling som viser om faktisk bruk samsvarer med projeksjoner. Oppdag utenforliggende samtaler som bruker for store tokener, som foreslår ledetekstproblemer eller misbruk.

Tokenmålinger inkluderer ledetekster (inndata til modell), fullføringstokener (modellutdata) og totalt antall tokener (summen av ledetekster og fullføring). Ledetekster er mer kontrollerbare enn fullføringstokener. Optimaliser ledetekster og hentet kontekst ved å redusere forbruket av ledetekster samtidig som kvaliteten opprettholdes.

Dataovervåkning sporer samtidige samtaler, forespørsler per sekund og trender for samtalevolum, og kan bidra til prosjektekapasitet og skaleringskrav. Sammenlign gjeldende gjennomløp med kjente frekvensgrenser eller varsler om kapasitetsstandardlinjer når terskler nærmer seg.

Feilfrekvenssporing overvåker feil etter type, inkludert modellspesifikke feil, tidsavbrudd, tillatelsesneddelte feil og eksterne integrasjonsfeil. Feilmønstre viser systematiske problemer som krever rettelse. Beregne feilfrekvenser som prosentandel av totalt antall forespørsler som aktiverer sammenligning på tvers av agenter og tidsperioder.

Skill mellom feilkategorier som krever forskjellige svar. Modellspesifikke feil kan kreve ledetekstjusteringer eller bytte til en bedre modell. Tillatelsesfeil krever sikkerhetskonfigurasjonsendringer. Integrasjonsfeil krever ekstern systemundersøkelse eller aktivering av kryssbryter.

Tilgjengelighetsovervåking måler agentenes oppetid og vellykkede driftsperioder. Beregn tilgjengelighet som prosentandel av hvor mange tid agenter som svarer på forespørsler. Spor tilgjengelighet mot tjenestenivåmål (SLO-er) og aktiver proaktiv respons når tilgjengeligheten faller under målene.

Proactive Monitoring evaluerer organisasjonen for plattformavvik og ressursutnyttelsesproblemer som kan påvirke agentinfrastrukturens tilstand. Den viser signaler før de eskaleres til brukersynlige problemer. Bruk den til å holde seg foran betingelser på infrastrukturnivå, som uvanlig API-aktivitet eller trend for ressursforbruk mot plattformgrenser, som kan redusere agentytelsen. Se gjennom signalene i forhold til agentenes normale driftsstandard slik at du kan skille handlingsavvik fra forventet variasjon.

Overvåk svarkvalitet kontinuerlig for å oppdage nedgang før det påvirker forretningsutfall. Når plattformen tilbyr innebygde evalueringsverktøy, bruker du dem i stedet for tilpassede eller manuelle prosesser. Start med innebygde test- og evalueringsverktøy. Med Agentforce-testsenter kan du vedlikeholde gjenbrukbare test-sakssett og kjøre agenter mot dem i batcher, og sjekke om agenten valgte det forventede emnet og handlingen og produserte en akseptabel respons i stedet for å bygge og kjøre ditt eget testbånd. Den støtter også innebygde evalueringer, inkludert forhåndsdefinerte kvalitetsdimensjoner og en LLM-tilnærming som dommer for scoring av samtalekvalitet, og den tillater redigering av tilpassede evalueringer for organisasjonsspesifikke kriterier. Bruk representative samtaler i testsett slik at evalueringen gjenspeiler faktisk bruk.

Svarpresisjonen måler om agentsvar inneholder riktig informasjon. Nøyaktig evaluering krever deklarasjoner med kjente svar eller menneskelig gjennomgang. For faktiske spørsmål med kjente svar sammenligner automatisert evaluering agentsvar med riktige svar. Behold disse som testtilfeller i Testing Center for gjentagende evaluering. Når det gjelder åpne spørsmål, vurderer evaluerere nøyaktigheten på samtaler med utvalg. Spor nøyaktighetstrender over tid for å avdekke om endringer i ledetekster, modelloppdateringer eller endringer i Knowledge forbedrer eller reduserer ytelsen.

Svarrelevans måler om agentsvarene adresserer brukerspørsmål riktig selv om de ikke er helt nøyaktige. Relevante svar forstår brukerhensikt og gir nyttig informasjon selv om et fullstendig svar ikke er mulig. Evaluer relevans via innebygde evalueringer der det er tilgjengelig, menneskelig gjennomgang av sammendragssamtaler og brukersignaler. For agenter som er grunnlagt i en Knowledge, kan innebygd hentingskvalitetsanalyse vurdere kontekstrelevans, svarrelevans og lojalitet (grundighet) for svar.

Guardrails oppdager usikre, upassende eller skadelige svar, inkludert systematiske avvik, støtende innhold, farlige råd og omfangsfrie svar. Einstein Trust Layer bruker toksisitetsdeteksjon på LLM-interaksjoner ved kjøretid, som er din første forsvarslinje. Forbedre sikkerhetsovervåking gjennom innholdsfiltrering, manuell gjennomgang av utvalg, brukerrapporteringsmekanismer og rettferdighetsrevisjoner som vurderer fordelingen av utfall på tvers av demografiske grupper.

Brukertilfredshetsmålinger fanger opp subjektiv opplevelseskvalitet. Agentforce flyter inn i Einstein generative AI-revisjons- og tilbakemeldingsdatamodeller (GenAIFeedback/GenAIFeedbackDetail i Data 360). Disse modellene fanger opp eksplisitte brukersignaler – tommel opp/ned, godta/avvise, redigere og ordrette kommentarer – fra en menneskelig eller systemkilde, sammen med gatewayforespørselen og genereringsdata.Fang opp eksplisitt tilbakemelding (spør etter før eskalering, etter avsluttet samtale og gjennom oppfølgingsundersøkelser) der du trenger det, og kombiner eksplisitte og implisitte signaler for et omfattende kvalitetsperspektiv.

Salesforce har ulike modelloverflater. Generativt sjikt sørger for at samtalebegrepende agenter kjører på: Agentforce modeller leverer forhåndsdefinerte vurderinger innenfor Salesforces Trust, og henter dine egne LLM-lenker (BYOLLM) til eksterne LLM-er eller -leverandører. Forutsigelsessjiktet leverer de strukturerte scorene agenter baserer sine beslutninger på: BYOM trekker ut nul-kopi-forutsigelsesscore fra eksternt driftede plattformer, og innebygde Einstein produserer automatisert scoring og klassifisering på CRM-objekter. Sammen gir disse overflatene en autonom agent anledning på naturlig språk samtidig som arbeidsflyten baseres på strukturerte, statistiske data.

Overvåk modellavvik, som angir redusert ytelse over tid eller endrede betingelser som krever tilpassing. Se gjennom utgivelsesmerknadene og test viktige brukstilfeller i en Sandbox-organisasjon før hver hovedutgivelse går til produksjon. Bruk utgivelsesmatrisen og Sandbox-forhåndsvisningsvinduet til å fange opp kompatibilitetsproblemer tidlig.

Ytelsesavvik oppstår når agentens nøyaktighet, relevans eller sikkerhet reduseres over tid. Spor kvalitetsmålinger over tid og oppdag statistisk betydelige nedganger. Ytelsesavvik kan være et resultat av modellforringelse, utdatert Knowledge, feiljustering av ledetekster med endrede bruksmønstre eller konseptavvik der relasjoner mellom inndata og ønskede utdata utvikler seg.

Opprett standardytelse umiddelbart etter den første agentdistribusjonen som måler nøyaktighet, relevans, sikkerhet og tilfredshet på tvers av representative testtilfeller. Evaluer regelmessig på nytt mot de samme testtilfellene som viser ytelsesendringer uavhengig av skift i bruksmønster.

Varsle når kvalitetsmålinger faller ut over gyldige terskler. Definer terskler basert på toleranse for forretningsinnvirkning. Enkelte brukstilfeller tåler beskjeden kvalitetsforringelse, mens andre krever umiddelbar respons på eventuell nedgang.

Fordeling av avvik oppstår når brukerinndataprofiler endres betydelig fra opplærings- eller avstemmingsdatadistribusjoner. Distribusjonsavvik reduserer ytelsen når agenter støter på inndatatyper de ikke ble utformet for å håndtere. Overvåk inndataegenskaper, inkludert spørsmålslengde, emnefordeling, språkkompleksitet og domeneterminologi, som oppdager betydelige skift.

Sammenlign gjeldende inndatadistribusjoner med historiske standarder. Store fordelingsskift kan indikere nye bruksområder, endring av brukervirkemåte eller utvikling av forretningsprosesser. Distribusjonsskift kan kreve ledetekstoppdateringer, utvidelse av Knowledge eller forbedringer av agentegenskaper.

Virkemåteavvik oppstår når agentenes responsmønstre endres uventet. Overvåk svaregenskaper, inkludert gjennomsnittlig responslengde, handlingsoppkallfrekvenser, eskaleringsfrekvenser og feilmønstre. Betydelige virkemåteendringer kan indikere ledetekstproblemer, modellproblemer eller underliggende systemendringer.

Opprett grunnleggende virkemåter tidlig i produksjonsorganisasjonen, og fange opp normale driftskarakteristika som vanlige ytelsesmønstre, verktøybruk og beslutningsbaner. Disse basislinjene blir referansen som senere avvikdeteksjon måler mot. Sammenlign pågående virkemåte med basislinjer for å varsle om avvik overskrider forventet variasjon.

Automatisk varsling muliggjør proaktiv driftrespons. Konfigurer utløsing av varsler når avviksmålinger overskrider terskler som utløser undersøkelse og potensiell rettelse, inkludert forbedring av ledetekster, oppdatering av Knowledge, utvidelse av testsett eller BYOM-modellopplæring på nytt.

Oppdag automatisk uvanlig agentvirkemåte som krever undersøkelse.

Kostnadsavvik, inkludert stigninger i tokenforbruk, økninger i utledningsfrekvens eller total kostnadsakselerasjon. Kostnadstopp kan indikere ledetekstproblemer som fører til overdreven tokengenerering, misbruk eller misbruk som fører til uventet bruk, eller infrastrukturproblemer som fører til overflødige samtaler.

Overvåk tokenforbruksfordelinger som oppdager utenforliggende samtaler. Undersøk samtaler som bruker 10 ganger antall typiske tokener, for å forstå om de representerer legitime kanttilfeller eller problemer som krever rettelse.

Høye feilfrekvenser inkludert plutselige økninger i feilfrekvenser, nye feiltyper som ikke fantes i baseline, eller lokaliserte feilkonsentrasjoner som påvirker bestemte brukere, agenter eller brukstilfeller. Feiltopptekster kommer ofte foran problemer med kvalitetsforringelse som kunder kan se. Proaktiv deteksjon aktiverer rettelse før omfattende påvirkning.

Svarmønsterendringer inkludert plutselige skift i responslengde, handlingsoppkallshyppighet eller eskaleringsfrekvensendringer. Mønsterendringer kan indikere ledetekstproblemer, endringer i modellvirkemåte eller utviklende bruksmønstre.

Samtaleavbrudd øker der brukere avslutter samtaler med høyere frekvens, noe som tyder på redusert kvalitet, økt latens eller funksjonalitetsluker. Spor avbrudd etter samtalefase som identifiserer om brukere avslutter under den første interaksjonen, midt i samtalen eller etter forsøk på fullføring av oppgaven. Oppgivelsesmønstre viser spesifikke forbedringsmuligheter.

Utform varselarkitektur som balanserer raskt varsel mot varselutmattelse. Distribuer viktige agentfeil til ingeniører på oppringing umiddelbart. Distribuer advarsler om kvalitetsforringelse til produkttemaer for undersøkelse i åpningstidene. Aggreger mindre avvik i daglige sammendrag for trendanalyse.

Versjonskontroll for ledetekster, konfigurasjoner og modellmetadata som aktiverer tilbakestilling, A/B testing og revisjonssporvedlikehold.

Promptmaler er gjenbrukbare ledetekster opprettet i Ledetekstbygger som definerer agentens mål, begrensninger og retningslinjer for merkeprofilering, pluss plassholdere for dynamiske jordingsdata, som kunde- eller produktdetaljer. Lagre ledetekstmaler i Git sammen med programkode, og behandle ledetekster som kritisk programlogikk som fortjener samme rigor som kode. Endringer i ledeteksten går gjennom kodegjennomgang, testing og kontrollert distribusjon.

Bruk Ledetekstbygger til gjentagende ledetekstutvikling med versjonshistorikk og testing. Når du bruker ledetekstmaler som agenthandlinger, forhåndsviser du malen i Ledetekstbygger for å bekrefte at flettefeltene løses riktig. Bruk deretter Testing Center til å kjøre ende-til-slutt-tester som bekrefter at agenten velger handlingen og genererer de riktige utdataene.

Eksporter produksjonsklargjorte ledetekster til versjonskontroll for å opprette synkronisering mellom Ledetekstbygger og kildekontrollert distribusjon under behandling.

Konfigurasjonsbehandling sporer modellvalg, temperaturinnstillinger, hentingskonfigurasjoner og funksjonsflagg. Lagre konfigurasjoner som kode slik at du kan bruke miljøspesifikke verdier, automatisere distribusjoner og oppdage konfigurasjonsavvik.

Semantisk versjonsbehandling gjelder for agentutgivelser. Hovedversjoner angir bruddendringer som endrede inndata/utdatakontrakter eller betydelig endret virkemåte. Mindre versjoner angir funksjonstillegg eller forbedringer som beholder kompatibilitet. Patchversjoner angir feilrettinger. Versjonsnummering kommuniserer endringsinnvirkningen til driftsteam og brukere.

Implementer semantisk versjonsbehandling for agentkomponenter, inkludert ledetekstmaler, agentkonfigurasjoner og Knowledge. Versjonsnumre i logger aktiverer hendelseskorrelasjon med bestemte distribusjoner.

Endringsdokumentasjonen fanger opp grunnlaget for endringer i ledetekster, konfigurasjonsendringer og modelloppdateringer. Dokumenter hva som ble endret, hvorfor det ble endret, hvilke tester som validerte endringen, og hvilke tilbakeføringsprosedyrer som finnes. Endringsdokumentasjon øker hastigheten på hendelsesundersøkelse og Knowledge.

Vedlikehold et omfattende register over modellversjoner, ledetekster, konfigurasjoner og distribusjonshistorikk.

Modellregisteret registrerer hvilke modellversjoner som distribueres der, inkludert modellfamilie, spesifikk versjon, finjusteringstilstand, distribusjonsmiljø (produksjon, oppstillings- og utviklingsdato), distribusjonsdato og ansvarlig team. Registreringen inneholder én enkelt sannhetskilde for agentinfrastrukturstatusen.

Distribusjonssporing logger hver agentdistribusjon, inkludert distribuert versjon, miljø, tidsstempel for distribusjon, distribusjonsbruker, godkjente godkjenninger og distribusjonsresultat. Bruk distribusjonshistorikk til å vurdere innvirkningen når problemer oppstår (for eksempel "hvilke agenter ble distribuert før denne hendelsen startet?"), og til å støtte samsvarsrapportering.

Avhengighetssporing tilordner relasjoner mellom agenter, ledetekster, Knowledge-baser, handlinger og integrasjoner. Når den delte Knowledge oppdateres, viser avhengighetssporing hvilke agenter som berøres. Når eksterne integrasjoner endres, identifiserer avhengighetssporing berørte agenter.

Dokumenter avhengigheter eksplisitt i stedet for å oppdage dem under hendelser. Opprett avhengighetskart som vedlikeholdes gjennom utviklings- og distribusjonsprosesser.

Avskrivingspolicyer definerer livssykluser for modellversjoner, inkludert varighet av støtte, tidslinje for avskriving og overføringskrav. Tydelige avskrivningspolicyer behandler teknisk gjeld og hindrer ubestemt støtte for gamle modellversjoner. Opprett en avdragsplan som kommuniserer tidslinjer tilstrekkelig på forhånd for å aktivere planlagte overføringer i stedet for hastebesvar på tvungne avdrag. En velkommunisert og policybasert minimumsperiode for varsel gir tilstrekkelig overføringstid for viktige endringer.

Med tilbakestillingsprosedyrer kan team raskt gjenopprette fra problematiske distribusjoner. Dokumenter tilbakeføringsprosedyrer for hver agent og inkluderer følgende:

  • Betingelser som utløser en tilbakeføring
  • Hvilken versjon som skal tilbakestilles til
  • Slik utfører du tilbakeføringen
  • hvem som godkjenner og utfører tilbakeføringen
  • Hvilke tester som bekrefter at tilbakemeldingen var vellykket, og hvilke team som skal varsles.

Test tilbakeføringsprosedyrer regelmessig i ikke-produksjonsmiljøer for å bekrefte at de fungerer før du avhenger av dem under produksjonshendelser. Gjenta med mock-distribusjoner slik at teamet vet nøyaktig hva de skal gjøre. Ikke-testede tilbakekallingsprosedyrer mislykkes ofte når det er mest nødvendig.

Oppretthold agentkvalitet gjennom pågående opplærings-, finjusterings- og forbedringsarbeidsflyter.

Tilbakemeldingsinnsamling samler systematisk inn tilbakemeldinger fra brukere, korrigering av gjennomganger, kvalitetsvurderinger og utfallsmålinger. Tilbakemelding gir råmateriale for forbedring. Uten systematisk innsamling blir forbedring til gjetting. Innhent eksplisitt tilbakemelding via spørsmål ved å stille spørsmål før eskalering, etter avsluttet samtale eller gjennom oppfølgingsundersøkelser. Innhent implisitt tilbakemelding via fullføringsgrader, eskaleringsfrekvenser og mønstre for å prøve på nytt. Kombiner eksplisitte og implisitte signaler for å gi et omfattende kvalitetsperspektiv.

Datakurering opprettholder opplæringsdatasett av høy kvalitet gjennom kurering, kvalitetssjekk og systematiske avvikskontroller. Opplæringsdatakvalitet bestemmer modellkvaliteten direkte. Dårlige data produserer upålitelige modeller, gode data gir eksepsjonell ytelse.

Samtalekartlogger til opplæringsdatasett etter:

  • Filtrere etter kvalitet – inkludert høyt vurderte samtaler og vellykkede utfall
  • fjerne problematiske eksempler, inkludert sikkerhetsbrudd og feil
  • Sikre representativitet – inkludert ulike scenarier og kanttilfeller
  • Oppheve duplikater – fjerne nesten identiske eksempler

Tilpass agenter til domenet ditt – spesialisert vokabular, unike forretningsprosesser, organisasjonsspesifikk Knowledge – hovedsakelig gjennom hentforbedret generering (RAG) basert på Data 360 og ledetekstjustering, den Salesforce-baserte banen.

Ingen generative modeller er finjustert i Salesforce, du velger og konfigurerer modeller via AI-modeller og Ledetekstbygger. Når tilordningen ikke er tilstrekkelig, finjusterer du eksternt og kobler til via BYOLLM.

Promptforbedring forbedrer gjentagende ledetekster basert på ytelsesdata ved bruk av Ledetekstbygger. Ledeteknikk er kontinuerlig praksis i stedet for engangsopplæring. Etter hvert som bruksmønstre utvikler seg, forretningsprosesser endres og brukerforventninger skifter, krever ledetekster justering for å opprettholde optimal ytelse.

Opprett regelmessig kadens for gjennomgang av ledetekster som undersøker nylige samtaler, kvalitetsmålinger og tilbakemeldinger fra brukere som identifiserer forbedringsmuligheter. Implementer endringer i ledetekster trinnvis med A/B-testing som validerer forbedringer før full utrulling.

Evalueringsautomatisering utfører kvalitetsvurdering på utestående testsett som muliggjør rask vurdering av forbedringskandidater. Automatisert evaluering gir målrettet måling som supplerer subjektiv vurdering fra person.

Vedlikehold testsett som dekker gode baner, kanttilfeller, motstanderinndata og historiske problemscenarier. Angi testautomatisering til å kjøre testscenariene på en regelmessig kadens. Inkluder automatisk resultatovervåking, terskler og varsler for å varsle administratorer om avvik. Denne automatiserte testen er avgjørende for å oppdage negative effekter fra eksterne faktorer som modellavvik.

Utvid testsett kontinuerlig etter hvert som nye kantsaker vises i produksjonsorganisasjonen. Testeautomatisering er nøkkelen, men kjør også regelmessige manuelle spotkontroller, engangstester og gorilla-testing for å sikre at den agentiske distribusjonen holder i mot kanttilfeller.

Distribuer agentendringer gradvis og overvåk kvalitet før full utrulling for å begrense radiusen for problemer. Når en endring spenner over flere områder – ledetekster, modellkonfigurasjon, handlinger, jording, integrasjoner – kan den redusere virkemåten på måter som tester ikke fanger opp. Når det skjer, peker den resulterende kvalitetsregresjonen sjelden til en enkelt, åpenbar rotårsak. Send små endringer én om gangen slik at en regresjon kan spores til kilden, og slipp hver til en begrenset bit trafikk først for å inneholde innvirkningen mens du diagnostiserer.

Flaggfunksjoner kobler distribusjon fra utgivelse ved å distribuere agenter med funksjoner deaktivert bak konfigurasjonen. Implementer funksjonsflagg ved bruk av logikk- eller tilpassede metadatatyper eller tilpassede innstillinger. Funksjonsflagg aktiverer testing i produksjonsmiljøet uten å vise funksjoner til brukere, gradvis utrulling til bestemte brukersegmenter, A/B-testing med sammenligning av implementeringer og umiddelbar tilbakekalling ved å deaktivere flagg uten omdistribusjon.

Bruk funksjonsflagg til betydelige agentendringer, der en feils blastradius kan være alvorlig, som Endringer som påvirker forretningskritiske agenter, Nye vurderingsmønstre med usikker produksjonsvirkemåte Integreringer med eksterne systemer der interaksjonsmønstre kan avvike fra testing.

Canary-distribusjoner slipper agentendringer til små brukersett først for å overvåke feilfrekvenser, kvalitetsmålinger og ytelse før bredere utrulling. Bruk tillatelsessett til å kontrollere kanary-distribusjoner – begrens agenttilgang til et delsett av brukere, eller filtrer innenfor orkestreringslogikk basert på brukerattributter.

Overvåk og mål suksessfrekvenser, svarkvalitet og tilbakemeldinger fra brukere. Sammenlign kanarmålinger mot kontrollgrupper med den forrige agentversjonen. Utvid utrullingen bare når kanary viser tilsvarende eller forbedret ytelse.

A/B testing sammenligner agentvariasjoner som måler kvalitet, kostnad og brukertilfredshet. A/B testing gir empirisk bevis for forbedringsbeslutninger. Distribuer varianter til tilfeldig valgte brukerdelsett for å sikre statistisk gyldighet. Mål resultater på tvers av flere dimensjoner (nøyaktighet, tilfredshet, kostnad og latens) for å gi omfattende sammenligninger.

Definer vellykkede kriterier og hypotese før du starter A/B-tester. Tydelige kriterier hindrer tvetydige resultater der noen målinger forbedres mens andre reduseres. Vellykket-kriterier bør være i samsvar med forretningsmål (for eksempel "Variant B må samsvare med Variant A-nøyaktighet innenfor 2 % samtidig som kostnadene reduseres med 15 %").

Champion-challenger-testing distribuerer forbedrede agentversjoner til delsett av trafikk sammenlignet med gjeldende superbrukerversjoner. Champion-challenger-mønster behandler forbedringsrisiko ved å beholde bekreftet versjon som reserveserver. Hvis utfordreren gjør det dårligere, går du tilbake til superbruker uten brukerinnvirkning. Hvis utfordringen yter bedre, promoterer du den til den nye superbrukeren.

Opprett målrettede promoteringskriterier, inkludert minste utvalgstørrelse for statistisk gyldighet, kvalitets terskler som utfordrere må overskride, og evalueringsvarighet før promoteringsbeslutninger. Dokumenter promoteringsbeslutninger som gir et revisjonsspor for hvorfor agentversjoner ble endret.

Opprett hendelsesregistrering som identifiserer agentoperative problemer raskt gjennom omfattende overvåking.

Agentfeilmoduser er forskjellig fra tradisjonelle programfeil. Vanlige feilmeldinger omfatter følgende:

  • Hallusinasjoner – genererer sannsynlig, men feil informasjon
  • Svar utenfor emne – misforstå brukerhensikt
  • Overdreven kostnadsforbruk - generering av kjørende token
  • Tidsavbruddfeil - utleding tar for lang tid
  • Tillatelsesfeil – forsøk på uautoriserte handlinger
  • Integrasjonsfeil - utilgjengelighet av eksternt system
  • Sikkerhetsbrudd – generere upassende innhold

Oppdag feil ved hjelp av automatisk overvåking av varsler om feilfrekvenser, nedgang i kvalitetsmålinger, kostnadsavvik, økninger i latens og brukereskaleringer. Kompletter med egenrapporteringsmekanismer for brukere, inkludert tilbakemeldingsforespørsler og tydelig veiledning om hvordan og hvor tilbakemeldinger skal gis, slik at du kan rette opp rapporterte hull i automatiseringen.

Alvorlighetsklassifisering ruter hendelser til de riktige svarpersonene med passende haster. Kritiske hendelser angir at produksjon ikke er tilgjengelig som påvirker mange brukere, at det er risiko for dataavbrudd fra agenthandlinger, at det oppstår sikkerhetskompromiss eller at det oppstår sikkerhetsbrudd som krever umiddelbar respons. Høy alvorlighetsgrad angir nedsatt kvalitet som påvirker forretningskritiske agenter eller betydelige kostnadsoverstyringer. Middels alvorlighetsgrad angir isolerte problemer eller nærmer seg terskler som krever undersøkelse i åpningstidene. Lav alvorlighetsgrad angir mindre problemer som spores utenfor hendelsesbehandlingsprosessen.

Definer alvorlighetskriterier objektivt basert på brukerinnvirkning, blast radius, risiko for dataintegritet og haster med gjenoppretting. Målkriterier hindrer undereskalering av reelle problemer og overeskalering av mindre problemer. Vedlikehold dokumentasjon om hendelsesløsningsfunn for å kontinuerlig forbedre prosessen.

De første responsprosedyrene styrer umiddelbare tiltak for å stabilisere situasjonen. Prosedyrer inkluderer følgende:

  • Deaktiver mislykket agent – aktivering av kryssbryter
  • Rut brukere til reservasjonsalternativer – personlig overføring, enklere agent, statiske svar
  • Innhente diagnostisk informasjon - siste samtaler, feillogger, ressursmålinger
  • Varsle interessenter – ingeniører, produkteiere og berørte brukere
  • Start hendelseskommunikasjon – statussideoppdateringer, interne koordineringskanaler
  • Dokumenter første responsprosedyrer som kjørebøker som gir rask utførelse uten å kreve hendelsesspesifikk undersøkelse.
  • Kjørebøker må være kjørbare av ingeniører på oppringing uten dyp agentkompetanse.

Hindre feil med gjennomgripende utforming og opprettholde delvis funksjonalitet under agenthendelser.

Kretsbrytermønster deaktiverer automatisk mislykkede agenter som hindrer gjentatte feil og brukerpåvirkning mens problemer løses. Implementer kretsbrytere som overvåker feilfrekvenser og åpning (deaktiveringsagent) når feilfrekvensen overskrider terskelen for en varig periode.

Konfigurer kretsbrytere med feilterskel, varighetsvindu og gjenopprettingstesting. For eksempel en 50 % feilfrekvens med et rullerende vindu på fem minutter, og en periodisk prøveversjon som ber om å teste om agenten ble gjenopprettet. Når kretsen åpnes, rutes forespørsler til reservetilbudsalternativer. Etter en tidsavbruddsperiode går kretsen over til en delvis åpen tilstand som tillater at prøveforespørsler går gjennom. Når prøveforespørsler er vellykkede konsekvent, lukker du kretsen og gjenopptar normal drift.

Fallbackhierarkier gir grasiøs degradering når primære agenter mislykkes. Utform reservesekvenser som forsøker å få stadig enklere alternativer inntil et akseptabelt svar oppnås. Eksempel på reservhierarki: Primær avansert agent → Enklere sikkerhetskopieagent → Statiske svar på vanlige spørsmål → Håndheving fra person.

Implementer reservellogikk i orkestreringslaget i stedet for i agenter som aktiverer konsistent virkemåte på tvers av agentøkosystemet. Test reservebaner regelmessig og valider at de fungerer når det er nødvendig.

Menneskelig overføring eskaleres til menneskelige agenter når AI-agenter ikke kan håndtere forespørsler. Utform overføringsarbeidsflyter som beholder samtalekontekst, kommuniserer overføringsårsaken, ruter til riktige menneskelige agenter med relevant ekspertise, og sporer overføringsfrekvens som avslører forbedringsmuligheter.

Overvåk eskaleringsgrader etter emne, agent og årsak til feil. Høyere frekvenser angir gap i agentfunksjonalitet som krever forbedringer av ledetekster, utvidelse av Knowledge eller forbedring av brukstilfeller.

Graceful degradering opprettholder delvis funksjonalitet under degradert drift. Når avanserte vurderinger mislykkes, går du tilbake til enklere logikk. Når sanntidsdata ikke er tilgjengelig, opererer du på bufrede data. Når eksterne integrasjoner mislykkes, opererer du i skrivebeskyttet modus. Med god nedgang kan et system fortsette å fungere med redusert kapasitet i stedet for å mislykkes fullstendig.

Utfør uskyldige etterhendelsesgjennomganger med fokus på systemforbedringer i stedet for individuelle feil som skaper psykologisk sikkerhet for ærlig vurdering.

Timeline rekonstruksjon skaper detaljert sekvens fra startbetingelser gjennom første signal, deteksjon, bekreftelse, undersøkelse, responshandlinger, gjenoppretting og validering. Tidsstempel for hver hendelse som aktiverer varighetsanalyse av hver fase, som viser hvor hendelsessvar ble forsinket.

Inkluder følgende på tidslinjen:

  • Hva har blitt distribuert nylig (ledetekster, konfigurasjoner, modeller, integrasjoner)?
  • Hvilke endringer i bruksmønstre (sudden økning i trafikk, nye samtaletyper) ble observert?
  • Hvilke eksterne faktorer bidro (nedgang i tredjepartstjenesten, plattformoppdateringer)?
  • Hva gjorde deteksjon tregere enn ideelt?

Rotårsak identifisering bestemmer direkte teknisk årsak. Skill umiddelbar årsak (modelltidsavbrudd) fra bidragsfaktorer (ledetekstutforming overskrider tokengrenser i bestemte samtalemønstre). Rotårsaksanalyse hindrer forenklede konklusjoner ("agenten hadde en feil") til fordel for bestemte funn som fører til en effektiv rettelse.

Bruk "Five Whys"-teknikken for å gå fra symptomer til grunnleggende årsaker.

Overflate eksempel: "Agent produserte feil informasjon" → "Hvorfor? Hentet kontekst inneholdt utdaterte data" → "Hvorfor? Knowledge ble ikke oppdatert med de siste produktendringene" → "Hvorfor? Det finnes ingen prosess for produktteamet for å utløse oppdateringer av Knowledge" → rotårsak: Manglende arbeidsflyt som kobler produktutgivelser til vedlikehold av Knowledge.

Bidragsfaktorer avslører organisasjons-, prosess- eller arkitektoniske forhold som muliggjør eller forsterker hendelsesinnvirkningen. Vanlige faktorer inkluderer overvåkingshull som gjør at problemer vedvarer lenger enn det oppdages, testhull som gjør at feilscenarier ikke blir dekket, dokumentasjonshull som reduserer hastigheten på diagnostiseringen, automatiseringshull som tvinger manuelle gjenopprettingstrinn, og arkitektoniske hull som enkeltpunkter med feil eller manglende overflødighet.

Bidragsfaktoranalyse avdekker forbedringsmuligheter utover umiddelbar rotårsaksløsning. De fleste hendelser har flere bidragsfaktorer, hver med en forsterkende innvirkning.

Deteksjonsanalyse undersøker hvordan hendelsen ble oppdaget og om deteksjonen kunne ha vært raskere. Mange agenthendelser rapporteres først av brukere i stedet for automatisk overvåking, noe som indikerer et overvåkingshull. Bestem: Hvilket signal skulle ha oppdaget problemet tidligere? Hvilken overvåking vil gi raskere deteksjon? Hvilke varselkriterier ville ha blitt utløst riktig?

Forbedringer av deteksjonsanalyse inkluderer følgende: Legge til manglende overvåkingsdekning, justere varselterskler for å eliminere usanne negativer, berike varselkonteksten for raskere sortering og forbedre kontrollpaneler for proaktiv problemidentifikasjon.

Svarvurdering vurderer hva som gikk bra og hva som var tregere eller vanskeligere enn nødvendig. Svarvurderingsspørsmål: Var kjørebøker nyttige og nøyaktige? Var eskaleringsbanene tydelige og effektive? Var tilbakeføringsprosedyrer testet og klare? Har verktøy gitt nødvendig diagnostisk informasjon? Var kommunikasjonen tidsriktig og effektiv?

Forbedringer i svarevaluering inkluderer følgende: oppdatere kjørebøker med leksjoner som er lært, klargjøre eskaleringskriterier, teste tilbakeføringsprosedyrer regelmessig, legge til diagnostiske verktøy og forbedre hendelseskommunikasjonsmaler.

Handlingsartikler angir konkrete, tildelte, tidsbegrensede forbedringer som hindrer gjentagelse eller forbedrer fremtidige tiltak. Unngå vage handlingselementer, som "forbedre overvåking", til fordel for bestemte oppgaver, som "legge til varsel for agentfeilfrekvens på over 5 % over et 10-minutters vindu, tildelt: Alex, forfaller: 2 uker.".

Spor fullføring av handlingselementer i påfølgende vurderinger for å sikre at kontinuerlig forbedring faktisk skjer. Se gjennom åpne handlingselementer fra tidligere hendelser under hver etterfølgende hendelsesgjennomgang. Lav fuldførelsesfrekvens angiver kontinuerlig forbedringsprocesfejl, der kræver opmærksomhed.

Knowledge-deling dokumenterer etterhendelsesgjennomganger i delt wiki, Knowledge-base eller samarbeidsområde med koding som muliggjør mønsteranalyse på tvers av flere hendelser. Hendelsesretrospektiver bør være søkbare etter feilmodus, berørte komponenter og tidsperiode slik at fremtidige respondenter kan lære fra historiske hendelser.

Del post-hendelsesvurderinger bredt utover umiddelbare hendelsessvarere. Organisasjonslæring krever informasjon. Vurder å presentere viktige hendelseslæringer i teammøter eller lunsj-og-lær-økter som sprer Knowledge og bygger kollektiv kapasitet.

Krev godkjenning før du distribuerer produksjonsagenter som sikrer gjennomgang, risikovurdering og interessentjustering.

Sjekklisten før distribusjon validerer klargjøring, inkludert:

  • Omfattende testing fullført - funksjonalitet, kvalitet, sikkerhet, ytelse
  • Sikkerhetsvurdering godkjent - tillatelsesgrenser, datatilgang, handlingsgodkjenning
  • Samsvar validert - lovpålagte krav, policyoverholdelse
  • Dokumentasjon fullført - kjørebøker, tilbakeføringsprosedyrer, eskaleringsbaner
  • Overvåking konfigurert - kvalitetsmålinger, feilfrekvenser, kostnadssporing
  • Interessentgodkjenning innhentet - produkteier, sikkerhet, samsvar

Sjekkliste gir konsistente evalueringskriterier på tvers av agenter. Tilpass sjekklisten for agentrisikoprofil med varierende dybde basert på agentkritiskhet, datasensitivitet og autonominivå.

Risikobehandlingen evaluerer den potensielle innvirkningen av agentfeil, inkludert:

  • Blast radius - hvor mange brukere som påvirkes av feil
  • Datasensitivitet – hva dataagent har tilgang til
  • Handlingsinstans – hvilke endringer agenten kan gjøre
  • Integrasjonsavhengigheter – hvilke systemagenter agenten påvirker
  • Gjenopprettingskompleksitet – hvor vanskelig tilbakestilling er
  • Konsekvenser av overholdelse – hvilke forskrifter som gjelder

Risikovurdering bestemmer godkjenningskravene. Agenter med høy risiko krever godkjenning av ledere, sikkerhetsvurdering og gradvis utrulling, mens agenter med lav risiko kan kreve fagfellevurdering og standard testing.

Godkjenningsarbeidsflyter ruter forespørsler om distribusjon gjennom de riktige kontrollørene. Implementer godkjenningsarbeidsflyter ved bruk av Salesforce-godkjenningsprosesser eller eksterne distribusjonsverktøy. Automatiser, spor og revider godkjenningsarbeidsflyter for å aktivere samsvarsrapportering og hendelsesundersøkelse.

Dokumenter godkjenningsbeslutninger, opprett revisjonsspor for hvem som godkjente distribusjoner, hvilken informasjon som informerte godkjenninger, hvilke betingelser eller begrensninger som ble brukt, og hvilke overvåkingsforpliktelser som ble gjort.

Hasterbypass-prosedyrer muliggjør rask distribusjon under produksjonshendelser når normale godkjenningsprosesser vil forsinke viktige rettinger. Hasteprosedyrer må kreve godkjenning av ledere, inkludere begrunnelsesdokumentasjon og utløse raskere gjennomgang etter distribusjon for validering av endringer i hasteavtaler.

Spor hastedistribusjoner separat fra standardutgivelser. Distribusjonshyppighet for høye haster angir prosessproblemer som krever undersøkelse.

Definer kvalitetsportaler som agentene må passere før produksjonsdistribusjon, for å hindre at problematiske agenter når brukere.

Funksjonstesting validerer at agenter utfører tiltenkte oppgaver riktig på tvers av representative scenarier. Test lykkelige baner som dekker typiske interaksjoner, kanttilfeller som dekker sjeldne, men gyldige scenarier, feilbaner som tester om agenter håndterer ugyldige inndata på en god måte, og grensebetingelser som kontrollerer om agenten er innenfor styringsgrenser, tokengrenser og datavolumgrenser.

Funksjonell testing for agenter er forskjellig fra tradisjonell testing fordi ikke-deterministiske utdata hindrer nøyaktig samsvar. Test utdatakarakteristikker (inneholder nødvendig informasjon, beholder riktig tone, inkluderer nødvendige anførselstegn) i stedet for nøyaktig tekst.

Svarkvalitetstesting evaluerer svarets nøyaktighet og relevans på tvers av testscenarier. Kvalitetstesting krever menneskelig evaluering eller datasett med sannhetsgrunnlag med forventede utdata. Angi minimumsgrenser for kvalitet som agenter må oppfylle (for eksempel "95 % nøyaktighet på utestående testsett, null sikkerhetsbrudd, revisjon av rettferdighet viser ingen demografiske forskjeller som overskrider 5 %"). Vedlikehold og utvid testsett kontinuerlig etter hvert som nye kanttilfeller oppdages.

Sikkerhetstesting validerer om agenter avviser farlige, uetiske eller omfattende forespørsler. Sikkerhetstesting forsøker motinndata, inkludert

  • Be om injeksjonsforsøk – forsøke å overstyre instruksjoner
  • Jailbreak-forsøk – forsøk på å omgå sikkerhetsbegrensninger
  • Be om eskalering – be om stadig mer sensitive handlinger
  • Forespørsler utenfor omfang – forsøk på uautoriserte oppgaver

Tildel sikkerhetstesting til uavhengige teammedlemmer som ikke var involvert i byggingen av agenten. For agenter med høy risiko henter du inn red team-spesialister.

Ytelsestesting validerer forventninger om latens, gjennomstrømning og kostnad. Test under realistisk belastning, inkludert samtidige samtaler, typiske samtalevarigheter og projisert bruksvolum. Ytelsestesting avdekker styringsgrenseproblemer, ressursbegrensninger og flaskehalser som ikke er synlige i testing for enkeltbrukere.

Mål forbruket av testmiljøet under ytelsestesting, og bruk det til å projisere produksjonskapasitetsbehov.

Sikkerhetstesting validerer tillatelsesgrenser, datatilgangskontroller og handlingsgodkjenning. Sikkerhetstesting bekrefter: agenter får ikke tilgang til uautoriserte data, agenter kan ikke utføre uautoriserte handlinger, ledetekstinntak kan ikke eskalere rettigheter, og revisjonslogging fanger opp alle agentaktiviteter.

Integrer statisk kodesikkerhetsskanning i distribusjonspipelinen med Salesforce Code Analyzer, som skanner Apex, Flyter, Lightning og Visualforce for sikkerhetssårbarheter og kan kjøre i kontinuerlig integrasjon/distribusjon (CI/CD) via kommandolinjegrensesnittet (CLI) eller GitHub-handlingen. Bruk spesialisert AI/agent-sikkerhetstesting til å oppdage sårbarheter ved ledetekstinnsetting og risiko for eksponering for sensitive data, fordi disse er kjøretids LLM-inndatatrusler utenfor omfanget av statisk kodeanalyse.

Bruk disiplin for endringsbehandling på agentdistribusjoner for å sikre at endringer dokumenteres, gjennomgås og kommuniseres.

Endringsdokumentasjonen fanger opp:

  • Hva som er endret - ledetekstendringer, konfigurasjonsoppdateringer, modellendringer
  • Hvorfor denne endringen ble gjort – kvalitetsforbedring, kostnadsoptimalisering, feilretting
  • Hvilke tester som validerte denne endringen - testresultater, kvalitetsscore, sikkerhetsskanninger
  • Hvilken tilbakeføringsprosedyre som finnes

Endringsdokumentasjon aktiverer hendelsesundersøkelse, samsvarsrapportering og Knowledge. Dokumenterte endringer oppretter en læringsorganisasjon som bygger på tidligere erfaringer i stedet for å oppdage erfaringer på nytt.

Kommunikasjonsplanlegging varsler interessenter om agentendringer, inkludert berørte brukere, driftsteam, kundestøtteteam og forretningsinteressenter. Kommunikasjonen skal beskrive: hva som endres, når endring distribueres, hvilke fordeler brukere vil se, hvilke risikoer som finnes, og hvem som skal kontaktes for problemer.

Opprett kommunikasjonsmaler for forskjellige endringstyper som standardiserer meldinger og reduserer kostnadene for klargjøring av distribusjon.

Distribusjonsplanlegging tidspunkter agentdistribusjoner i perioder med lav bruk informert av hendelsesovervåking data som viser faktiske bruksmønstre. Unngå distribusjoner ved bruk på høyt nivå, avslutning på månedsslutt, avslutning på kvartalsslutt eller store forretningshendelser. Kommuniser distribusjonsvinduer, inkludert forventet varighet og tidslinje for tilbakeføringsbeslutninger.

Vurder å planlegge store endringer fra tidlig til midten av uken, og unngå distribusjoner sent i uken, slik at problemer kan løses med tilstrekkelige ressurser. Prioriter rask tilbakeføring og sterk overvåking etter distribusjon foran en hvilken som helst fast kalenderregel.

Byttevinduer og fryser beskytter kritiske driftsperioder. Sett opp endringsfrysingsperioder før viktige forretningshendelser (slutt på regnskapsåret, produktintroduksjoner og store markedsføringskampanjer) for å hindre distribusjonsutløste problemer i perioder med stor innsats.

Frysingskalender for dokumentendringer hvert år kommuniserer begrensede perioder tilstrekkelig på forhånd slik at team kan planlegge i henhold til dette. Overdreven frysing fører til langsom hastighet, og utilstrekkelig frysing skaper forretningsrisiko.

Opprett tilbakemeldingsløyfer som kobler operativ telemetri til agentforbedring.

Brukertilbakemeldingsinnsamling samler eksplisitt tilbakemelding gjennom spørsmål eller oppfølgingsundersøkelser. Innhent implisitt tilbakemelding via fullføringsfrekvenser, eskalering til menneskelige agenter, mønstre for å prøve på nytt og oppfølgingsspørsmål som indikerer utilfredshet. Kombiner eksplisitte og implisitte signaler for å gi et omfattende kvalitetsperspektiv.

Innhent innebygd tilbakemelding akkurat når den skjer, og ikke senere. Forsinket tilbakemeldingsinnsamling reduserer svarfrekvenser og introduserer tilbakekallingsskjevhet.

Bruksanalyser viser reelle samtalemønstre som gjentagende emner, spørsmål og trender. De tester om en agents kompleksitet tjener sin beholdning, om funksjoner blir ubrukte på grunn av dårlig oppdagbarhet, og om faktisk bruk validerer de opprinnelige utformingsforutsetningene.

Spørringssamtalelogger som analyserer spørsmålstyper, samtalevarigheter, suksessfrekvenser etter emne og brukertilfredshet etter samtaleegenskaper. Bruksmønsteranalyse veileder om forbedring, utvidelse av Knowledge og prioritering av funksjoner.

Feilmønsteranalyse identifiserer systematiske kvalitetsproblemer som krever korrigering. Analyser feillogger som grupperes etter feiltype, berørte brukere, samtalemønstre og tidsfordeling. Feilmønstre viser ledetekstproblemer, gap i Knowledge, integrasjonsproblemer eller kanttilfeller som krever håndtering.

Prioriter feilsøking etter frekvens og innvirkning. Feil med høy frekvens som påvirker mange brukere, krever umiddelbar oppmerksomhet. Lavfrekvensfeil kan representere akseptable kanttilfeller avhengig av forretningsinnvirkning og kostnad for rettelse.

Kvalitetstrendovervåking sporer nøyaktighet, relevans, sikkerhet og tilfredshet over tid og oppdager forringelse før den blir alvorlig. Opprett kvalitetsstandarder etter første agentdistribusjon. Overvåk pågående kvalitet mot varsler om grunnlinjer når trender faller ut over gyldige terskler.

Kvalitetsovervåking avdekker om endringer i ledetekster, modelloppdateringer eller endringer i Knowledge forbedrer eller reduserer ytelsen som aktiverer datadrevne forbedringsbeslutninger.

Spor eksperimenter som systematisk gir informasjon om forbedringsbeslutninger, med empiriske bevis.

Rammeverket for eksperimenter gir en konsistent struktur for testing av forbedringer, inkludert:

  • Hypotese – hvilken forbedring som forventes
  • Eksperimentell utforming - hvordan varianter distribueres
  • Målinger – hvilke utfall som måles
  • Eksempelstørrelse - hvor mange interaksjoner som er nødvendige for statistisk gyldighet
  • Suksesskriterier – hvilke resultater som berettiger promotering

Dokumenter eksperimenter før utføring for å hindre tvetydig tolkning av resultater. Forhåndsdefinerte suksesskriterier muliggjør tydelige promoteringsbeslutninger ved å unngå lange diskusjoner om om resultatet er "godt nok".

Variantsporing logger hvilke brukere som mottok hvilke varianter som aktiverer utfallskorrelasjon. Spor varianttildeling i samtalemetadata som aktiverer analyse av kvalitet, kostnad og tilfredshet etter variant.

Statistisk gyldighet sikrer eksperimenter kjører lenge nok med tilstrekkelig prøve størrelse for pålitelige konklusjoner. Beregn nødvendig prøvestørrelse før eksperimenter basert på forventet effektstørrelse, statistiske strømkrav og akseptable feilfrekvenser. Ikke tilstrekkelige prøver fører til bråkete resultater som fører til dårlige beslutninger.

Multi-armed bandit optimalisering dynamisk tildeler mer trafikk til bedre ytelse varianter under eksperimenter. Multi-armed bandit-tilnærminger reduserer salgsmulighetskostnadene ved eksperimentering ved å redusere eksponeringen for dårligere varianter samtidig som det samles inn tilstrekkelige data for statistisk analyse.

Eksperimentkatalogen logger hver eksperiments varianter, utfall og beslutninger. Den hindrer at team tester mislykkede tilnærminger på nytt, sprer innsikt i hele organisasjonen og bygger en delt post for hva som faktisk fungerer.

Operasjonell ekspertise for agentiske systemer krever utvidelse av tradisjonelle DevOps-rutiner for å løse unike AI-egenskaper. Omfattende observabilitet muliggjør forståelse av virkemåte for emergente agenter. Systematisk livssyklusbehandling sikrer kvalitet, sikkerhet og kostnadskontroll. Hendelsessvarprosedyrer håndterer agentspesifikke feilmoduser. Kontinuerlig forbedring transformerer driftsopplevelsen til organisasjonsegenskaper.

Viktige fremgangsmåter for å oppnå god drift i agentiske systemer:

  • Logg fullførte samtaler, inkludert inndata, utdata, vurderingssporinger, handlinger og utfall.
  • Overvåk svarkvalitet kontinuerlig gjennom nøyaktighet, relevans, sikkerhet og tilfredshetsmålinger.
  • Oppdage modellavvik og atferdsendringer via grunnleggende sammenligning og avvikdeteksjon.
  • Versjon kontrollerer ledetekster, konfigurasjoner og modeller som aktiverer tilbakemelding og A/B-testing.
  • Implementer gradvis utrulling med funksjonsflagg og kanariske distribusjoner som begrenser blast radius.
  • Utform kretsbrytere og reservere hierarkier for å hindre feil i gjennomgripende agent.
  • Utfør skamløse etterhendelsesvurderinger med fokus på systematiske forbedringer.
  • Opprett kvalitetsportaler og godkjenningsprosesser som hindrer at problemagenter kommer til produksjon.
  • Bygg tilbakemeldingsløyfer som kobler operativ telemetri til agentforbedring.
  • Spor eksperimenter systematisk ved bruk av empiriske bevis som veiledning til forbedringsbeslutninger.

Organisasjoner som investerer i operasjonell dyktighet for agenter, får en bærekraftig konkurransefordel gjennom pålitelige AI-funksjoner av høy kvalitet som utvikler seg kontinuerlig etter forretningsbehov.

Dele tilbakemeldingene dine om det velbygde rammeverket.