Driftsmæssig excellence for agentvirksomheden
Driftsmæssig excellence for agentiske systemer udvider traditionelle DevOps-praksisser til at håndtere de entydige egenskaber for AI-agenter: ikke-deterministisk adfærd, kontekstafhængig overvejelse og hukommelse, målkompleksitet og variabelafledningsomkostninger. Konventionelle applikationer følger forudsigelige kodestier, men agenter genererer nye svar baseret på kontekst. Traditionel overvågning sporer kendte metrikker, mens agentobservation kræver forståelse af sprogmodellers argumentation og beslutningsmønstre. Standardtest validerer deterministiske resultater, men agentvalidering vurderer svarkvalitet på tværs af flere dimensioner, herunder nøjagtighed, relevans, sikkerhed og rimelighed.
Produkter og systemer ændres over tid, så anvend disse fem designprincipper for at integrere driftsmæssig ekspertise i, hvordan du kører dem: udvikle med observabilitet, standardisere driftsmæssige procedurer, omfavne en DevOps-kultur, automatisere for effektivitet og lære fra alle driftsmæssige begivenheder. Kerneprincippet for driftsmæssig excellence “Evolver med observabilitet” bliver kritisk for agentiske systemer, fordi agentadfærd opstår fra komplekse interaktioner mellem meddelelser, hentet kontekst, modeladfærd og samtalehistorik snarere end fra deterministisk kodekørsel. Architekter kan ikke forudsige hvert agentsvar på designtidspunktet, da svar er udformet af modellen, meddelelsen og livekonteksten, så design til observabilitet og vagtstreger. Omfattende observabilitet afslører, hvordan agenter rent faktisk optræder under reelle forhold. Denne synlighed aktiverer datastyrede forbedringer og hurtig problemdiagnose, når agenter opretter uventede resultater.
“Handlinger som kode” får nye dimensioner for agenter. Traditionel infrastruktur-som-kode udvides til meddelelsesversionering, modelkonfigurationsstyring og agentimplementeringsautomatisering. Agentens driftsmæssige procedurer håndterer modelversionsændringer, meddelelsesudvikling og opdateringer af Knowledge og konventionelle implementerings- og tilbagerulningshandlinger.
“Lær af alle driftsmæssige begivenheder” bliver endnu mere værdifuldt med agentiske systemer. Agenthændelser afslører ofte subtile meddelelsesteknikproblemer, script- og orkestreringsfejl, mangler i Knowledge eller uventede brugerinteraktionsmønstre. Efter dødsfald kombineret med systematisk analyse af agenttelemetrie transformerer driftsmæssig oplevelse til organisatorisk funktionalitet, der sammensættes over tid.
Fuld samtale-logføring udgør grundlaget for agentobservation. Registrer hver samtale, herunder brugerinput, agentsvar, argumenteringstrin, handlinger, der er kaldt, hentede data og endelige resultater. Denne telemetri tjener flere formål: fejlfinding af specifikke hændelser, kvalitetsanalyser på tværs af mange interaktioner, overensstemmelsesovervågning, modelforbedring og anvendelsesmønsteranalyse.
Brug den oprindelige sessionssporingsmodel over tilpasset registrering. Agentforce registrerer agentinteraktionsdata i en forenet datamodel på Data 360 i stedet for at kræve, at du opbygger et parallelt telemetriesystem. STDM (Session Tracing Data Model) registrerer samtalen som et sporingshierarki. Hver session indeholder interaktioner (drejer), hver interaktion indeholder trin (UserInputStep, LLMExecutionStep, FunctionStep), og trin indeholder meddelelser (bruger- og agentkommunikation). STDM bruger Data 360-standardobjekter, f.eks. AIAgentSession, AIAgentSessionParticipant, AIAgentInteraction, AIAgentInteractionStep og AIAgentInteractionMessage. Interaktioner har distribuerede sporingsidentifikatorer (TelemetryTraceId og TelemetryTraceSpanId), og trin har et span-id (TelemetryTraceSpanId), der afspejler en OpenTelemetry-typografisk span-model.
Modelering af agentsamtaler som spor og omfang er branchestandardtilgangen til agentobservation, og genbrug af den oprindelige model undgår skaleringsproblemer, som håndbyggede objekter løber ind i: lagring af multi-turn-samtaler, store JSON-data og hurtig datavækst. Opbygning af tilpassede transaktionsobjekter til at logføre samtaler er en bevidst undtagelse – f.eks. et letvægts tilpasset objekt, der korrelerer agentadfærd med forretningsresultater og ikke det primære logføringsubstrat.
Sessions- og samtalemetadata registrerer kritisk kontekst, herunder sessions- og interaktionsidentifikatorer, brugeridentitet, agentidentitet, starttidspunkt og sluttidspunkt. STDMalso linker hvert interaktionstrin til dets store sprogmodel-opkaldsregistreringer (via GenerationId og GenAiGatewayRequest/Response-referencer). Detaljer om tokenanvendelse, model og meddelelse er tilgængelige gennem disse forbindelser i stedet for lagret som sessionsfelter. Metadata aktiverer filtrering og aggregering af samtaler til mønsteranalyser.
Interaktions- og detaljeniveauregistrerer hver drejning inklusive brugerinput, agentsvar, begrundelsesforklaring (når den er tilgængelig), konfidensscores, hentet kontekst, handlinger, der er forsøgt, og fejl, der er stødt på. Sporing på trinniveau aktiverer detaljeret hændelsesundersøgelse, der genopbygger nøjagtigt, hvad der skete på hvert punkt i grundlæggende kæde.
Handlingstrin registrerer hver handling, som en agent foretager, herunder API-kald, datamodifikationer, eksterne systeminteraktioner og integrationer, der kaldes. Handlingsregistreringer besvarer spørgsmål som “Hvad ændrede denne agent?” og “Hvilke systemer fik denne agent adgang til?” Disse svar understøtter sikkerhedsundersøgelser og overensstemmelseskrav. STDM registrerer handlinger som standard som interaktionstrin.
Årsagsspor fra Atlas Reasoning Engine afslører agentbeslutningsprocesser og hjælper med at diagnosticere, hvorfor agenter valgte specifikke handlinger eller genererede bestemte svar. Sessionssporing registrerer planlæggerens trin som en del af hver interaktion. Dybden af eksponeret argumentation afhænger af modellen og planlæggeren, men når disse spor er tilgængelige, forbedres fejlfindbarheden dramatisk.
Einstein Trust Layer generative AI-revisionsspor registrerer hver generativ AI-interaktion, meddelelses- og svarteksten – herunder personligt identificerbare oplysninger (PII)-maskerede versioner – hentede grunddata, svarsikkerheds- og toksicitetsscores og LLM-modeloplysninger – alt sammen streamet til og lagret i Data 360. Aktiver Einstein Generative AI og Feedback-datasamling og -lagring, så revision og feedbackdata registreres i Data 360 – hvor du kan forespørge og analysere dem med Data 360-rapportering for langsigtet bevarelse.
Eksempel:
God: Samtalelogfiler, der er lagret i tilpassede Salesforce-objekter med felter for brugerinput, agentsvar, udførte handlinger, tokenforbrug og samtaleresultat. Dashboard viser samtalesuccesfrekvenser efter agent og anvendelsessituation. Bedre: Omfattende logføring inkluderer grundlæggende spor, der viser agentbeslutningsprocessen, hentet kontekst, der viser, hvilke oplysninger der er baseret på svar, og konfidensscores, der angiver usikkerhed. Bedst: Samtaleanalyser korrelerer agentadfærd med forretningsresultater, identificerer forbedringsmuligheder gennem mønsteranalyser og leverer kontinuerlige lærings-pipelines med kvalitetsbetegnede eksempler.
Overvåg den driftsmæssige ydeevne, så du sikrer, at agenter opfylder serviceniveauer og fungerer inden for de forventede parametre.
Svarforsinkelse sporer end-to-end-tid fra brugerinput til agentsvar. Forsinkelse påvirker brugeroplevelsen direkte. Mål forsinkelse ved percentiler (p50, p95, p99), der viser typisk ydeevne og oplevelser med værste tilfælde. Advar, når p95-forsinkelse overskrider tærskler, der angiver nedbrydning af ydeevne.
Forsinkelsesfaktorer for agenter omfatter modeludledningstid, varighed af hentning af data og kontekst, eksterne værktøjer og handlinger og netværksforsinkelse. Instrumenter hver fase separat, der aktiverer målrettet optimering, når den generelle forsinkelse overskrider målene.
Tokenforbrug måler tokener, der bruges pr. samtale, pr. agent og pr. anvendelsessituation. Tokenforbrug styrer udledningsomkostninger og påvirker svartid (flere tokener kræver mere udledningsberegning). Spor tokenfordeling, der afslører, om faktisk anvendelse matcher projiceringer. Registrer afvigelsessamtaler, der forbruger overdrevne tokener, der foreslår meddelelsesproblemer eller misbrug.
Tokenmetrikker inkluderer meddelelsestokener (input til model), fuldførelsestokener (modeloutput) og tokener i alt (sum af meddelelse og fuldførelse). Meddelelsestokener er mere kontrollerbare end fuldførelsestokener. Optimer meddelelser og hentet kontekst, der reducerer meddelelsestokenforbruget, mens kvaliteten bevares.
Gennemgangsovervågning sporer samtidige samtaler, anmodninger pr. sekund og samtalevolumenstendenser og kan hjælpe med projektkapacitet og skaleringskrav. Sammenlign aktuel gennemsnit med kendte frekvensgrænser eller kapacitetsbasislinjer, der advarer, når tærskler nærmer sig.
Fejlfrekvenssporing overvåger fejl efter type, herunder modelspecifikke fejl, timeoutfejl, afviste fejl og eksterne integrationsfejl. Fejlmønstre afslører systematiske problemer, der kræver afhjælpning. Beregn fejlfrekvenser som en procentdel af de samlede anmodninger, der aktiverer sammenligning på tværs af agenter og tidsperioder.
Skelner mellem fejlkategorier, der kræver forskellige svar. Modelspecifikke fejl kan kræve meddelelsesjusteringer eller skifte til en bedre model. Tilladelsesfejl kræver ændringer af sikkerhedskonfiguration. Integrationsfejl kræver ekstern systemundersøgelse eller aktivering af strømafbrydere.
Tilgængelighedsovervågning måler agentoppetid og vellykkede driftsperioder. Beregn tilgængelighed som procentdel af tid, som agenter besvarer anmodninger. Spor tilgængelighed op mod serviceniveaumålsætninger (SLO’er), og aktiver proaktivt svar, når tilgængeligheden falder under målene.
Proactive Monitoring evaluerer din organisation for platformsafvigelser og ressourceanvendelsesproblemer, der kan påvirke agentinfrastrukturens tilstand. Den viser signaler, før de eskaleres til brugersynlige problemer. Brug den til at være på forkant med betingelser på infrastrukturniveau – f.eks. usædvanlig API-aktivitet eller tendenser for ressourceforbrug mod platformsbegrænsninger – som kan nedsætte agentydeevnen. Gennemse dets signaler i forhold til dine agenters normale driftsbasislinje, så du kan skelne afvigelser, der kan handles på, fra forventet variation.
Overvåg svarkvalitet kontinuerligt og registrer forringelse, før det påvirker forretningsresultater. Når platformen tilbyder indbyggede evalueringsværktøjer, skal du bruge dem i stedet for tilpassede eller manuelle processer. Start med oprindelige test- og evalueringsværktøjer. Agentforce-testcenter giver dig mulighed for at vedligeholde genanvendelige testsagsæt og køre agenter mod dem i batches, hvor du kontrollerer, om agenten valgte det forventede emne og handling og producerede et acceptabelt svar i stedet for at opbygge og køre dit eget testarmatur. Den understøtter også oprindelige evalueringer, herunder indbyggede kvalitetsdimensioner og en LLM-as-judge-tilgang til scoring af samtalekvalitet, og den tillader oprettelse af tilpassede evalueringer for organisationsspecifikke kriterier. Brug repræsentative samtaler i dine testsæt, så evaluering afspejler den faktiske anvendelse.
Svarnøjagtighed måler, om agentsvar indeholder korrekte oplysninger. Nøjagtig evaluering kræver kendte svarpåstande eller menneskelig gennemgang. For faktiske spørgsmål med kendte svar sammenligner automatiseret evaluering agentsvar med korrekte svar. Bevar disse som testsager i Testcenter for gentagelig evaluering. For åbne spørgsmål vurderer menneskelige evalueringer nøjagtigheden på samtaler, der er udvalgt. Spor nøjagtighedstendenser over tid og afsløre, om meddelelsesændringer, modelopdateringer eller ændringer af Knowledge forbedrer eller nedsætter ydeevnen.
Svarrelevans måler, om agentsvar håndterer brugerspørgsmål korrekt, selvom de ikke er helt nøjagtige. Relevante svar forstår brugerens hensigt og giver nyttige oplysninger, selv når et komplet svar ikke er muligt. Evaluer relevans gennem oprindelige evalueringer, hvor de er tilgængelige, gennemsyn af samtaler og brugersignaler. For agenter, der er baseret på en Knowledge, kan indbyggede hentningskvalitetsanalyser vurdere kontekstrelevans, svarrelevans og trofasthed (baserethed) af svar.
Guard Trails registrerer usikre, upassende eller skadelige reaktioner, herunder bias, stødende indhold, farlige råd og reaktioner uden for omfanget. Einstein Trust Layer anvender toksicitetsregistrering på LLM-interaktioner på kørselstidspunktet, hvilket er din første forsvarslinje. Gør sikkerhedsovervågning bedre gennem indholdsfiltrering, manuel gennemgang af prøver, brugerrapporteringsmekanismer og rimelige revisioner, der vurderer resultatfordelinger på tværs af demografiske grupper.
Brugertilfredshedsmetrikker registrerer subjektiv oplevelseskvalitet. Agentforce flyder ind i Einstein generative AI-revision- og feedbackdatamodeller (GenAIFeedback/GenAIFeedbackDetail i Data 360). Disse modeller registrerer eksplicitte brugersignaler – tommelfinger op/ned, accept/afvisning, redigeringer og ordrette kommentarer – fra en menneskelig eller systemkilde sammen med gatewayanmodningen og genereringsdata. Registrer eksplicit feedback (anmodning før eskalering, efter afslutningen af en samtale og gennem opfølgningsundersøgelser), hvor du har brug for det, og kombiner eksplicit og implicit signaler for et omfattende kvalitetsperspektiv.
Salesforce leverer forskellige modeloverflader. Det genererende niveau leverer de samtaleargumenteringsagenter, der kører på: Agentforce leverer indbyggede argumenter inden for Trust, og få dine egne BYOLLM-links (LLM) til eksterne LLM’er eller udbydere. Forudsigelsesniveauet leverer de strukturerede scores, som agenter baserer deres beslutninger på: BYOM trækker nul-kopier forudsigelsesscores fra eksternt hostede platforme, og indbyggede Einstein opretter automatiseret scoring og klassificering på CRM-objekter. Sammen gør disse overflader det muligt for en autonom agent at give mening på naturligt sprog, mens vedkommendes arbejdsflow baseres på strukturerede statistiske data.
Overvåg for modelforskydning, som angiver nedsat ydeevne over tid eller ændrede betingelser, der kræver tilpasning. Gennemse produktbemærkninger, og test kritiske anvendelsessituationer i en sandbox, før hver større version går i produktion. Brug versionsmatrixen og sandbox-eksempelvisningsvinduet til at fange kompatibilitetsproblemer tidligt.
Ydeevneafvigelse forekommer, når agentnøjagtighed, relevans eller sikkerhed forringes over tid. Spor kvalitetsmetrikker over tid og registrer statistisk signifikante faldende. Ydelsesforskydning kan være et resultat af nedbrydning af modeller, forældet Knowledge, fejlretning af meddelelser med ændrede anvendelsesmønstre eller konceptafvigelse, hvor relationer mellem input og ønskede output udvikles.
Etabler basislinjeydeevne umiddelbart efter den indledende agentimplementering, der måler nøjagtighed, relevans, sikkerhed og tilfredshed på tværs af repræsentative testsager. Genevaluer regelmæssigt op mod de samme testsager, der afslører ændringer i ydeevnen uafhængigt af anvendelsesmønstervagter.
Advar, når kvalitetsmetrikker falder ud over acceptable tærskler. Definer tærskler baseret på forretningspåvirkningstolerance. Nogle anvendelsessituationer tolererer beskeden kvalitetsnedgradering. Andre kræver øjeblikkelig reaktion på enhver afvisning.
Fordelingsafvigelse forekommer, når brugerinputmønstre ændres væsentligt fra træning eller tilpasning af datafordelinger. Distributionsforskydning nedsætter ydeevnen, når agenter støder på inputtyper, som de ikke er designet til at håndtere. Overvåg inputegenskaber, herunder spørgsmålslængde, emnefordeling, sprogkompleksitet og domæneterminologi, der registrerer væsentlige vagter.
Sammenlign aktuelle inputfordelinger med historiske basislinjer. Store distributionsvagter kan angive nye anvendelsessituationer, ændring af brugeradfærd eller udvikling af forretningsprocesser. Distributionsvagter kan kræve meddelelsesopdateringer, udvidelse af Knowledge eller forbedringer af agentfunktioner.
Adfærdsmæssig afvigelse opstår, når agentresponsmønstre ændres uventet. Overvåg svaregenskaber, herunder gennemsnitlig svarlængde, handlingsanmodningsfrekvenser, eskaleringsfrekvenser og fejlmønstre. Vigtige adfærdsmæssige ændringer kan angive meddelelsesproblemer, modelproblemer eller underliggende systemændringer.
Opret adfærdsmæssige basislinjer tidligt i produktionen og registrer normale driftskarakteristika, f.eks. almindelige ydeevnemønstre, værktøjsanvendelse og beslutningsstier. Disse basislinjer bliver det benchmark, som senere afvigelsesregistrering måler mod. Sammenlign igangværende adfærd i forhold til basislinjer, advarsel, når afvigelser overskrider den forventede variation.
Automatisk alarm muliggør proaktivt driftsvar. Konfigurer advarsler, der udløses, når afledningsmetrikker overskrider tærskler, der udløser undersøgelse og potentiel rettelse, herunder meddelelsesjustering, opdateringer af Knowledge, udvidelse af testsæt eller BYOM-modeltræning.
Registrer automatisk usædvanlig agentadfærd, der kræver undersøgelse.
Uregelmæssige omkostninger, herunder spidser i tokenforbrug, stigninger i udledningsfrekvens eller samlet omkostningsforøgelse. Omkostningsspring kan angive meddelelsesproblemer, der forårsager overdreven tokengenerering, misbrug, der fører til uventet brug, eller infrastrukturproblemer, der forårsager overflødige opkald.
Overvåg distributioner af tokenforbrug, der registrerer afvigelsessamtaler. Undersøg samtaler, der forbruger 10 gange det typiske tokenantal, for at forstå, om de repræsenterer lovlige kantsager eller problemer, der kræver afhjælpning.
Fejlfrekvensspids, herunder pludselige stigninger i fejlfrekvenser, visning af nye fejltyper, der ikke fandtes i basislinjen, eller lokaliserede fejlkoncentrationer, der påvirker specifikke brugere, agenter eller anvendelsessituationer. Fejlspieds kommer ofte før kvalitetsafbrydelsesproblemer, som kunder kan se. Proaktiv registrering aktiverer afhjælpning før omfattende påvirkning.
Svarmønsterændringer inklusive pludselige skift i svarlængde, handlingskaldsfrekvens eller eskaleringsfrekvensændringer. Mønsterændringer kan angive meddelelsesproblemer, ændringer i modeladfærd eller udviklende anvendelsesmønstre.
Ophævelse af samtale øges, hvor brugere afbryder samtaler med højere frekvenser, hvilket tyder på nedsat kvalitet, øget forsinkelse eller funktionsmangler. Spor afvisning efter samtalefase, der identificerer, om brugere afbryder under den indledende interaktion, midt i samtalen eller efter forsøg på opgavefuldførelse. Afvisningsmønstre afslører specifikke forbedringsmuligheder.
Design advarselsarkitektur, der afbalancerer hurtig advisering mod advarselstræthed. Distribuer kritiske agentfejl til on-call-teknikere med det samme. Distribuer advarsler om kvalitetsnedgradering til produktteams til undersøgelse i arbejdstider. Aggreger mindre afvigelser i daglige sammendrag for tendensanalyser.
Versionsstyringsmeddelelser, konfigurationer og modelmetadata, der aktiverer tilbagerulning, A/B-test og vedligeholdelse af revisionsspor.
Meddelelsesskabeloner er genanvendelige meddelelser, der er oprettet i Promptkonstruktør, der definerer agentens mål, begrænsninger og brandretningslinjer, plus pladsholdere for dynamiske grundlæggende data, f.eks. kunde- eller produktoplysninger. Gem meddelelsesskabeloner i Git sammen med applikationskode og behandl meddelelser som vigtig applikationslogik, der fortjener den samme rigor som kode. Meddelelsesændringer gennemgår kodegennemgang, test og kontrolleret implementering.
Brug Promptkonstruktør til iterativ promptudvikling med versionshistorik og testfunktioner. Når du bruger meddelelsesskabeloner som agenthandlinger, kan du se en eksempelvisning af skabelonen i Promptkonstruktør for at bekræfte, at flettefelterne løses korrekt. Brug derefter testcenteret til at køre end-to-end-test, der bekræfter, at agenten vælger handlingen og genererer de korrekte resultater.
Eksporter produktionsklar meddelelser til versionskontrol, der opretter synkronisering mellem Promptkonstruktør og kildekontrollerede implementeringspipelines.
Konfigurationsstyring sporer modelvalg, temperaturindstillinger, hentningskonfigurationer og funktionsflag. Gem konfigurationer som kode, så du kan bruge miljøspecifikke værdier, automatisere implementeringer og registrere konfigurationsforskydning.
Semantic versionering gælder for agentversioner. Større versioner angiver afbrydende ændringer som ændrede input-/outputkontrakter eller væsentligt ændret adfærd. Mindre versioner angiver funktionstilføjelser eller forbedringer, der bevarer kompatibilitet. Fejlretningsversioner angiver fejlrettelser. Versionsnummerering kommunikerer ændringspåvirkning til driftsteams og brugere.
Implementer semantisk versionering for agentkomponenter, herunder meddelelsesskabeloner, agentkonfigurationer og Knowledge. Versionsnumre i logfiler aktiverer hændelseskorrelation med specifikke implementeringer.
Ændringsdokumentationen registrerer grundlaget for promptændringer, konfigurationsændringer og modelopdateringer. Dokumenter, hvad der er ændret, hvorfor det er ændret, hvilke test der validerede ændringen, og hvilke tilbagerulningsprocedurer der findes. Ændringsdokumentation sætter fart på hændelsesundersøgelse og Knowledge.
Vedligehold en omfattende registrering af modelversioner, meddelelser, konfigurationer og implementeringshistorik.
Modelregistreringsdatabasen registrerer, hvilke modelversioner der implementeres, herunder modelfamilie, specifik version, finjusteringstilstand, implementeringsmiljø (produktion, faseinddeling og udvikling), implementeringsdato og ansvarlige team. Registreringen leverer en enkelt kilde til sandheden for agentens infrastrukturtilstand.
Implementeringssporing logfører hver agentimplementering inklusive version implementeret, miljø, implementeringstidsstempel, implementerende bruger, opnåede godkendelser og implementeringsresultat. Brug implementeringshistorik til at vurdere påvirkning, når der opstår problemer (f.eks. “hvilke agenter blev implementeret, før denne hændelse startede?”) og til at understøtte overensstemmelsesrapportering.
Afhængighedssporing kortlægger relationer mellem agenter, meddelelser, Knowledge-baser, handlinger og integrationer. Når den delte Knowledge opdateres, afslører afhængighedssporing, hvilke agenter der påvirkes. Når eksterne integrationer ændres, identificerer afhængighedssporing påvirkede agenter.
Dokumentafhængigheder eksplicit i stedet for at finde dem under hændelser. Opret afhængighedskort, der vedligeholdes gennem udvikling og implementeringsprocesser.
Udfasningspolitikker definerer livscyklusser for modelversioner, herunder supportvarighed, udfasningstidslinje og migreringskrav. Tydelige udfasningspolitikker administrerer teknisk gæld, der forhindrer ubestemt understøttelse af gamle modelversioner. Opret en udfasningstidsplan, der kommunikerer tidslinjer tilstrækkeligt på forhånd, så du aktiverer planlagte migreringer i stedet for nødservicereaktioner på tvungne udfasninger. En velkommuniceret og policebehandlet mindste adviseringsperiode giver tilstrækkelig migreringstid for kritiske ændringer.
Rullback-procedurer gør det muligt for teams hurtigt at komme sig efter problematiske implementeringer. Dokumenttilbagerulningsprocedurer for hver agent og inkludere følgende:
- Betingelser, der udløser en tilbagerulning
- Hvilken version der skal returneres til
- Sådan udføres tilbagerulningen
- Hvem der autoriserer og udfører tilbagerulningen
- Hvilke test bekræfter, at tilbagerulningen lykkedes, og hvilke teams der skal adviseres.
Test tilbagerulningsprocedurer regelmæssigt i ikke-produktionsmiljøer for at bekræfte, at de fungerer, før du er afhængig af dem under produktionshændelser. Prøv med simulerede implementeringer, så teamet ved nøjagtigt, hvad de skal gøre. Ikke-testede tilbagerulningsprocedurer mislykkes ofte, når der er mest brug for det.
Vedligehold agentkvalitet gennem igangværende uddannelses-, finjusterings- og justeringsarbejdsflows.
Feedbackindsamling indsamler systematisk brugerfeedback, korrektioner for gennemgang, kvalitetsvurderinger og resultatmål. Feedback leverer råmateriale til forbedring. Uden systematisk indsamling bliver forbedring til gætteri. Indsaml eksplicit feedback gennem spørgsmål ved at spørge før eskalering, efter afslutningen af en samtale eller gennem opfølgningsundersøgelser. Indsaml implicit feedback gennem fuldførelsesfrekvenser, eskaleringsfrekvenser og prøvemønstre. Kombiner eksplicitte og implicitte signaler, der giver et omfattende kvalitetsperspektiv.
Data curation vedligeholder træningsdatasæt af høj kvalitet gennem curation, kvalitetsgennemgang og biaskontrol. Træningsdatakvalitet bestemmer modelkvalitet direkte. Dårlige data producerer upålidelige modeller. Fremragende data aktiverer enestående ydeevne.
Organiser samtallogfiler i træningsdatasæt efter:
- Filtrering efter kvalitet - inklusive samtaler med høje vurderinger og vellykkede resultater
- Fjernelse af problematiske eksempler - inklusive sikkerhedsovertrædelser og fejl
- Sikring af repræsentativitet - inklusive forskellige scenarier og kantsager
- Deduplikering - fjernelse af næsten identiske eksempler
Adapter agenter til dit domæne – specialiseret ordforråd, unikke forretningsprocesser, organisationsspecifik Knowledge – primært gennem hentningsforstærket generering (RAG) baseret på Data 360 og prompt tuning, den Salesforce-oprindelige sti.
Ingen generative modeller er finjusteret i Salesforce. Du vælger og konfigurerer modeller via AI-modeller og Promptkonstruktør. Når jordning er utilstrækkelig, kan du finjustere eksternt og derefter oprette forbindelse gennem BYOLLM.
Promptforbedring forbedrer iterativt meddelelser baseret på ydeevnedata ved brug af Promptkonstruktør. Meddelelsesteknik er kontinuerlig praksis snarere end engangsøvelse. Efterhånden som anvendelsesmønstre udvikles, forretningsprocesser ændres, og brugerforventninger skifter, kræver meddelelser justering for at opretholde optimal ydeevne.
Opret regelmæssig meddelelsesgennemgangskadence, der undersøger seneste samtaler, kvalitetsmetrikker og brugerfeedback, der identificerer forbedringsmuligheder. Implementer meddelelsesændringer trinvist med A/B-test, der validerer forbedringer før fuld udrulning.
Evalueringsautomatisering kører kvalitetsvurdering på udløbne testsæt, hvilket muliggør hurtig vurdering af forbedringskandidater. Automatiseret evaluering leverer målsætning, der supplerer subjektiv menneskelig vurdering.
Vedligehold testsæt, der dækker glade stier, kantsager, modsætningsinput og historiske problemsscenarier. Indstil testautomatisering til at køre dine testscenarier på en regelmæssig kadence. Inkluder automatiseret resultatovervågning, tærskler og adviseringer for at advare administratorer om afvigelser. Denne automatiserede test er vigtig for at registrere negative effekter fra eksterne faktorer som modelforskydning.
Udvid kontinuerligt testsæt, efterhånden som der vises nye sager i produktion. Testautomatisering er vigtig, men kører også regelmæssige manuelle spotkontroller, engangstest og gorilla-test for at sikre, at din agentimplementering klarer sig i forhold til kanttilfælde.
Implementer agentændringer gradvist, og overvåg kvaliteten før fuld udrulning for at begrænse radiussen for problemer. Når en ændring strækker sig over flere områder – meddelelser, modelkonfiguration, handlinger, grounding, integrationer – kan den nedsætte adfærden på måder, som test ikke fandt sted. Når det sker, peger den resulterende kvalitetsregression sjældent på en enkelt, åbenlys grundlæggende årsag. Send små ændringer en ad gangen, så en regression kan spores til dens kilde, og slip hver til en begrænset del af trafikken først for at indeholde påvirkningen, mens du diagnosticerer.
Funktionsflag adskiller implementering fra frigivelse ved at implementere agenter med funktioner, der er inaktiveret bag konfigurationen. Implementer funktionsflag ved brug af logik eller tilpassede metadatatyper eller tilpassede indstillinger. Funktionsflag aktiverer test i produktionsmiljøet uden at vise funktioner for brugere, gradvise udrulninger til specifikke brugersegmenter, A/B-test, der sammenligner implementeringer og øjeblikkelig tilbagerulning ved at inaktivere markeringer uden genimplementering.
Brug funktionsflag til væsentlige agentændringer, hvor en fejlens eksplosionsradius kan være alvorlig, f.eks. Ændringer, der påvirker forretningskritiske agenter, Nye overvejelsesmønstre med usikker produktionsadfærd Integrationer med eksterne systemer, hvor interaktionsmønstre kan afvige fra test.
Canary implementerer ændringer af frigivelsesagent til små brugersuppsæt, der først overvåger fejlfrekvenser, kvalitetsmetrikker og ydeevne før bredere udrulning. Brug tilladelsessæt til at kontrollere canary-implementeringer – begræns agentadgang til et undersæt af brugere, eller filtrer inden for orkestreringslogik baseret på brugerattributter.
Overvåg og mål succesfrekvenser, svarkvalitet og brugerfeedback. Sammenlign canariske metrikker op mod kontrolgrupper ved brug af den tidligere agentversion. Udvid kun udrulning, når Canary viser ækvivalent eller forbedret ydeevne.
A/B-test sammenligner agentvariationer, der måler kvalitet, omkostninger og brugertilfredshed. A/B-test giver empiriske beviser for forbedringsbeslutninger. Implementer varianter til vilkårligt valgte brugersæt, så du sikrer statistisk gyldighed. Mål resultater på tværs af flere dimensioner (nøjagtighed, tilfredshed, omkostninger og forsinkelse), der giver omfattende sammenligning.
Definer succeskriterier og hypoteser, før du starter A/B-test. Tydelige kriterier forhindrer tvetydige resultater, hvor nogle metrikker forbedres, mens andre nedbrydes. Succeskriterier skal være i overensstemmelse med forretningsmål (f.eks. “Variant B skal matche Variant A-nøjagtighed inden for 2 % og reducere omkostninger med 15 %”).
Champion-challenger-test implementerer forbedrede agentversioner til undersæt af trafik sammenlignet med de nuværende mesterversioner. Mesterudfordringsmønster administrerer forbedringsrisiko ved at vedligeholde bekræftet version som tilbagerulning. Hvis udfordreren klarer sig dårligt, kan du vende tilbage til mester uden brugerpåvirkning. Hvis udfordreren klarer sig bedre, skal du rykke den op til den nye mester.
Etabler målrettede reklamekampagnekriterier, herunder mindste prøvestørrelse for statistisk gyldighed, kvalitetstærskler, som udfordrere skal overskride, og evalueringsvarighed før reklamekampagnebeslutninger. Dokumentkampagnebeslutninger, der opretter et revisionsspor for, hvorfor agentversioner blev ændret.
Etabler hændelsesregistrering, der identificerer operationelle agentproblemer hurtigt gennem omfattende overvågning.
Agentfejltilstande adskiller sig fra traditionelle programfejl. Almindelige fejltilstande inkluderer:
- Hallucinationer - generering af sandsynlige, men ukorrekte oplysninger
- Svar uden for emnet - misforståelse af brugerhensigt
- Overdreven omkostningsforbrug - generering af løbende token
- Timeoutfejl - konklusion tager for lang tid
- Tilladelsesfejl - forsøg på uautoriserede handlinger
- Integrationsfejl - ekstern system utilgængelighed
- Sikkerhedsovertrædelser - generering af upassende indhold
Registrer fejl gennem automatiseret overvågning af advarsler om fejlfrekvenser, kvalitetsmetriknedgradering, omkostningsafvigelser, forsinkelsesforøgelser og brugerskaleringer. Suppler med brugerens selvrapporteringsmekanismer, herunder feedbackanmodninger og tydelig vejledning i, hvordan og hvor du skal give feedback, så du kan afhjælpe rapporterede mangler i automatisering.
Sværdiklassificering distribuerer hændelser til passende besvarere med passende haster. Kritiske hændelser angiver, at produkttilgængelighed påvirker mange brugere, risiko for datakorruption fra agenthandlinger, sikkerhedskompromis eller sikkerhedsovertrædelser, der kræver øjeblikkelig reaktion. Høj alvorsgrad angiver nedsat kvalitet, der påvirker forretningskritiske agenter eller væsentlige omkostningstilsidesættelser. Medium alvorsgrad angiver isolerede problemer eller nærmeste tærskler, der kræver undersøgelse i arbejdstiden. Lav alvorsgrad angiver mindre problemer, der spores uden for hændelsesstyringsprocessen.
Definer alvorskriterier objektivt baseret på brugerpåvirkning, blastradius, risiko for dataintegritet og gendannelsesnødvendighed. Målkriterier forhindrer under-eskalering af virkelige problemer og over-eskalering af mindre problemer. Vedligehold dokumentation om hændelsesløsningsresultater for kontinuerligt at forbedre processen.
De første reaktionsprocedurer styrer de øjeblikkelige foranstaltninger, der skal stabilisere situationen. Procedurerne omfatter:
- Inaktiver mislykkede agenter - aktivering af strømafbrydere
- Distribuer brugere til tilbagerulningsindstillinger - menneskelig overførsel, enklere agent, statiske svar
- Indsaml diagnostiske oplysninger - seneste samtaler, fejllogfiler, ressourcemetrikker
- Adviser interessenter - on-call-teknikere, produktejere, påvirkede brugere
- Start hændelseskommunikation - statussideopdateringer, interne koordineringskanaler
- Dokumenter indledende svarprocedurer som kørselsark, der aktiverer hurtig kørsel uden at kræve hændelsesspecifik undersøgelse.
- Kørselslister skal være eksekverbare af on-call-teknikere uden dyb agent-ekspertise.
Forhindr overlappende fejl, og bevar delvis funktionalitet under agenthændelser.
Kredsløbsforbindelsesmønster inaktiverer automatisk mislykkede agenter, der forhindrer gentagne fejl og brugerpåvirkning, mens problemer løses. Implementer afbrydere, der overvåger fejlfrekvenser og åbner (inaktiverer agent), når fejlfrekvensen overskrider tærsklen for en vedvarende periode.
Konfigurer afbrydere med fejltærskel, varighedsvindue og gendannelsestest. F.eks. en fejlsats på 50 % med et rullende vindue på fem minutter og en regelmæssig prøve, der anmoder om at teste, om agenten er gendannet. Når kredsløbet åbnes, distribueres anmodninger til tilbagerulningsindstillinger. Efter en timeoutperiode skifter kredsløbet til en halvåben tilstand, der tillader prøveanmodninger at gå igennem. Når prøveanmodninger lykkes konsekvent, skal du lukke kredsløbet og genoptage normal drift.
Fallback hierarkier giver god nedbrydning, når primære agenter mislykkes. Design tilbagerulningssekvenser ved at forsøge på mere og mere enkle indstillinger, indtil der opnås acceptabelt svar. Eksempel på tilbagerulningshierarki: Primær sofistikeret agent → Enklere sikkerhedskopieringsagent → Statiske Ofte stillede spørgsmålssvar → Human handoff.
Implementer tilbagerulningslogik i orkestreringslaget i stedet for i agenter, der aktiverer ensartet adfærd på tværs af agentøkosystemet. Test tilbagerulningsstier regelmæssigt, der validerer, at de fungerer, når der er behov for det.
Menneskelig afvisning eskaleres til menneskelige agenter, når AI-agenter ikke kan håndtere anmodninger. Design af overførselsarbejdsflows, der bevarer samtalekonteksten, kommunikerer afførselsårsag, distribuerer til relevante menneskelige agenter med relevant ekspertise og sporer afførselsfrekvens, der afslører forbedringsmuligheder.
Overvåg eskaleringsfrekvenser efter emne, agent og fejlårsag. Højere frekvenser angiver agentfunktionsmangler, der kræver meddelelsesforbedringer, udvidelse af Knowledge eller justering af anvendelsessituationer.
Den godeste nedbrydning bevarer delvis funktionalitet under nedbrydning. Når sofistikerede argumenter mislykkes, skal du vende tilbage til enklere logik. Når realtidsdata er utilgængelige, skal du handle på cachelagrede data. Når eksterne integrationer mislykkes, skal du fungere i skrivebeskyttet tilstand. Gunstig nedbrydning giver et system mulighed for at blive ved med at fungere i en reduceret kapacitet i stedet for at mislykkes fuldstændigt.
Udfør uskyldige efterhændelsesgennemgange med fokus på systemforbedringer i stedet for individuelle fejl, der skaber psykisk sikkerhed for ærlig vurdering.
Timeline-genopbygning skaber detaljerede sekvenser fra de indledende forhold gennem første signal, detektering, bekræftelse, undersøgelse, reaktionshandlinger, gendannelse og validering. Tidsstempel for hver begivenhed, der aktiverer varighedsanalyser for hver fase, der viser, hvor hændelsessvaret blev forsinket.
Medtag følgende i din tidslinje:
- Hvad blev implementeret for nylig (meddelelser, konfigurationer, modeller, integrationer)?
- Hvilke ændringer i anvendelsesmønstre (pludselig stigning i trafik, nye samtaletyper) blev observeret?
- Hvilke eksterne faktorer bidrog (tredjepartstjenestenedgradering, platformsopdateringer)?
- Hvad gjorde registreringen langsommere end ideel?
Rødårsagssidentifikation bestemmer den direkte tekniske årsag. Adskil øjeblikkelig årsag (modeltimeout) fra bidragende faktorer (meddelelsesdesign, der overskrider tokengrænser under specifikke samtalemønstre). Rodårsagsanalyse forhindrer forenklede konklusioner (“agenten havde en fejl”) til fordel for specifikke resultater, der resulterer i en effektiv løsning.
Brug “Five Whys”-teknikken til at gå i detaljer med symptomer og grundlæggende årsager.
Overfladeeksempel: “Agent producerede ukorrekte oplysninger” → “Hvorfor? Hentet kontekst indeholdt forældede data” → “Hvorfor? Knowledge blev ikke opdateret med seneste produktændringer” → “Hvorfor? Der findes ingen proces for produktteamet til at udløse opdateringer af Knowledge” → Rodårsag: Manglende arbejdsflow, der forbinder produktversioner med vedligeholdelse af Knowledge.
Tildragende faktorer afslører organisatoriske, procesmæssige eller arkitektoniske forhold, der muliggør eller forstærker hændelsens påvirkning. Almindelige faktorer omfatter overvågning af huller, der gør det muligt for problemer at forblive længere end registreret, testhuller, der efterlader fejlscenarier ukendt, dokumentationshuller, der nedsætter hastigheden af hurtig diagnose, automatiseringshuller, der tvinger manuelle gendannelsestrin, og arkitektoniske huller, f.eks. enkelte fejlpunkter eller manglende overflødighed.
Bidragende faktoranalyse afslører forbedringsmuligheder ud over øjeblikkelig løsning af grundlæggende årsager. De fleste hændelser har flere bidragende faktorer, som hver forstærker påvirkningen.
Detektionsanalysen undersøger, hvordan hændelsen blev registreret, og om det kunne have været hurtigere. Mange agenthændelser rapporteres først af brugere i stedet for automatiseret overvågning, hvilket angiver et overvågningsmangel. Bestem: Hvilket signal skulle have registreret problemet tidligere? Hvilken overvågning vil aktivere hurtigere registrering? Hvilke advarselskriterier ville have udløst korrekt?
Forbedringer af registreringsanalyser omfatter: Tilføjelse af manglende overvågningsdækning, justering af advarselstærskler, der eliminerer falske negativer, berigelse af advarselskontekst for hurtigere sortering og forbedring af dashboards til proaktiv problemidentifikation.
Response evaluering vurderer, hvad der gik godt, og hvad der gik langsommere eller sværere end nødvendigt. Svarevalueringsspørgsmål: Var kørselslister nyttige og nøjagtige? Var eskaleringsstier tydelige og effektive? Er tilbagerulningsprocedurer testet og klar? Leverede værktøjer de nødvendige diagnostiske oplysninger? Var kommunikationen rettidig og effektiv?
Forbedringer af svarvaluering inkluderer: opdatere kørselslister med lærte lektioner, tydeliggøre eskaleringskriterier, teste tilbagerulningsprocedurer regelmæssigt, tilføje diagnostiske værktøjer og forbedre hændelseskommunikationsskabeloner.
Foranstaltningsposter angiver konkrete, tildelte, tidsbegrænsede forbedringer, der forhindrer gentagelse eller forbedrer fremtidige reaktioner. Undgå vage handlingselementer, f.eks. “forbedr overvågning”, til fordel for specifikke opgaver, f.eks. “tilføj advarsel for agentfejlsats, der overstiger 5 % over et 10-minutters vindue, tildelt: Alex, forfalden: 2 uger”.
Spor fuldførelse af handlingselement i efterfølgende gennemgange, så der faktisk sker kontinuerlig forbedring. Gennemse åbne handlingselementer fra tidligere hændelser under hver efter hændelsesgennemgang. Frekvenser med lav fuldførelse angiver en kontinuerlig fejl i forbedringsprocessen, der kræver opmærksomhed.
Vidensdeling dokumenterer efterhændelsesgennemgange i delt wiki, Knowledge-base eller samarbejdsområde med tagging, der gør det muligt at analysere mønstre på tværs af flere hændelser. Hændelsesretrospektiver skal kunne søges efter fejltilstand, påvirkede komponenter og tidsperiode, så fremtidige respondenter kan lære af historiske hændelser.
Del efterhændelsesgennemgange bredt ud over øjeblikkelige hændelsessvar. Organisationsmæssig læring kræver udbredelse af oplysninger. Overvej at præsentere større hændelseslærred i teammøder eller lunch-and-learn-sessioner, der spreder Knowledge og opbygger kollektiv kapacitet.
Kræv godkendelse, før du implementerer produktionsagenter, der sikrer gennemgang, risikovurdering og interessentjustering.
Tjekliste før implementering validerer parathed, herunder:
- Omfattende test udført - funktionalitet, kvalitet, sikkerhed, ydeevne
- Sikkerhedsgennemgang godkendt - tilladelsesgrænser, dataadgang, handlingsgodkendelse
- Overensstemmelse valideret - regulerende krav, policeoverholdelse
- Dokumentation fuldført - kørselsark, tilbagerulningsprocedurer, eskaleringsstier
- Overvågning konfigureret - kvalitetsmetrikker, fejlfrekvenser, omkostningssporing
- Interessentgodkendelse opnået - produktejer, sikkerhed, compliance
Tjekliste leverer ensartede evalueringskriterier på tværs af agenter. Tilpas tjekliste for agentrisikoprofil, der varierer dybde baseret på agentkritikalitet, datafølsomhed og autonomi niveau.
Risikovurdering evaluerer den potentielle virkning af agentfejl, herunder:
- Blast radius - hvor mange brugere, der er påvirket af fejl
- Datafølsomhed - hvilke dataagenter der får adgang til
- Handlingsautoritet - hvilke ændringer agenten kan foretage
- Integrationsafhængigheder - hvilke systemagenter der påvirker
- Gendannelseskompleksitet - hvor vanskelig tilbagerulning er
- Overensstemmelsespåvirkninger - hvilke bestemmelser der gælder
Risikovurdering bestemmer godkendelseskrav. Agenter med høj risiko kræver ledelsesgodkendelse, sikkerhedsgennemgang og gradvis udrulning, mens agenter med lav risiko kan kræve peer-gennemgang og standardtest.
Godkendelsesarbejdsflows distribuerer implementeringsanmodninger gennem relevante korrekturlæsere. Implementer godkendelsesarbejdsflows ved brug af Salesforce-godkendelsesprocesser eller eksterne implementeringsværktøjer. Automatiser, spor og revider godkendelsesarbejdsflows for at aktivere overensstemmelsesrapportering og hændelsesundersøgelse.
Dokumentgodkendelsesbeslutninger, oprettelse af revisionsspor for, hvem der godkendte implementeringer, hvilke oplysninger der informerede godkendelser, hvilke betingelser eller begrænsninger der blev anvendt, og hvilke overvågningsforpligtelser der blev foretaget.
Nødhjælpsomgåelsesprocedurer muliggør hurtig implementering under produktionshændelser, når normale godkendelsesprocesser vil forsinke kritiske rettelser. Nødserviceprocedurer skal kræve ledelsesgodkendelse, inkludere grundlæggende dokumentation og udløse hurtiggennemgang efter implementering, der validerer nødserviceændringer.
Spor nødimplementeringer separat fra standardversioner. Høj hastighedsimplementeringsfrekvens angiver procesproblemer, der kræver undersøgelse.
Definer kvalitetsportaler, som agenterne skal passere, før produktionsimplementering forhindrer problematiske agenter i at nå brugere.
Funktionstest validerer, at agenter udfører de tilsigtede opgaver korrekt på tværs af repræsentative scenarier. Test glade stier, der dækker typiske interaktioner, kantsager, der dækker sjældne, men gyldige scenarier, fejlstier, der tester, om agenter håndterer ugyldige input på en god måde, og grænsebetingelser, der kontrollerer, om agenten er inden for styringsbegrænsninger, tokenbegrænsninger og datamængdebegrænsninger.
Funktionel test for agenter afviger fra traditionel test, fordi ikke-deterministiske output forhindrer nøjagtig matchning. Test outputegenskaber (indeholder påkrævede oplysninger, bevarer relevant tone, inkluderer nødvendige citationer) snarere end nøjagtig tekst.
Svarkvalitetstest evaluerer svarets nøjagtighed og relevans på tværs af testscenarier. Kvalitetstest kræver menneskelig evaluering eller grundlæggende sandhedsdatasæt med forventede output. Etabler minimumkvalitetstærskler, som agenter skal opfylde (f.eks. “95 % nøjagtighed på tilbageholdte testsæt, nul sikkerhedsovertrædelser, fairness-revision viser ingen demografiske forskelle, der overstiger 5 %”). Vedligehold og udvid testsæt kontinuerligt, efterhånden som der opdages nye kantsager.
Sikkerhedstest validerer, at agenter afviser farlige, uetiske eller ikke-omfangede anmodninger. Sikkerhedstest forsøger modsatte input, herunder:
- Meddelelsesinjektionsforsøg - forsøg på at tilsidesætte instruktioner
- Jailbreakforsøg - forsøg på at tilsidesætte sikkerhedsbegrænsninger
- Anmodning om eskalering - anmodning om mere følsomme handlinger
- Anmodninger uden for omfang - forsøg på uautoriserede opgaver
Tildel sikkerhedstest til uafhængige teammedlemmer, der ikke var involveret i opbygningen af agenten. For agenter med høj risiko skal du hente red team-specialister.
Ydeevnetest validerer forventninger om forsinkelse, gennemsnit og omkostninger. Test under realistisk indlæsning, herunder samtidige samtaler, typiske samtalelængder og projiceret anvendelsesvolumen. Ydeevnetest afslører styringsbegrænsningsproblemer, ressourcebegrænsninger og flaskehalse, der er usynlige i enkeltbrugertest.
Mål testmiljøforbrug under ydeevnetest, og brug det til at projicere produktionskapacitetsbehov.
Sikkerhedstest validerer tilladelsesgrænser, dataadgangskontroller og handlingsgodkendelse. Sikkerhedstest bekræfter: agenter kan ikke få adgang til uautoriserede data, agenter kan ikke udføre uautoriserede handlinger, meddelelsesinjektion kan ikke eskalere rettigheder, og revisionslogføring registrerer alle agentaktiviteter.
Integrer statisk kodesikkerhedsscanning i implementeringspipelinen ved brug af Salesforce Code Analyzer, som scanner Apex, Forløb, Lightning og Visualforce for sikkerhedssårbarheder og kan køre i kontinuerlig integration/implementering (CI/CD) via sin kommandolinjegrænseflade (CLI) eller GitHub-handling. Brug specialiserede AI/agent-sikkerhedstest til at registrere meddelelsesinjektionssårbarheder og risici for følsom dataeksponering, da disse er løbende LLM-inputtrusler uden for omfanget af statiske kodeanalyser.
Anvend ændringsstyringsdisciplin på agentimplementeringer, så du sikrer, at ændringerne dokumenteres, gennemses og kommunikeres.
Ændringsdokumentationen indeholder:
- Hvad er ændret - meddelelsesændringer, konfigurationsopdateringer, modelændringer
- Hvorfor denne ændring blev foretaget - kvalitetsforbedring, optimering af omkostninger, fejlrettelse
- Hvilke test validerede denne ændring - testresultater, kvalitetsscores, sikkerhedsscanninger
- Hvilken tilbagerulningsprocedure findes
Ændringsdokumentation aktiverer hændelsesundersøgelse, overensstemmelsesrapportering og Knowledge. Dokumenterede ændringer opretter en læringsorganisation, der bygger på tidligere erfaringer i stedet for at genopdage lektioner.
Kommunikationsplanlægning underretter interessenter om agentændringer, herunder påvirkede brugere, driftsteams, supportteams og forretningsinteressenter. Kommunikation skal beskrive: hvad der ændres, hvornår ændringen implementeres, hvilke fordele brugerne vil se, hvilke risici der findes, og hvem de skal kontakte for problemer.
Opret kommunikationsskabeloner for forskellige ændringstyper, standardiser meddelelser og reducer implementeringsforberedelse overhead.
Implementeringsplanlægningstider for agentimplementeringer i perioder med lav anvendelse informeret af begivenhedsovervågningsdata, der viser faktiske anvendelsesmønstre. Undgå implementeringer under spidsbelastning, månedsslut lukning, kvartalsslut lukning eller større forretningsbegivenheder. Kommuniker implementeringsvinduer inklusive forventet varighed og tidslinje for tilbagerulningsbeslutning.
Overvej at planlægge større ændringer for tidligt-til-midt-uge, og undgå sen-uge-implementeringer, så problemer kan håndteres med tilstrækkelige ressourcer. Prioriter hurtig tilbagerulning og stærk efterimplementeringsovervågning over enhver fast kalenderregel.
Byt vinduer og fryser beskytter kritiske arbejdsperioder. Etabler ændringsfrysningsperioder før større forretningsbegivenheder (slut på regnskabsår, produktlanceringer og større marketingkampagner) for at forhindre implementeringsinducerede problemer i perioder med høje satser.
Dokumentændringsfrysningskalender årligt kommunikerer begrænsede perioder tilstrækkeligt på forhånd, så team kan planlægge tilsvarende. Overdreven frysning nedsætter hastigheden. Utilstrækkelige frysninger skaber forretningsrisiko.
Etabler feedbackløkker, der forbinder driftsmæssig telemetri med agentforbedring.
Brugerfeedbackindsamling indsamler eksplicit feedback gennem spørgsmål eller opfølgningsundersøgelser. Indsaml implicit feedback gennem fuldførelsesfrekvenser, eskalering til humane agenter, prøvemønstre og opfølgningsspørgsmål, der indikerer utilfredshed. Kombiner eksplicitte og implicitte signaler, så du får et omfattende kvalitetsperspektiv.
Indsaml feedback direkte, lige når det sker og ikke senere. Forsinket feedbackindsamling reducerer svarfrekvenser og introducerer tilbagekaldsbias.
Anvendelsesanalyser viser virkelige samtalemønstre som gentagne emner, spørgsmål og tendenser. De tester, om en agents kompleksitet tjener dens bevarelse, om funktionerne bliver ubrugte på grund af dårlig opdagelighed, og om den virkelige anvendelse validerer de oprindelige designantagelser.
Forespørgselssamtalelogfiler, der analyserer spørgsmålstyper, samtalelængder, succesfrekvenser efter emne og brugertilfredshed efter samtalekarakteristika. Anvendelsesmønsteranalyser guider meddelelser om justering, udvidelse af Knowledge og prioritering af funktioner.
Fejlmønsteranalyse identificerer systematiske kvalitetsproblemer, der kræver afhjælpning. Analyser fejllogfiler grupperet efter fejltype, påvirkede brugere, samtalemønstre og tidsfordeling. Fejlmønstre afslører meddelelsesproblemer, Knowledge, integrationsproblemer eller kantsager, der kræver håndtering.
Prioriter fejlrettelse efter frekvens og påvirkning. Højfrekvente fejl, der påvirker mange brugere, kræver øjeblikkelig opmærksomhed. Fejl med lav frekvens kan repræsentere acceptable kanttilfælde afhængigt af forretningseffekt og udbedringsomkostninger.
Kvalitetstendensovervågning sporer nøjagtighed, relevans, sikkerhed og tilfredshed over tid og registrerer nedbrydning, før den bliver alvorlig. Opret kvalitetsbasislinjer efter den indledende agentimplementering. Overvåg løbende kvalitet op mod basislinjeadvarsler, når tendenser falder ud over acceptable tærskler.
Kvalitetsovervågning afslører, om meddelelsesændringer, modelopdateringer eller ændringer af Knowledge forbedrer eller nedsætter ydeevnen, der aktiverer datastyrede forbedringsbeslutninger.
Spor eksperimenter, der systematisk informerer forbedringsbeslutninger med empiriske beviser.
Eksperimenteringsstrukturen giver en ensartet struktur til test af forbedringer, herunder:
- Hypotese - hvilken forbedring der forventes
- Eksperimentelt design - hvordan varianter implementeres
- Metrikker - hvilke resultater der måles
- Eksempelstørrelse - hvor mange interaktioner der er nødvendige for statistisk gyldighed
- Succeskriterier - hvilke resultater der justerer promovering
Dokumenteksperimenter før kørsel forhindrer tvetydig fortolkning af resultater. Foruddefinerede succeskriterier aktiverer tydelige kampagnebeslutninger, der undgår lange diskussioner om, om resultaterne er “godt nok”.
Variantsporingslogfiler, hvilke brugere modtog hvilke varianter, der aktiverer resultatkorrelation. Spor variantstildeling i samtalemetadata, der aktiverer analyse af kvalitet, omkostninger og tilfredshed efter variant.
Statistisk validitet sikrer, at forsøgene kører længe nok med tilstrækkelig prøvestørrelse til pålidelige konklusioner. Beregn den krævede prøvestørrelse før eksperimenter baseret på den forventede effektstørrelse, statistiske potenskrav og acceptable fejlfrekvenser. Utilstrækkelige prøver producerer støjende resultater, der fører til dårlige beslutninger.
Multi-armed bandit optimering tildeler dynamisk mere trafik til bedre effektive varianter under eksperimenter. Multi-armede bandittilgange reducerer salgsmulighedsomkostningerne ved at reducere eksponeringen for underordnede varianter, mens de stadig indsamler tilstrækkelige data til statistisk analyse.
Eksperimentkatalog logfører hvert eksperiments varianter, resultater og beslutninger. Den stopper teams i at teste mislykkede tilgange igen, distribuerer læring på tværs af organisationen og opbygger en delt registrering af, hvad der faktisk fungerer.
Driftsmæssig excellence for agentiske systemer kræver udvidelse af traditionelle DevOps-praksisser for at håndtere entydige AI-karakteristika. Omfattende observation gør det muligt at forstå emergent agentadfærd. Systematisk livscyklusstyring sikrer kvalitet, sikkerhed og omkostningskontrol. Hændelsessvarprocedurer håndterer agentspecifikke fejltilstande. Kontinuerlig forbedring transformerer driftsmæssig oplevelse til organisationsfunktionalitet.
Nøglepraksisser for driftsmæssig excellence i agentiske systemer:
- Registrer komplette samtaler, herunder input, output, argumentspor, handlinger og resultater.
- Overvåg svarkvalitet kontinuerligt gennem nøjagtighed, relevans, sikkerhed og tilfredshedsmetrikker.
- Registrer modelforskydning og adfærdsmæssige ændringer gennem basislinjesammenligning og afvigelsesregistrering.
- Versionsstyringsmeddelelser, konfigurationer og modeller, der aktiverer tilbagerulning og A/B-test.
- Implementer gradvis udrulning med funktionsflag og kanariske implementeringer, der begrænser eksplosionsradius.
- Design af afbrydere og tilbagerulningshierarkier, der forhindrer overlappende agentfejl.
- Udfør skadesløse efterhændelsesgennemgange med fokus på systematiske forbedringer.
- Etabler kvalitetsportaler og godkendelsesprocesser, der forhindrer problematiske agenter i at nå produktion.
- Opbyg feedbackløkker, der forbinder driftsmæssig telemetri med agentforbedring.
- Spor eksperimenter systematisk ved brug af empiriske beviser til at guide forbedringsbeslutninger.
Organisationer, der investerer i driftsmæssig ekspertise for agenter, får bæredygtig konkurrencefordel gennem pålidelige AI-funktioner af høj kvalitet, der udvikles kontinuerligt med forretningsbehov.