Operational Excellence voor de Agentic Enterprise

Operational Excellence voor de Agentic Enterprise

Operationele uitmuntendheid voor agentische systemen breidt traditionele DevOps-praktijken uit om de unieke kenmerken van AI-agenten aan te pakken: niet-deterministisch gedrag, contextafhankelijk redeneren en geheugen, complexiteit van doelen en variabele gevolgkosten. Conventionele toepassingen volgen voorspelbare codepaden, maar agenten genereren nieuwe reacties op basis van context. Traditionele bewaking houdt bekende meetgegevens bij, terwijl de observatie door agenten inzicht vereist in de redenering en beslissingspatronen van taalmodellen. Standaardtests valideren deterministische uitvoer, maar agentvalidatie beoordeelt de reactiekwaliteit over meerdere dimensies, waaronder nauwkeurigheid, relevantie, veiligheid en eerlijkheid.

Producten en systemen veranderen in de loop van de tijd, dus pas deze vijf ontwerpprincipes toe om operationele uitmuntendheid in te bedden in de manier waarop u ze uitvoert: evolueer mee met waarneembaarheid, standaardiseer operationele procedures, omarm een DevOps-cultuur, automatiseer voor efficiëntie en leer van alle operationele events. Het kernprincipe van operationele uitmuntendheid, “Evolueren met waarneembaarheid”, wordt cruciaal voor agentische systemen omdat agentgedrag ontstaat uit complexe interacties tussen aanwijzingen, opgehaalde context, modelgedrag en gesprekshistorie, in plaats van uit deterministische code-uitvoering. Architecten kunnen niet elke reactie van agenten voorspellen op het moment van ontwerpen, aangezien responsen worden bepaald door het model, de aanwijzing en de live context, dus ontwerp voor observatie en vangrails. Uitgebreide observatie laat zien hoe agenten zich gedragen onder reële omstandigheden. Deze zichtbaarheid maakt gegevensgestuurde verbeteringen en snelle probleemdiagnoses mogelijk wanneer agenten onverwachte uitvoer produceren.

“Operations as Code” krijgt nieuwe dimensies voor agenten. Traditionele infrastructuur-als-code strekt zich uit tot versiebeheer voor aanwijzingen, modelconfiguratiebeheer en automatisering van agentimplementatie. Operationele procedures voor agenten hebben betrekking op wijzigingen in modelversies, promptevolutie en Knowledge Base-updates, en conventionele implementatie- en terugdraaibewerkingen.

“Leer van alle operationele events” wordt nog waardevoller met agentische systemen. Agent incidenten onthullen vaak subtiele prompt engineering problemen, scripting en doeltreffende combinatie fouten, Knowledge base hiaten of onverwachte interactiepatronen van gebruikers. Postmortems gecombineerd met systematische analyse van agenttelemetrie transformeren operationele ervaring in organisatorische mogelijkheden die in de loop van de tijd toenemen.

Volledig vastleggen van gesprekken vormt de basis van observatie door agenten. Leg elk gesprek vast, inclusief gebruikersinvoer, reacties van agenten, redeneringsstappen, aangeroepen acties, opgehaalde gegevens en uiteindelijke uitkomsten. Deze telemetrie dient meerdere doelen: fouten opsporen in specifieke incidenten, kwaliteitsanalyse voor vele interacties, nalevingscontrole, modelverbetering en analyse van gebruikspatronen.

Gebruik het native model voor sessietracering in plaats van op maat samengesteld vastleggen. Agentforce Sessietracering legt interactiegegevens van agenten vast in een gecombineerd gegevensmodel op Data 360, in plaats van dat u een parallel telemetriesysteem moet samenstellen. Het gegevensmodel Sessietracering (STDM) legt het gesprek vast als een traceringshiërarchie. Elke sessie bevat interacties (beurten), elke interactie bevat stappen (UserInputStep, LLMExecutionStep, FunctionStep) en stappen bevatten berichten (communicatie tussen gebruikers en agenten). STDM gebruikt standaard Data 360-objecten zoals AIAgentSession, AIAgentSessionParticipant, AIAgentInteraction, AIAgentInteractionStep en AIAgentInteractionMessage. Interacties hebben identifiers voor gedistribueerde tracering (TelemetryTraceId en TelemetryTraceSpanId) en stappen hebben een span identifier (TelemetryTraceSpanId), die een OpenTelemetry-stijl spanmodel weerspiegelt.

Het modelleren van gesprekken met agenten als traces en spans is de industriestandaardbenadering voor observatie door agenten, en hergebruik van het native model vermijdt de schaalproblemen waar handmatig samengestelde objecten tegenaan lopen: het opslaan van gesprekken met meerdere beurten, grote JSON-payloads en snelle gegevensgroei. Het samenstellen van aangepaste transactionele objecten om gesprekken vast te leggen is een bewuste uitzondering—bijvoorbeeld een lichtgewicht aangepast object dat het gedrag van agenten correleert met bedrijfsuitkomsten en niet met het primaire substraat voor vastleggen.

Sessie- en gespreksmetagegevens leggen kritieke context vast, waaronder sessie- en interactie-ID’s, gebruikersidentiteit, agentidentiteit, begintijd en eindtijd. STDM koppelt ook elke interactiestap aan de bijbehorende gespreksrecords van het grote taalmodel (LLM) (via GenerationId en GenAiGatewayRequest/Response-verwijzingen). Tokengebruik, model en aanwijzingsdetails zijn beschikbaar via die joins in plaats van opgeslagen als sessievelden. Metagegevens maken het filteren en aggregeren van gesprekken voor patroonanalyse mogelijk.

Interactie- en stapniveaudetails leggen elke beurt vast, inclusief invoer van de gebruiker, reactie van de agent, redenering (indien beschikbaar), vertrouwensscores, opgehaalde context, pogingen tot acties en aangetroffen fouten. Tracing op stapniveau maakt gedetailleerd incidentonderzoek mogelijk, waarbij exact wordt gereconstrueerd wat er op elk punt in de redeneerketen is gebeurd.

Actiestappen leggen elke actie vast die een agent onderneemt, inclusief API-aanroepen, gegevenswijzigingen, externe systeeminteracties en aangeroepen integraties. Actierecords beantwoorden vragen als “wat heeft deze agent gewijzigd?” en “tot welke systemen heeft deze agent toegang gehad?”. Deze antwoorden ondersteunen beveiligingsonderzoeken en nalevingsvereisten. STDM legt acties vast als interactiestappen.

Redeneringstraceringen uit de Atlas Reasoning Engine onthullen beslissingsprocessen van agenten, waardoor kan worden vastgesteld waarom agenten specifieke acties hebben gekozen of bepaalde reacties hebben gegenereerd. Sessietracering legt de stappen van de planner vast als onderdeel van elke interactie. De diepte van blootgesteld redeneren is afhankelijk van het model en de planner, maar indien beschikbaar verbeteren deze traces de foutopsporing dramatisch.

Het Einstein Trust Layer-controletraject voor genererende AI legt elke generatieve AI-interactie, de aanwijzing en de reactietekst vast, inclusief via persoonsgegevens gemaskeerde versies, opgehaalde aardingsgegevens, veiligheids- en toxiciteitsscores voor reacties en LLM-modeldetails, allemaal gestreamd naar en opgeslagen in Data 360. Schakel Einstein Generatieve AI- en feedbackgegevensverzameling en -opslag in zodat audit- en feedbackgegevens worden vastgelegd in Data 360, waar u deze kunt opvragen en analyseren met Data 360-rapportage voor langdurige bewaring.

Voorbeeld:

Goed. Gesprekslogboeken die zijn opgeslagen in aangepaste Salesforce-objecten met velden voor gebruikersinvoer, reactie van agenten, ondernomen acties, tokenverbruik en gespreksuitkomst. Dashboard toont gesprekssuccesscores op agent en gebruikscase. Beter: Uitgebreid vastleggen omvat redeneringssporen die het beslissingsproces van agenten tonen, opgehaalde context die toont welke informatie gefundeerde responsen bevat, en vertrouwensscores die duiden op onzekerheid. Beste: Conversation Analytics correleert het gedrag van agenten met bedrijfsresultaten, identificeert verbeteringsopportunities door middel van patroonanalyse en voedt continue leerpijplijnen met voorbeelden met kwaliteitslabels.

Bewaak operationele prestaties om ervoor te zorgen dat agenten voldoen aan serviceniveaus en binnen de verwachte parameters werken.

Responslatentie houdt de end-to-end tijd bij van gebruikersinvoer tot reactie van agenten. Latentie is rechtstreeks van invloed op de gebruikerservaring. Meet de latentie bij percentielen (p50, p95, p99) om typische prestaties en slechtste ervaringen te ontdekken. Waarschuwing wanneer de p95-latentie de drempelwaarden overschrijdt, wat duidt op een achteruitgang van de prestaties.

Latentiefactoren voor agenten zijn onder meer modelinferentietijd, duur van het ophalen van gegevens en context, uitvoering van externe tools en acties en netwerklatentie. Instrumenteer elke fase afzonderlijk en schakel doelgerichte optimalisering in wanneer de algehele latentie doelen overschrijdt.

Tokenverbruik meet tokens die per gesprek, per agent en per gebruikscase worden gebruikt. Tokenverbruik verhoogt de inferentiekosten en heeft invloed op de reactietijd (meer tokens vereisen meer inferentieberekening). Houd de tokendistributie bij om te zien of het feitelijke gebruik overeenkomt met projecties. Detecteer gesprekken met uitschieters die buitensporige tokens verbruiken en die duiden op prompte problemen of misbruik.

Tokenmeetgegevens omvatten aanwijzingstokens (invoer naar model), voltooiingstokens (modeluitvoer) en totaal aantal tokens (som van aanwijzing en voltooiing). Prompttokens zijn beter controleerbaar dan voltooiingstokens. Optimaliseer aanwijzingen en opgehaalde context om het gebruik van prompttokens te verminderen met behoud van kwaliteit.

Middels bewaking worden gelijktijdige gesprekken, verzoeken per seconde en trends in gespreksvolume bijgehouden en kunnen projectcapaciteits- en schaalvereisten worden verbeterd. Vergelijk huidige doorvoer met bekende snelheidslimieten of capaciteitsbaselines die waarschuwen wanneer drempelwaarden worden benaderd.

Fouten bijhouden bewaakt fouten op type, inclusief modelspecifieke fouten, time-outfouten, fouten wegens geweigerde machtigingen en fouten bij externe integratie. Foutpatronen brengen systematische problemen aan het licht die moeten worden verholpen. Bereken foutenpercentages als percentage van het totale aantal verzoeken, zodat vergelijking tussen agenten en tijdsbestekken mogelijk is.

Maak onderscheid tussen foutcategorieën die verschillende reacties vereisen. Modelspecifieke fouten vereisen mogelijk snelle aanpassingen of overschakelen naar een beter model. Machtigingsfouten vereisen wijzigingen in de beveiligingsconfiguratie. Integratiefouten vereisen extern systeemonderzoek of activering van stroomonderbrekers.

Beschikbaarheidscontrole meet de uptime van agenten en succesvolle bedrijfsperioden. Bereken beschikbaarheid als percentage van de tijd dat agenten met succes reageren op verzoeken. Houd beschikbaarheid bij ten opzichte van Service Level Objectives (SLO’s), zodat u proactief kunt reageren wanneer de beschikbaarheid onder de doelen zakt.

Proactive Monitoring evalueert uw organisatie op platformanomalieën en resource-inzetproblemen die van invloed kunnen zijn op de gezondheid van de infrastructuur van agenten. Signalen worden zichtbaar voordat ze escaleren tot voor de gebruiker zichtbare problemen. Gebruik dit om voorwaarden op infrastructuurniveau voor te blijven—zoals ongebruikelijke API-activiteit of resourceverbruik dat richting platformlimieten gaat—die de prestaties van agenten kunnen verslechteren. Controleer de signalen ten opzichte van de normale bedrijfsuitgangswaarde van uw agenten, zodat u navolgbare anomalieën kunt onderscheiden van verwachte variatie.

Bewaak continu de kwaliteit van respons en detecteer degradatie voordat deze van invloed is op bedrijfsresultaten. Wanneer het platform ingebouwde evaluatietools biedt, gebruikt u deze in plaats van aangepaste of handmatige processen. Begin met native test- en evaluatietools. Met Agentforce-testcentrum kunt u herbruikbare testcasesets onderhouden en er in batches agenten tegen uitvoeren, waarbij u controleert of de agent het verwachte onderwerp en de verwachte actie heeft geselecteerd en een acceptabele respons heeft geproduceerd, in plaats van uw eigen testharnas samen te stellen en uit te voeren. Het ondersteunt ook native beoordelaars, inclusief kant-en-klare kwaliteitsdimensies en een LLM-als-rechter-benadering voor het scoren van gesprekskwaliteit, en het maakt het mogelijk om aangepaste beoordelaars te schrijven voor organisatiespecifieke criteria. Gebruik representatieve gesprekken in uw testsets zodat de evaluatie het werkelijke gebruik weerspiegelt.

Reactienauwkeurigheid meet of responsen van agenten correcte informatie bevatten. Nauwkeurige evaluatie vereist definities van bekende antwoorden of menselijke beoordeling. Voor feitelijke vragen met bekende antwoorden vergelijkt geautomatiseerde evaluatie responsen van agenten met correcte antwoorden. Bewaar deze als testcases in het Testcentrum voor herhaalbare evaluatie. Voor open vragen beoordelen menselijke beoordelaars de nauwkeurigheid van gesprekken in de steekproef. Houd nauwkeurigheidstrends in de loop van de tijd bij en laat zien of prompte wijzigingen, modelupdates of Knowledge base-wijzigingen de prestaties verbeteren of verslechteren.

Responsrelevantie meet of responsen van agenten vragen van gebruikers op de juiste manier beantwoorden, zelfs als ze niet perfect nauwkeurig zijn. Relevante reacties hebben inzicht in de intentie van de gebruiker en bieden nuttige informatie, zelfs wanneer een volledig antwoord niet mogelijk is. Evalueer relevantie door middel van native beoordelaars, indien beschikbaar, menselijke beoordeling van gesprekken in de steekproef en gebruikerssignalen. Voor agenten die zijn gebaseerd op een Knowledge base, kan een native analyse van de kwaliteit van ophalen contextrelevantie, relevantie van antwoorden en getrouwheid (gegrondheid) van responsen beoordelen.

Vangrails detecteren onveilige, ongepaste of schadelijke reacties, inclusief vertekening, aanstootgevende inhoud, gevaarlijk advies en reacties buiten het bereik. De Einstein Trust Layer past toxiciteitsdetectie toe op LLM-interacties tijdens run-time, wat uw eerste verdedigingslinie is. Verbeter de veiligheidsbewaking door middel van inhoudfiltering, handmatige beoordelingssteekproeven, rapportagemechanismen voor gebruikers en fairness audits waarbij uitkomstverdelingen over demografische groepen worden beoordeeld.

Meetgegevens over gebruikerstevredenheid leggen de kwaliteit van de subjectieve ervaring vast. Agentforce feedback stroomt naar Einstein’s generatieve AI Audit en Feedback gegevensmodellen (GenAIFeedback/GenAIFeedbackDetail in Data 360). Deze modellen leggen expliciete gebruikerssignalen vast—duim omhoog/omlaag, accepteren/afwijzen, bewerken en woordelijke opmerkingen—van een menselijke of systeembron, naast het gatewayverzoek en het genereren van gegevens. Leg expliciete feedback vast (vragen vóór escalatie, na het einde van een gesprek en via vervolgenquêtes) waar u deze nodig hebt, en combineer expliciete en impliciete signalen voor een uitgebreid kwaliteitsperspectief.

Salesforce biedt verschillende modeloppervlakken. De generatieve laag biedt de gespreksredenering waarop agenten worden uitgevoerd: Door Agentforce gehoste modellen bieden kant-en-klare redeneringen binnen de Salesforce Trust grens en brengen uw eigen LLM-koppelingen (BYOLLM) naar externe LLM’s of aanbieders. De predictieve laag levert de gestructureerde scores waarin agenten hun beslissingen baseren: BYOM haalt voorspellende scores van nul exemplaren op van extern gehoste platforms en native Einstein modellen produceren geautomatiseerde scores en classificatie voor CRM-objecten. Samen laten deze oppervlakken een autonome agent redeneren in natuurlijke taal en zijn werkstroom baseren op gestructureerde, statistische gegevens.

Controleer op modeldrift, wat aangeeft dat de prestaties in de loop van de tijd zijn afgenomen of dat de omstandigheden veranderen die aanpassing vereisen. Bekijk releaseopmerkingen en test kritieke gebruikscases in een sandbox voordat elke belangrijke release in productie gaat. Gebruik de releasematrix en het voorbeeldvenster van de sandbox om compatibiliteitsproblemen vroeg op te sporen.

Prestatieafwijking treedt op wanneer de nauwkeurigheid, relevantie of veiligheid van agenten in de loop van de tijd afneemt. Houd kwaliteitsmeetgegevens bij in de loop van de tijd en detecteer statistisch significante dalingen. Prestatieafwijking kan het gevolg zijn van achteruitgang van het model, Knowledge base-staaless, snelle onjuiste uitlijning met veranderende gebruikspatronen of conceptafwijking waarbij relaties tussen invoer en gewenste uitvoer zich ontwikkelen.

Stel baselineprestaties vast onmiddellijk na de initiële agentimplementatie en meet nauwkeurigheid, relevantie, veiligheid en tevredenheid voor representatieve testcases. Evalueer periodiek opnieuw op basis van dezelfde testcases, waarbij prestatiewijzigingen onafhankelijk van diensten met gebruikspatronen worden onthuld.

Waarschuw wanneer kwaliteitsmeetgegevens boven aanvaardbare drempelwaarden dalen. Definieer drempelwaarden op basis van tolerantie voor bedrijfsimpact. Sommige gebruikscases tolereren een bescheiden kwaliteitsdegradatie; andere vereisen onmiddellijke reactie op elke daling.

Distributieafwijking treedt op wanneer invoerpatronen van gebruikers aanzienlijk veranderen door distributie van trainings- of tuninggegevens. Distributiedrift verslechtert de prestaties wanneer agenten invoertypen tegenkomen waarvoor ze niet zijn ontworpen. Bewaak invoerkenmerken, waaronder vraaglengte, onderwerpverdeling, taalcomplexiteit en domeinterminologie die significante verschuivingen signaleren.

Vergelijk huidige invoerverdelingen met historische baselines. Grote distributiediensten kunnen duiden op nieuwe gebruikscases, veranderend gebruikersgedrag of veranderende bedrijfsprocessen. Distributiediensten kunnen snelle updates, Knowledge base-uitbreiding of uitbreidingen van agentmogelijkheden vereisen.

Gedragsdrift treedt op wanneer reactiepatronen van agenten onverwacht veranderen. Bewaak responskenmerken zoals gemiddelde responsduur, aanroepingsscores van acties, escalatiefrequenties en foutpatronen. Belangrijke gedragswijzigingen kunnen duiden op prompte problemen, modelproblemen of onderliggende systeemwijzigingen.

Stel gedragsuitgangspunten vast vroeg in de productie en leg normale bedrijfskenmerken vast, zoals regelmatige prestatiepatronen, gereedschapsgebruik en beslissingstrajecten. Deze baselines worden de benchmark waaraan later anomaliedetectie wordt gemeten. Vergelijk het doorlopende gedrag met baselines en waarschuw wanneer afwijkingen de verwachte variatie overschrijden.

Geautomatiseerde waarschuwing maakt proactieve driftrespons mogelijk. Configureer waarschuwingen die worden geactiveerd wanneer meetgegevens over drift de drempelwaarden overschrijden en die onderzoek en potentiële oplossingen activeren, waaronder verfijning van de prompt, Knowledge Base-updates, uitbreiding van testsets of hertraining van het BYOM-model.

Automatisch ongebruikelijk gedrag van agenten detecteren dat onderzoek vereist.

Kostenanomalieën, inclusief pieken in tokenverbruik, stijgingen van inferentiescores of versnelling van totale kosten. Kostenpieken kunnen duiden op prompte problemen die leiden tot overmatig genereren van tokens, misbruik of misbruik als gevolg van onverwacht gebruik, of infrastructuurproblemen die redundante aanroepen veroorzaken.

Bewaak tokenverbruiksdistributies door gesprekken met uitschieters te detecteren. Onderzoek gesprekken die 10 keer het normale aantal tokens verbruiken, om te begrijpen of ze legitieme edgecases vertegenwoordigen of problemen die moeten worden verholpen.

Foutpercentagepieken, waaronder plotselinge toenames in foutpercentages, nieuwe fouttypen die niet bestonden in de uitgangssituatie, of gelokaliseerde foutconcentraties die specifieke gebruikers, agenten of gebruikscases betreffen. Foutpieken gaan vaak vooraf aan kwaliteitsproblemen die klanten kunnen zien. Proactieve detectie maakt herstel mogelijk vóór wijdverspreide gevolgen.

Responspatroonwijzigingen, inclusief plotselinge verschuivingen in responslengte, frequentie van aanroepen van acties of wijzigingen in escalatiescores. Patroonwijzigingen kunnen duiden op prompte problemen, wijzigingen in modelgedrag of veranderende gebruikspatronen.

Het opgeven van gesprekken wanneer gebruikers gesprekken met hogere percentages opgeven, suggereert een verminderde kwaliteit, verhoogde latentie of functionaliteitshiaten. Houd het opgeven bij op gespreksfase en geef aan of gebruikers opgeven tijdens de eerste interactie, halverwege het gesprek of na een poging tot voltooiing van een taak. Stopzettingspatronen tonen specifieke verbeteringsmogelijkheden.

Ontwerp waarschuwingsarchitectuur die snelle kennisgevingen tegen waarschuwingsvermoeidheid in evenwicht brengt. Routeer kritieke storingen van agenten onmiddellijk naar oproepbare engineers. Routeer kwaliteitswaarschuwingen naar productteams voor onderzoek tijdens kantooruren. Aggregeer kleine anomalieën in dagelijkse samenvattingen voor trending analyse.

Aanwijzingen voor versiebeheer, configuraties en modelmetagegevens die terugdraaien, A/B-tests en onderhoud van controletrajecten mogelijk maken.

Aanwijzingssjablonen zijn herbruikbare aanwijzingen die worden gemaakt in Aanwijzingensamensteller en die het doel, de beperkingen en de merkrichtlijnen van de agent definiëren, plus plaatshouders voor dynamische aardingsgegevens, zoals klant- of productdetails. Sla aanwijzingssjablonen op in Git naast toepassingscode, waarbij aanwijzingen worden behandeld als kritieke toepassingslogica die dezelfde striktheid verdient als code. Wijzigingen in de aanwijzing gaan via codebeoordeling, testen en gecontroleerde implementatie.

Gebruik Aanwijzingensamensteller voor herhalende aanwijzingsontwikkeling met versiehistorie en testmogelijkheden. Wanneer u aanwijzingssjablonen als agentacties gebruikt, bekijkt u een voorbeeld van de sjabloon in Aanwijzingensamensteller om te bevestigen dat samenvoegvelden correct worden opgelost. Gebruik vervolgens het Testcentrum om end-to-end tests uit te voeren die bevestigen dat de agent de actie selecteert en de juiste uitvoer genereert.

Exporteer voor productie geschikte aanwijzingen naar versiebeheer, waardoor synchronisatie ontstaat tussen Aanwijzingensamensteller ontwikkeling en brongestuurde implementatiepijplijnen.

Configuratiebeheer houdt modelselectie, temperatuurinstellingen, ophaalconfiguraties en voorzieningenvlaggen bij. Sla configuraties op als code zodat u omgevingsspecifieke waarden kunt gebruiken, implementaties kunt automatiseren en configuratieafwijkingen kunt detecteren.

Semantische versiebeheer is van toepassing op releases van agenten. Belangrijke versies geven wijzigingen aan zoals gewijzigde invoer-/uitvoercontracten of een aanzienlijk gewijzigde werking. Kleinere versies duiden op toevoegingen of verbeteringen van voorzieningen die de compatibiliteit behouden. Patchversies geven bugfixes aan. Versienummering communiceert de impact van wijzigingen aan operationele teams en gebruikers.

Implementeer semantische versiebeheer voor agentcomponenten, waaronder aanwijzingssjablonen, agentconfiguraties en Knowledge bases. Versienummers in logboeken schakelen incidentcorrelatie met specifieke implementaties in.

In de wijzigingsdocumentatie worden de redenen voor snelle wijzigingen, configuratiewijzigingen en modelupdates vastgelegd. Leg vast wat er is gewijzigd, waarom het is gewijzigd, welke tests de wijziging hebben gevalideerd en welke terugdraaiprocedures er zijn. Veranderingsdocumentatie versnelt incidentonderzoek en Knowledge transfer.

Houd een uitgebreid register bij van modelversies, aanwijzingen, configuraties en implementatiehistorie.

Modelregister legt vast welke modelversies waar worden geïmplementeerd, inclusief modelfamilie, specifieke versie, finetuningstatus, implementatieomgeving (productie, fasering en ontwikkeling), implementatiedatum en verantwoordelijk team. Het register biedt één bron van waarheid voor de status van de agentinfrastructuur.

Implementatie bijhouden registreert elke agentimplementatie, inclusief geïmplementeerde versie, omgeving, implementatietijdstempel, implementerende gebruiker, verkregen goedkeuringen en implementatie-uitkomst. Gebruik de implementatiehistorie om de impact te beoordelen wanneer er problemen optreden (bijvoorbeeld “welke agenten zijn geïmplementeerd voordat dit incident begon?”) en om nalevingsrapportage te ondersteunen.

Bijhouden van afhankelijkheid wijst relaties tussen agenten, aanwijzingen, Knowledge bases, acties en integraties toe. Wanneer gedeelde Knowledge bases worden bijgewerkt, toont het bijhouden van afhankelijkheid welke agenten hierbij betrokken zijn. Wanneer externe integratie verandert, identificeert het bijhouden van afhankelijkheid beïnvloede agenten.

Documenteer afhankelijkheden expliciet in plaats van ze te ontdekken tijdens incidenten. Maak afhankelijkheidskaarten die worden onderhouden via ontwikkelings- en implementatieprocessen.

Afschrijvingsbeleid definieert levenscyclussen voor modelversies, inclusief ondersteuningsduur, afschrijvingstijdlijn en migratievereisten. Beleidsvormen voor duidelijke afschrijvingen beheren technische schulden waardoor onbeperkte ondersteuning van oude modelversies wordt voorkomen. Stel ruim van tevoren een afschrijvingsschema op waarin tijdlijnen worden gecommuniceerd, zodat geplande migraties mogelijk zijn in plaats van noodmaatregelen op gedwongen afschrijvingen. Een goed gecommuniceerde en door polissen ondersteunde minimale opzegtermijn biedt voldoende migratietijd voor kritieke wijzigingen.

Met terugdraaiprocedures kunnen teams snel herstellen van problematische implementaties. Documenteer terugdraaiprocedures voor elke agent en behels het volgende:

  • Voorwaarden die een terugdraaiactie activeren
  • Naar welke versie moet worden teruggekeerd
  • De terugdraaiing uitvoeren
  • Wie de terugdraaiing autoriseert en uitvoert
  • Welke tests bevestigen dat de terugdraaiing is geslaagd en welke teams moeten worden geïnformeerd.

Test terugdraaiprocedures regelmatig in niet-productieomgevingen om te controleren of ze werken voordat u erop vertrouwt tijdens productie-incidenten. Oefen met nepimplementaties zodat het team precies weet wat het moet doen. Niet-geteste terugdraaiprocedures mislukken vaak wanneer dat het meest nodig is.

Handhaaf de kwaliteit van agenten door voortdurende training, verfijning en verfijning van werkstromen.

Feedbackverzameling verzamelt systematisch feedback van gebruikers, correcties van menselijke beoordelingen, kwaliteitsbeoordelingen en uitkomstmetingen. Feedback biedt grondstof voor verbetering. Zonder systematisch verzamelen wordt verbetering giswerk. Verzamel expliciete feedback door vragen te stellen vóór escalatie, na het einde van een gesprek of door vervolgenquêtes. Verzamel impliciete feedback via voltooiingsscores, escalatiefrequenties en patronen voor opnieuw proberen. Combineer expliciete en impliciete signalen voor een uitgebreid kwaliteitsperspectief.

Gegevensbeheer handhaaft trainingsgegevenssets van hoge kwaliteit door middel van beheer, kwaliteitsbeoordeling en vertekeningscontrole. Kwaliteit van trainingsgegevens bepaalt rechtstreeks de kwaliteit van het model. Slechte gegevens produceren onbetrouwbare modellen; uitstekende gegevens maken uitzonderlijke prestaties mogelijk.

Gesprekslogboeken beheren bij trainingsgegevenssets door:

  • Filteren op kwaliteit - inclusief gesprekken met hoge beoordeling en succesvolle resultaten
  • Problematische voorbeelden verwijderen - inclusief veiligheidsschendingen en fouten
  • Waarborgen van representativiteit - inclusief diverse scenario’s en randcases
  • Dedupliceren - vrijwel identieke voorbeelden verwijderen

Pas agenten aan aan uw domein—gespecialiseerde woordenschat, unieke bedrijfsprocessen, organisatiespecifieke Knowledge—voornamelijk door middel van retrieval-augmented generation (RAG) gebaseerd op Data 360 en prompt tuning, het oorspronkelijke Salesforce-pad.

Er is geen generatief model dat is afgestemd binnen Salesforce. U selecteert en configureert modellen via AI-modellen en Aanwijzingensamensteller. Wanneer de aarding onvoldoende is, kunt u extern afstemmen en aansluiten via BYOLLM.

Aanwijzingenverfijning verbetert herhaaldelijk aanwijzingen op basis van prestatiegegevens met behulp van Aanwijzingensamensteller. Prompt engineering is continu oefenen in plaats van eenmalig oefenen. Naarmate gebruikspatronen zich ontwikkelen, bedrijfsprocessen veranderen en gebruikersverwachtingen veranderen, vereisen aanwijzingen aanpassing om optimale prestaties te behouden.

Zorg voor regelmatige snelle beoordelingscadansen bij het onderzoeken van recente gesprekken, kwaliteitsmeetgegevens en feedback van gebruikers die verbeteringsopportuniteiten identificeren. Implementeer promptwijzigingen incrementeel met A/B-tests die verbeteringen valideren vóór volledige implementatie.

Evaluatieautomatisering voert kwaliteitsevaluaties uit op bestaande testsets, waardoor verbeterkandidaten snel kunnen worden beoordeeld. Geautomatiseerde evaluatie biedt objectieve metingen ter aanvulling van subjectieve menselijke beoordeling.

Onderhoud testsets die happy paths, edge cases, tegenstandersinvoer en historische probleemscenario’s bestrijken. Stel testautomatisering in om uw testscenario’s regelmatig uit te voeren. Neem geautomatiseerde resultaatbewaking, drempelwaarden en kennisgevingen op om beheerders te waarschuwen voor anomalieën. Deze geautomatiseerde testen zijn cruciaal voor het detecteren van negatieve effecten van externe factoren zoals modeldrift.

Breid testsets continu uit terwijl nieuwe randcases in productie verschijnen. Testautomatisering is essentieel, maar voer ook periodieke handmatige steekproeven, eenmalige tests en gorillatests uit om ervoor te zorgen dat uw agentische implementatie bestand is tegen edgecases.

Implementeer agentwijzigingen geleidelijk en bewaak de kwaliteit vóór volledige implementatie om de straal van problemen te beperken. Wanneer een wijziging meerdere gebieden bestrijkt—aanwijzingen, modelconfiguratie, acties, aarding, integraties—kan de werking verslechteren op manieren waarop testen niet is gelukt. Wanneer dat gebeurt, wijst de resulterende kwaliteitsregressie zelden naar één duidelijke hoofdoorzaak. Verzend kleine wijzigingen stuk voor stuk, zodat een regressie kan worden getraceerd naar de bron, en geef ze eerst vrij aan een beperkte hoeveelheid verkeer om de gevolgen op te vangen terwijl u de diagnose stelt.

Functievlaggen ontkoppelen implementatie van release door agenten te implementeren met voorzieningen uitgeschakeld achter de configuratie. Implementeer functievlaggen met behulp van logica of aangepaste metagegevenstypen of aangepaste instellingen. Functievlaggen maken testen in de productieomgeving mogelijk zonder voorzieningen zichtbaar te maken voor gebruikers, geleidelijke implementaties naar specifieke gebruikerssegmenten, A/B-tests bij het vergelijken van implementaties en onmiddellijke terugdraaiing door vlaggen uit te schakelen zonder herimplementatie.

Gebruik voorzieningsvlaggen voor significante agentwijzigingen, waarbij de straal van een storing ernstig kan zijn, zoals wijzigingen die van invloed zijn op bedrijfskritieke agenten, nieuwe redeneringspatronen met onzeker productiegedrag Integraties met externe systemen waarbij interactiepatronen kunnen verschillen van testen.

Canary-implementaties geven wijzigingen van agenten vrij voor kleine subsets van gebruikers die eerst foutenpercentages, kwaliteitsmeetgegevens en prestaties bewaken voordat ze breder worden geïmplementeerd. Gebruik machtigingensets om canary-implementaties te beheren—beperk toegang van agenten tot een subset van gebruikers of filter binnen doeltreffende combinatielogica op basis van gebruikerskenmerken.

Bewaak en meet successcores, responskwaliteit en feedback van gebruikers. Vergelijk kanariemeetgegevens met controlegroepen met behulp van de vorige agentversie. Breid de implementatie alleen uit wanneer canary gelijkwaardige of verbeterde prestaties laat zien.

A/B-tests vergelijken agentvariaties die kwaliteit, kosten en gebruikerstevredenheid meten. A/B-tests leveren empirisch bewijs voor verbeterbeslissingen. Implementeer varianten op willekeurig geselecteerde gebruikerssubsets om statistische validiteit te garanderen. Meet resultaten over meerdere dimensies (nauwkeurigheid, tevredenheid, kosten en latentie) en biedt een uitgebreide vergelijking.

Definieer succescriteria en hypothese voordat u begint met A/B-tests. Duidelijke criteria voorkomen onduidelijke resultaten waarbij sommige meetgegevens verbeteren, terwijl andere afnemen. Succescriteria moeten overeenkomen met bedrijfsdoelstellingen (bijvoorbeeld “Variant B moet overeenkomen met de nauwkeurigheid van variant A binnen 2% en de kosten met 15% verlagen”).

Met kampioenstests worden verbeterde agentversies geïmplementeerd in subsets van verkeer in vergelijking met de huidige kampioensversies. Kampioen-uitdagerpatroon beheert het verbeteringsrisico door bewezen versie als reserve te behouden. Als de uitdager ondermaats presteert, kunt u terugkeren naar de kampioen zonder gevolgen voor de gebruiker. Als de uitdager beter presteert, promoveer deze dan naar de nieuwe kampioen.

Stel objectieve criteria voor doorzetting vast, inclusief minimale steekproefgrootte voor statistische validiteit, kwaliteitsdrempels die uitdagers moeten overschrijden, en evaluatieduur voordat beslissingen over doorzetting worden genomen. Documenteer beslissingen over speciale acties door een controletraject te maken van waarom agentversies zijn gewijzigd.

Stel incidentdetectie in om operationele problemen van agenten snel te identificeren door middel van uitgebreide bewaking.

Foutmodi voor agenten verschillen van traditionele toepassingsfouten. Veel voorkomende foutmodi zijn:

  • Hallucinaties - het genereren van plausibele maar onjuiste informatie
  • Off-topic reacties - verkeerd begrijpen van de intent van de gebruiker
  • Buitensporig kostenverbruik - genereren van op hol geslagen tokens
  • Time-outfouten - gevolgtrekking duurt te lang
  • Machtigingsfouten - poging tot ongeoorloofde acties
  • Integratiefouten - externe systeemonbeschikbaarheid
  • Veiligheidsschendingen - ongepaste inhoud genereren

Detecteer storingen door middel van geautomatiseerde bewakingswaarschuwingen voor foutpercentages, kwaliteitsvermindering van meetgegevens, kostenanomalieën, latentieverhogingen en gebruikersescalaties. Aanvullen met zelfrapportagemechanismen voor gebruikers, inclusief feedbackverzoeken en duidelijke richtlijnen over hoe en waar feedback te geven, zodat u gerapporteerde hiaten in de automatisering kunt corrigeren.

De ernstclassificatie routeert incidenten met de juiste urgentie naar de juiste responders. Kritieke incidenten duiden op onbeschikbaarheid van de productie voor veel gebruikers, risico op gegevenscorruptie door acties van agenten, beveiligingsrisico’s of veiligheidsschendingen die onmiddellijke reactie vereisen. Hoge ernst duidt op een slechtere kwaliteit van bedrijfskritieke agenten of aanzienlijke kostenoverschrijdingen. Gemiddelde ernst duidt op geïsoleerde problemen of naderende drempelwaarden die onderzoek vereisen tijdens kantooruren. Lage ernst duidt op kleine problemen die worden bijgehouden buiten het incidentbeheerproces.

Definieer ernstcriteria objectief op basis van de impact van de gebruiker, de straal van de blast, het risico van gegevensintegriteit en de urgentie van herstel. Objectieve criteria voorkomen onder-escalerende echte problemen en over-escalerende kleine problemen. Onderhoud documentatie over bevindingen van incidentoplossing om het proces continu te verbeteren.

Initiële reactieprocedures sturen onmiddellijke acties om de situatie te stabiliseren. Procedures omvatten:

  • Falende agent uitschakelen - activering van stroomonderbreker
  • Gebruikers routeren naar reserveopties - menselijke overdracht, eenvoudigere agent, statische reacties
  • Diagnostische informatie verzamelen - recente gesprekken, foutenlogboeken, resourcemeetgegevens
  • Belanghebbenden informeren - oproepbare engineers, producteigenaars, betroffen gebruikers
  • Incidentcommunicatie starten - statuspagina-updates, interne coördinatiekanalen
  • Documenteer initiële-reactieprocedures als runbooks voor snelle uitvoering zonder incidentspecifiek onderzoek.
  • Runbooks moeten uitvoerbaar zijn voor oproepbare engineers zonder diepgaande agentexpertise.

Voorkom trapsgewijze storingen en behoud gedeeltelijke functionaliteit tijdens agentincidenten.

Het stroomonderbrekerpatroon schakelt automatisch falende agenten uit, waardoor herhaalde storingen en gevolgen voor de gebruiker worden voorkomen terwijl problemen worden opgelost. Implementeer stroomonderbrekers die foutenpercentages bewaken en openen (agent uitschakelen) wanneer foutenpercentage de drempelwaarde overschrijdt voor een aanhoudende periode.

Configureer stroomonderbrekers met foutdrempel, duur en hersteltests. Bijvoorbeeld een foutenpercentage van 50% met een doorlooptijd van vijf minuten en een periodieke proef waarin wordt gevraagd of de agent is hersteld. Wanneer het circuit wordt geopend, routeert u verzoeken naar reserveopties. Na een time-outperiode krijgt het circuit een halfopen status, waardoor proefaanvragen kunnen worden doorlopen. Wanneer proefaanvragen consistent slagen, sluit u het circuit en hervat u de normale werking.

Reservehiërarchieën zorgen voor sierlijke degradatie wanneer primaire agenten falen. Ontwerp reservereeksen waarbij steeds eenvoudigere opties worden geprobeerd totdat er een acceptabele respons is bereikt. Voorbeeld van reservehiërarchie: Primaire geavanceerde agent → Eenvoudigere back-upagent → Statische antwoorden op veelgestelde vragen → Menselijke overdracht.

Implementeer reservelogica in de doeltreffende combinatielaag in plaats van binnen agenten, waardoor consistente werking binnen het agentecosysteem mogelijk wordt. Test reservepaden regelmatig en controleer of ze werken wanneer dat nodig is.

Human handoff escaleert naar human agents wanneer AI-agenten verzoeken niet kunnen afhandelen. Ontwerp overdrachtswerkstromen met behoud van gesprekscontext, het communiceren van de reden voor overdracht, routering naar geschikte menselijke agenten met relevante expertise en het bijhouden van de overdrachtsfrequentie, die verbeteringsopportuniteiten onthullen.

Bewaak escalatiecijfers op onderwerp, agent en reden van mislukking. Hogere percentages duiden op hiaten in de mogelijkheden van agenten die snelle verbeteringen, Knowledge base-uitbreiding of verfijning van gebruikscases vereisen.

Graceful degradatie handhaaft gedeeltelijke functionaliteit tijdens verminderde werking. Wanneer geavanceerd redeneren mislukt, grijp dan terug naar eenvoudigere logica. Wanneer real-time gegevens niet beschikbaar zijn, werkt u op cachegegevens. Wanneer externe integraties mislukken, werkt u in de alleen-lezen modus. Dankzij een gracieuze afbraak kan een systeem blijven functioneren in een verminderde capaciteit in plaats van volledig te mislukken.

Voer onberispelijke beoordelingen na het incident uit, waarbij u zich richt op systeemverbeteringen in plaats van individuele fouten die psychologische veiligheid creëren voor een eerlijke beoordeling.

Tijdlijnreconstructie maakt een gedetailleerde volgorde vanaf de initiële voorwaarden tot het eerste signaal, detectie, bevestiging, onderzoek, reactieacties, herstel en validatie. Tijdstempel voor elke event, zodat een duuranalyse van elke fase mogelijk is, die aangeeft waar de incidentrespons is vertraagd.

Neem het volgende op in uw tijdlijn:

  • Wat is recent geïmplementeerd (aanwijzingen, configuraties, modellen, integraties)?
  • Welke veranderingen in gebruikspatronen (plotselinge toename van verkeer, nieuwe gesprekstypen) zijn waargenomen?
  • Welke externe factoren hebben bijgedragen (degradatie van externe services, platformupdates)?
  • Wat maakte detectie trager dan ideaal?

Identificatie van hoofdoorzaak bepaalt de directe technische oorzaak. Onderscheid maken tussen directe oorzaak (modeltime-out) en bijdragende factoren (ontwerp van aanwijzing overschrijdt tokenlimieten onder specifieke gesprekspatronen). Analyse van de hoofdoorzaak voorkomt simplistische conclusies (“de agent had een bug”) ten gunste van specifieke bevindingen die resulteren in een effectieve oplossing.

Gebruik de “Vijf Waaroms”-techniek, waarbij je doorklikt van symptomen naar fundamentele oorzaken.

Voorbeeld van oppervlak: “Agent heeft onjuiste informatie geproduceerd” → “Waarom? Opgehaalde context bevatte verouderde gegevens” → “Waarom? Knowledge base is niet bijgewerkt met recente productwijzigingen” → “Waarom? Er bestaat geen proces voor het productteam om Knowledge base-updates te activeren” → Rootoorzaak: Ontbrekende werkstroom die productreleases verbindt met Knowledge base onderhoud.

Bijdragende factoren onthullen organisatorische, proces- of architectonische omstandigheden die de impact van incidenten mogelijk maken of vergroten. Veelvoorkomende factoren zijn hiaten in de bewaking waardoor problemen langer aanhouden dan gedetecteerd, hiaten in de test waardoor foutscenario’s niet zichtbaar zijn, documentatiehiaten die snelle diagnose vertragen, automatiseringshiaten die handmatige herstelstappen afdwingen en architectonische hiaten zoals enkelvoudige foutpunten of ontbrekende redundantie.

Analyse van bijdragende factoren onthult verbeteringsopportunities die verder gaan dan de onmiddellijke oplossing van de hoofdoorzaak. De meeste incidenten hebben meerdere bijdragende factoren, waarbij elke factor de impact vergroot.

Detectieanalyse onderzoekt hoe het incident werd gedetecteerd en of de detectie sneller had kunnen zijn. Veel agentincidenten worden eerst gemeld door gebruikers in plaats van geautomatiseerde bewaking, wat duidt op een hiaat in de bewaking. Bepalen: Welk signaal had het probleem eerder moeten signaleren? Welke monitoring zou snellere detectie mogelijk maken? Welke waarschuwingscriteria zouden op de juiste manier hebben gevuurd?

Verbeteringen in de detectieanalyse omvatten: Het toevoegen van ontbrekende bewakingsdekking, het afstemmen van waarschuwingsdrempelwaarden voor het elimineren van vals-negatieven, het verrijken van waarschuwingscontext voor snellere triage en het verbeteren van dashboards voor proactieve probleemidentificatie.

Responsevaluatie beoordeelt wat goed ging en wat langzamer of moeilijker was dan noodzakelijk. Vragen over responsevaluatie: Waren runbooks nuttig en nauwkeurig? Waren escalatietrajecten duidelijk en effectief? Zijn terugdraaiprocedures getest en gereed? Leverden tools noodzakelijke diagnostische informatie? Was de communicatie tijdig en effectief?

Verbeteringen in de evaluatie van reacties omvatten: runbooks bijwerken met geleerde lessen, escalatiecriteria verduidelijken, procedures regelmatig terugdraaien testen, diagnostische tools toevoegen en communicatiesjablonen voor incidenten verbeteren.

Actie-items specificeren concrete, toegewezen, tijdgebonden verbeteringen die herhaling voorkomen of toekomstige reactie verbeteren. Vermijd vage actie-items, zoals “de bewaking verbeteren”, ten gunste van specifieke taken, zoals “waarschuwing toevoegen voor foutenpercentage van agenten van meer dan 5% over een periode van 10 minuten, toegewezen: Alex, vervallen: 2 weken.”.

Houd voltooiing van actie-items bij in daaropvolgende beoordelingen, zodat continue verbetering daadwerkelijk plaatsvindt. Controleer open actie-items van vorige incidenten tijdens elke beoordeling na het incident. Lage voltooiingsscores duiden op een procesfout van continue verbetering die aandacht vereist.

Knowledge sharing documenten post-incident beoordelingen in gedeelde wiki, Knowledge base of samenwerkingsruimte met tagging inschakelen patroonanalyse voor meerdere incidenten. Retrospectieven van incidenten moeten doorzoekbaar zijn op foutmodus, betroffen componenten en tijdsbestek, zodat toekomstige responders kunnen leren van historische incidenten.

Deel beoordelingen na het incident op een manier die verder gaat dan directe incidentresponsers. Organisatieleren vereist informatieverspreiding. Overweeg om belangrijke incident learnings te presenteren in teamvergaderingen of lunch-and-learn-sessies waarbij Knowledge wordt verspreid en collectieve capaciteit wordt opgebouwd.

Vereist goedkeuring voordat u productieagenten implementeert om te zorgen voor beoordeling, risicobeoordeling en afstemming van belanghebbenden.

Pre-implementatiecontrolelijst valideert gereedheid, waaronder:

  • Uitgebreide tests voltooid - functionaliteit, kwaliteit, veiligheid, prestaties
  • Beveiligingsbeoordeling goedgekeurd - machtigingsgrenzen, gegevenstoegang, actieautorisatie
  • Naleving gevalideerd - wettelijke vereisten, naleving van beleid
  • Documentatie voltooid - runbooks, terugdraaiprocedures, escalatietrajecten
  • Bewaking geconfigureerd - kwaliteitsmeetgegevens, foutenpercentages, kosten bijhouden
  • Goedkeuring van belanghebbenden verkregen - producteigenaar, beveiliging, naleving

Controlelijst biedt consistente evaluatiecriteria voor alle agenten. Pas de controlelijst voor het risicoprofiel van agenten aan op basis van kritiekheid van agenten, gegevensgevoeligheid en autonomieniveau.

Risicobeoordeling evalueert de potentiële impact van agentfouten, waaronder:

  • Straal - hoeveel gebruikers getroffen door mislukking
  • Gegevensgevoeligheid - tot welke gegevensagent toegang heeft
  • Actieautoriteit - welke wijzigingen agenten kunnen aanbrengen
  • Integratieafhankelijkheden - welke systeemagent beïnvloedt
  • Complexiteit van herstel - hoe moeilijk is terugdraaien
  • Nalevingsgevolgen - welke regelgeving van toepassing is

Risicobeoordeling bepaalt goedkeuringsvereisten. Agenten met een hoog risico vereisen goedkeuring van leidinggevenden, beveiligingsbeoordeling en geleidelijke implementatie, terwijl agenten met een laag risico mogelijk peer review en standaardtests vereisen.

Goedkeuringswerkstromen routeren implementatieverzoeken via de juiste beoordelaars. Implementeer goedkeuringswerkstromen met behulp van Salesforce-goedkeuringsprocessen of externe implementatietools. Automatiseer, volg en controleer goedkeuringswerkstromen om nalevingsrapportage en incidentonderzoek in te schakelen.

Documenteer goedkeuringsbeslissingen, maak een controletraject van wie implementaties heeft goedgekeurd, welke informatie goedkeuringen heeft geïnformeerd, welke voorwaarden of beperkingen zijn toegepast en welke bewakingstoezeggingen zijn gedaan.

Noodomleidingsprocedures maken snelle implementatie mogelijk tijdens productie-incidenten wanneer normale goedkeuringsprocessen kritieke oplossingen zouden vertragen. Noodprocedures moeten worden goedgekeurd door de uitvoerende macht, moeten een motiveringsdocumentatie bevatten en een versnelde beoordeling na de implementatie activeren om wijzigingen in noodgevallen te valideren.

Houd implementaties van noodgevallen apart bij van standaardreleases. Hoge implementatiefrequentie bij noodgevallen duidt op procesproblemen die onderzoek vereisen.

Definieer kwaliteitspoorten die de agenten moeten doorlopen voordat ze worden geïmplementeerd, zodat problematische agenten gebruikers niet bereiken.

Functioneel testen valideert dat agenten beoogde taken correct uitvoeren in representatieve scenario’s. Test prettige trajecten die typische interacties bestrijken, randcases die zeldzame maar geldige scenario’s bestrijken, fouttrajecten die testen of agenten ongeldige invoer netjes afhandelen, en randvoorwaarden die controleren of de agent binnen beheerlimieten, tokenlimieten en gegevensvolumelimieten valt.

Functioneel testen voor agenten verschilt van traditioneel testen omdat niet-deterministische uitvoer exacte overeenkomsten verhindert. Testuitvoerkenmerken (bevat verplichte informatie, handhaaft de juiste toon, omvat noodzakelijke citaties) in plaats van exacte tekst.

Responskwaliteitstests evalueren de nauwkeurigheid en relevantie van respons in testscenario’s. Kwaliteitstests vereisen menselijke evaluatie of gegevenssets met verwachte uitvoer. Stel minimumkwaliteitsdrempels vast waaraan agenten moeten voldoen (bijvoorbeeld “95% nauwkeurigheid op uitgestelde testset, nul veiligheidsschendingen, eerlijkheidscontrole toont geen demografische verschillen van meer dan 5%”). Onderhoud en breid testsets continu uit naarmate nieuwe edgecases worden ontdekt.

Veiligheidstests valideren dat agenten gevaarlijke, onethische of buiten bereik liggende verzoeken weigeren. Bij veiligheidstests wordt geprobeerd tegengestelde invoer te gebruiken, waaronder:

  • Prompte injectiepogingen - instructies proberen te overschrijven
  • Jailbreakpogingen - veiligheidsbeperkingen proberen te omzeilen
  • Verzoekescalatie - vragen om steeds gevoeligere acties
  • Verzoeken buiten bereik - ongeautoriseerde taken proberen

Wijs veiligheidstests toe aan onafhankelijke teamleden die niet betrokken waren bij het samenstellen van de agent. Voor agenten met hoog risico schakelt u rode teamspecialisten in.

Prestatietests valideren latentie, doorvoer en kosten die voldoen aan verwachtingen. Test onder realistische belasting, inclusief gelijktijdige gesprekken, normale gespreksduur en verwacht gebruiksvolume. Prestatietests tonen problemen met beheerlimieten, resourcebeperkingen en bottlenecks in de schaalbaarheid die onzichtbaar zijn bij testen voor één gebruiker.

Meet het verbruik van de testomgeving tijdens prestatietests en gebruik dit om productiecapaciteitsbehoeften te voorspellen.

Beveiligingstests valideren machtigingsgrenzen, besturingselementen voor gegevenstoegang en actieautorisatie. Beveiligingstests bevestigen: agenten hebben geen toegang tot ongeautoriseerde gegevens, agenten kunnen geen ongeautoriseerde acties uitvoeren, prompte injectie kan de machtigingen niet escaleren en auditlogboeken leggen alle agentactiviteiten vast.

Integreer scannen van statische codebeveiliging in de implementatiepijplijn met behulp van Salesforce Code Analyzer, dat Apex, Stromen, Lightning en Visualforce scant op beveiligingskwetsbaarheden en kan worden uitgevoerd in continue integratie/implementatie (CI/CD) via de opdrachtregelinterface (CLI) of GitHub-actie. Gebruik gespecialiseerde AI-/agentbeveiligingstests om kwetsbaarheden bij prompt-injectie en risico’s bij blootstelling aan gevoelige gegevens te detecteren, aangezien dit run-time LLM-invoerdreigingen zijn die buiten het bereik van statische codeanalyse vallen.

Pas discipline voor wijzigingsbeheer toe op agentimplementaties om ervoor te zorgen dat wijzigingen worden gedocumenteerd, beoordeeld en gecommuniceerd.

In de wijzigingsdocumentatie worden vastgelegd:

  • Wat is er gewijzigd - prompte wijzigingen, configuratie-updates, modelwijzigingen
  • Waarom die wijziging is aangebracht - kwaliteitsverbetering, kostenoptimalisering, bugfix
  • Welke tests die wijziging hebben gevalideerd - testresultaten, kwaliteitsscores, beveiligingsscans
  • Welke terugdraaiprocedure bestaat

Wijzigingsdocumentatie maakt incidentonderzoek, nalevingsrapportage en Knowledge transfer mogelijk. Gedocumenteerde wijzigingen creëren een lerende organisatie die voortbouwt op eerdere ervaringen in plaats van lessen opnieuw te ontdekken.

Communicatieplanning informeert belanghebbenden over wijzigingen van agenten, waaronder betroffen gebruikers, operationele teams, ondersteuningsteams en zakelijke belanghebbenden. Communicatie moet beschrijven wat er verandert, wanneer verandering wordt geïmplementeerd, welke voordelen gebruikers zullen zien, welke risico’s er zijn en met wie ze contact kunnen opnemen bij problemen.

Stel communicatiesjablonen op voor verschillende wijzigingstypen, waarbij berichten worden gestandaardiseerd en de overhead voor implementatievoorbereiding wordt verminderd.

Tijdstippen voor implementatieplanning Agent-implementaties tijdens perioden met weinig gebruik op basis van Event Monitoring-gegevens die feitelijke gebruikspatronen tonen. Vermijd implementaties tijdens piekgebruik, sluiting van maandeinde, sluiting van kwartaaleinde of grote zakelijke events. Communiceer implementatieperioden inclusief verwachte duur en tijdlijn voor terugdraaien van beslissingen.

Overweeg grote wijzigingen te plannen voor implementaties van begin tot midden in de week en vermijd implementaties van eind weken, zodat problemen kunnen worden opgelost met voldoende resources. Geef prioriteit aan snel terugdraaien en sterke bewaking na de implementatie boven elke vaste agendaregel.

Verander vensters en bevriezingen beschermen kritieke bedrijfsperioden. Bepaal bevriezingsperioden voor belangrijke bedrijfsevents (fiscaal jaareinde, productintroducties en grote marketingcampagnes) om door implementatie veroorzaakte problemen te voorkomen tijdens perioden met grote belangen.

Documentwijzigingen bevriezen de agenda jaarlijks en communiceren beperkte perioden ruim van tevoren, zodat teams dienovereenkomstig kunnen plannen. Overmatige bevriezingen vertragen de snelheid; onvoldoende bevriezingen leiden tot bedrijfsrisico’s.

Maak feedbacklussen die operationele telemetrie verbinden met de verbetering van agenten.

Gebruikersfeedbackverzameling verzamelt expliciete feedback via vragen of vervolgenquêtes. Verzamel impliciete feedback via voltooiingsscores, escalatie naar menselijke agenten, patronen voor opnieuw proberen en vervolgvragen die duiden op ontevredenheid. Combineer expliciete en impliciete signalen en krijg een uitgebreid kwaliteitsperspectief.

Verzamel feedback inline, direct wanneer het gebeurt en niet later. Vertraagde feedbackverzameling verlaagt de responsscores en introduceert vertekening bij terugroepen.

Gebruiksanalyses leggen echte gesprekspatronen bloot, zoals onderwerpen, vragen en trends die terugkeren. Ze testen of de complexiteit van een agent zijn waarde verdient, of mogelijkheden ongebruikt blijven vanwege slechte vindbaarheid en of reëel gebruik de oorspronkelijke ontwerpaannames valideert.

Querygesprekslogboeken analyseren vraagtypen, gespreksduur, successcores op onderwerp en gebruikerstevredenheid op gesprekskenmerken. Analyse van gebruikspatronen begeleidt verfijning van de aanwijzing, uitbreiding van Knowledge base en prioritering van mogelijkheden.

Een foutenpatroonanalyse identificeert systematische kwaliteitsproblemen die moeten worden gecorrigeerd. Analyseer foutlogboekengroepering op type fout, betroffen gebruikers, gesprekspatronen en tijdelijke distributie. Foutpatronen onthullen prompte problemen, Knowledge base-hiaten, integratieproblemen of randcases die behandeling vereisen.

Prioriteer foutherstel op frequentie en impact. Hoogfrequente fouten die veel gebruikers treffen, verdienen onmiddellijke aandacht. Fouten met een lage frequentie kunnen acceptabele randcases vertegenwoordigen, afhankelijk van de bedrijfsimpact en de herstelkosten.

Kwaliteitstrendbewaking houdt nauwkeurigheid, relevantie, veiligheid en tevredenheid bij in de loop van de tijd en detecteert degradatie voordat deze ernstig wordt. Kwaliteitsbaselines vaststellen na de initiële implementatie van agenten. Bewaak continue kwaliteit ten opzichte van baselines door te waarschuwen wanneer trends afnemen boven acceptabele drempelwaarden.

Kwaliteitsbewaking laat zien of snelle wijzigingen, modelupdates of Knowledge base-aanpassingen de prestaties verbeteren of verslechteren, waardoor gegevensgestuurde verbeteringsbeslissingen mogelijk worden.

Houd experimenten systematisch bij op basis van empirisch bewijs en onderbouw verbeterbeslissingen.

Het experimentraamwerk biedt een consistente structuur voor het testen van verbeteringen, waaronder:

  • Hypothese - welke verbetering wordt verwacht
  • Experimenteel ontwerp - hoe varianten worden geïmplementeerd
  • Meetgegevens - welke uitkomsten worden gemeten
  • Voorbeeldgrootte - hoeveel interacties nodig zijn voor statistische validiteit
  • Succescriteria - welke resultaten rechtvaardigen promotie

Documenteer experimenten vóór uitvoering om onduidelijke interpretatie van resultaten te voorkomen. Vooraf gedefinieerde succescriteria maken duidelijke beslissingen over doorzetten mogelijk, waardoor lange discussies over de vraag of de resultaten “goed genoeg” zijn, worden vermeden.

Variant houdt bij welke gebruikers welke varianten hebben ontvangen, waardoor uitkomstcorrelatie mogelijk is. Houd de toewijzing van varianten bij in gespreksmetagegevens, zodat u de kwaliteit, kosten en tevredenheid per variant kunt analyseren.

Statistische validiteit zorgt ervoor dat experimenten lang genoeg duren met voldoende steekproefgrootte voor betrouwbare conclusies. Bereken de vereiste steekproefgrootte vóór experimenten op basis van verwachte effectgrootte, statistische vermogensvereisten en acceptabele foutpercentages. Onvoldoende steekproeven leiden tot luidruchtige resultaten die leiden tot slechte beslissingen.

Multi-armige bandietenoptimalisering wijst dynamisch meer verkeer toe aan beter presterende varianten tijdens experimenten. Meerarmige bandietenmethoden verlagen de opportunitykosten van experimenten door blootstelling aan inferieure varianten te verminderen en toch voldoende gegevens te verzamelen voor statistische analyse.

In de experimentcatalogus worden de varianten, uitkomsten en beslissingen van elk experiment vastgelegd. Het voorkomt dat teams mislukte benaderingen opnieuw testen, verspreidt lessen over de hele organisatie en bouwt een gedeeld record op van wat daadwerkelijk werkt.

Operationele uitmuntendheid voor agentische systemen vereist uitbreiding van traditionele DevOps-praktijken om unieke AI-kenmerken aan te pakken. Uitgebreide observatie maakt inzicht in het gedrag van opkomende agenten mogelijk. Systematisch levenscyclusbeheer garandeert kwaliteit, veiligheid en kostenbeheersing. Incidentresponsprocedures hebben betrekking op agentspecifieke foutmodi. Continue verbetering transformeert operationele ervaring in organisatorische mogelijkheden.

Belangrijke praktijken voor operationele uitmuntendheid in agentische systemen:

  • Leg volledige gesprekken vast, inclusief invoer, uitvoer, redeneringstraces, acties en uitkomsten.
  • Bewaak continu de kwaliteit van reacties door middel van meetgegevens over nauwkeurigheid, relevantie, veiligheid en tevredenheid.
  • Detecteer modelafwijkingen en gedragsveranderingen door middel van baselinevergelijking en anomaliedetectie.
  • Aanwijzingen voor versiebeheer, configuraties en modellen die terugdraaien en A/B-tests inschakelen.
  • Implementeer geleidelijke implementatie met voorzieningenvlaggen en kanarie-implementaties die de straal beperken.
  • Ontwerp stroomonderbrekers en reservehiërarchieën om trapsgewijze agentfouten te voorkomen.
  • Voer onberispelijke beoordelingen na het incident uit, waarbij u zich richt op systematische verbeteringen.
  • Stel kwaliteitspoorten en goedkeuringsprocessen in om te voorkomen dat problematische agenten productie bereiken.
  • Stel feedbacklussen samen die operationele telemetrie verbinden met agentverbetering.
  • Houd experimenten systematisch bij met behulp van empirisch bewijs om beslissingen over verbeteringen te sturen.

Organisaties die investeren in operational excellence voor agenten, behalen duurzaam concurrentievoordeel door betrouwbare, hoogwaardige AI-mogelijkheden die continu meegroeien met de bedrijfsbehoeften.

Deel uw feedback over het Goed Architectuurde Framework.