Оперативное мастерство для предприятия-агента

Оперативное совершенство для предприятия-агента

Оперативное совершенство для агентских систем расширяет традиционные практики DevOps для решения уникальных характеристик агентов на основе искусственного интеллекта: недетерминистское поведение, контекстно-зависимые рассуждения и память, сложность цели и переменные затраты на вывод. Обычные приложения следуют предсказуемым путям кода, но агенты создают новые ответы на основе контекста. Традиционный мониторинг отслеживает известные показатели, тогда как наблюдаемость агента требует понимания мотивации языковой модели и схем решений. Стандартное тестирование проверяет детерминистские результаты, но проверка агента оценивает качество ответа во многих измерениях, включая точность, актуальность, безопасность и справедливость.

Продукты и системы меняются с течением времени, поэтому примените следующие пять принципов проектирования для внедрения операционного совершенства в их выполнение: развиваются с возможностью наблюдения, стандартизируют операционные процедуры, внедряют культуру DevOps, автоматизируют для повышения эффективности и извлекают уроки из всех операционных событий. Базовый принцип операционного совершенства, «Развитие с наблюдаемостью», становится критическим для агентских систем, поскольку поведение агента возникает в результате сложных взаимодействий между напоминаниями, извлеченным контекстом, поведением модели и журналом разговора, а не в результате детерминистского выполнения кода. Архитекторы не могут предсказать каждый ответ агента во время проектирования, поскольку ответы формируются моделью, напоминанием и оперативным контекстом, поэтому проектируйте для наблюдения и ограждений. Комплексное наблюдение позволяет определить, как агенты ведут себя в реальных условиях. Эта доступность включает улучшения под управлением данных и быструю диагностику проблем, когда агенты выдают неожиданные результаты.

"Операции как код" приобретают новые измерения для агентов. Традиционная инфраструктура как код распространяется на оперативную версию, управление конфигурацией модели и автоматизацию развертывания агента. Операционные процедуры агента рассматривают изменения версий модели, оперативную эволюцию и обновления базы Knowledge, а также обычные операции развертывания и отката.

«Обучение на всех операционных событиях» становится еще более ценным с помощью агентских систем. Инциденты с агентами часто обнаруживают тонкие оперативные инженерные проблемы, ошибки сценариев и оркестрации, пробелы в базе Knowledge или непредвиденные схемы взаимодействия пользователей. Вскрытие в сочетании с систематическим анализом телеметрии агента трансформирует операционный опыт в организационные возможности, которые со временем добавляются.

Полная регистрация разговора является основой наблюдения агента. Собирайте каждый разговор, включительно с вводными данными пользователя, ответами агента, этапами рассуждения, вызванными действиями, извлеченными данными и итоговыми результатами. Эта телеметрия служит нескольким целям: отладка конкретных инцидентов, анализ качества во многих взаимодействиях, аудит соответствия, улучшение модели и анализ схемы использования.

Используйте нативную модель отслеживания сеансов над настраиваемой регистрацией. Отслеживание сеансов Agentforce собирает данные взаимодействия агентов в объединенной модели данных в Data 360, а не требует создания параллельной системы телеметрии. Модель данных отслеживания сеансов (STDM) записывает разговор как иерархию трассировки. Каждый сеанс содержит взаимодействия (обращения), каждое взаимодействие содержит этапы (UserInputStep, LLMExecutionStep, FunctionStep), а этапы содержат сообщения (коммуникации пользователя и агента). STDM использует стандартные объекты Data 360, например, AIAgentSession, AIAgentSessionParticipant, AIAgentInteraction, AIAgentInteractionStep и AIAgentInteractionMessage. Взаимодействия несут идентификаторы распределенного отслеживания (TelemetryTraceId и TelemetryTraceSpanId), а этапы несут идентификатор охвата (TelemetryTraceSpanId), отображающий модель охвата в стиле OpenTelemetry.

Моделирование разговоров агентов в качестве трассировки и охвата является стандартным подходом отрасли к наблюдению за агентами, и повторное использование нативной модели позволяет избежать проблем масштаба, с которыми сталкиваются объекты, созданные вручную: сохранение многооборотных разговоров, больших полезных данных JSON и быстрого роста данных. Создание настраиваемых транзакционных объектов для записи разговоров является преднамеренным исключением, например, легкий настраиваемый объект, который коррелирует поведение агента с бизнес-результатами, а не с основной подложкой регистрации.

Метаданные сеанса и разговора собирают критический контекст, включительно с идентификаторами сеанса и взаимодействия, удостоверением пользователя, удостоверением агента, временем начала и окончания. STDMтакже связывает каждый этап взаимодействия с записями вызовов модели большого языка (LLM) (посредством ссылок GenerationId и GenAiGatewayRequest/Response). Использование маркера, модель и подробные сведения о запросе доступны в этих присоединениях, а не сохраняются в качестве полей сеанса. Метаданные включают фильтрацию и агрегацию разговоров для анализа схемы.

Сведения о взаимодействии и уровне этапа собирают каждый ход, включительно с вводными данными пользователя, ответом агента, пояснением причин (при наличии), рейтингами надежности, извлеченным контекстом, предпринятыми действиями и возникшими ошибками. Отслеживание на уровне этапа позволяет детализировать расследование инцидентов, воссоздавая точные события на каждом этапе цепочки рассуждений.

Этапы действия записывают каждое действие, выполненное агентом, включая вызовы API, изменения данных, взаимодействия внешней системы и вызванные интеграции. Записи действий отвечают на вопросы: "Что изменил этот агент?" и "какие системы открывал этот агент?". Эти ответы поддерживают исследования безопасности и требования к соблюдению. STDM собирает действия нативно в качестве этапов взаимодействия.

Следы рассуждений в механизме рассуждений Atlas отображают процессы решений агентов, помогая определить, почему агенты выбрали определенные действия или создали определенные ответы. Отслеживание сеансов записывает этапы организатора как часть каждого взаимодействия. Глубина открытых рассуждений зависит от модели и организатора, но при наличии эти трассировки значительно улучшают отладку.

Контрольный журнал на основе генеративного искусственного интеллекта Einstein Trust Layer собирает каждое взаимодействие на основе генеративного искусственного интеллекта, текст напоминания и ответа, включительно с версиями, маскируемыми под персональную информацию (PII), извлеченные данные заземления, оценки безопасности и токсичности ответа и сведения о модели LLM — все это транслируется в Data 360 и сохраняется в ней. Включите генеративный искусственный интеллект Einstein и сбор и хранение данных обратной связи, чтобы данные аудита и обратной связи собирались в Data 360 — где вы можете запросить и проанализировать их с помощью отчетности Data 360 для долгосрочного хранения.

Пример:

Хорошо: Журналы разговоров, сохраненные в настраиваемых объектах Salesforce с полями ввода пользователя, ответа агента, предпринятых действий, расхода маркера и результата разговора. Панель мониторинга отображает уровень успеха разговора по агенту и сценарию использования. Лучше: Комплексное ведение журнала содержит трассировки рассуждений, отображающие процесс принятия решения агентом, извлеченный контекст, отображающий, какая информация привязана к ответам, и рейтинги надежности, указывающие на неопределенность. Лучшее: Аналитика диалогов коррелирует поведение агента с бизнес-результатами, определяет возможности улучшения посредством анализа схемы и подает непрерывные ожидаемые продажи обучения с примерами с метками качества.

Отслеживайте операционную производительность, обеспечивая соответствие агентов уровням обслуживания и работу в ожидаемых параметрах.

Задержка ответа отслеживает время от ввода пользователя до ответа агента. Задержка напрямую влияет на взаимодействие пользователя. Измерьте задержку в процентилях (р50, р95, р99), отображая типичную производительность и худший прогноз. Предупреждение о превышении пороговых значений задержки p95, обозначающих ухудшение производительности.

Факторы задержки для агентов включают время вывода модели, продолжительность извлечения данных и контекста, выполнение внешних инструментов и действий и сетевую задержку. Инструментируйте каждый этап отдельно, включив целевую оптимизацию, когда общая задержка превышает цели.

Маркеры мер потребления маркеров, используемые в разговоре, агенте и сценарии использования. Потребление маркера влияет на затраты на вывод и время ответа (больше маркеров требует больше вычислений вывода). Отслеживайте распределение маркеров, отображая, соответствует ли фактическое использование проекциям. Обнаруживайте выпадающие разговоры, использующие чрезмерные маркеры, предлагающие оперативные проблемы или неправильное использование.

Показатели маркеров включают маркеры напоминания (ввод в модель), маркеры завершения (вывод модели) и общие маркеры (сумма напоминания и завершения). Маркеры напоминания более управляемы, чем маркеры завершения. Оптимизируйте напоминания и извлеченный контекст, снижая потребление маркера напоминания при сохранении качества.

Мониторинг производительности отслеживает параллельные разговоры, запросы в секунду и тенденции объема разговоров, а также может помочь в определении нагрузки проекта и требований к масштабированию. Сравните текущую производительность с известными ограничениями скорости или базовыми значениями нагрузки, предупреждающими о приближении к порогам.

Отслеживание уровня ошибок отслеживает сбои по типу, включительно с ошибками модели, сбоями времени ожидания, ошибками отказа в полномочиях и ошибками внешней интеграции. Шаблоны ошибок обнаруживают систематические проблемы, требующие исправления. Вычислите уровень ошибок как процент от общего количества запросов, поддерживающих сравнение между агентами и периодами времени.

Различайте категории ошибок, требующие разных ответов. Ошибки модели могут потребовать быстрых поправок или переключения на лучшую модель. Ошибки полномочий требуют изменений конфигурации безопасности. Ошибки интеграции требуют исследования внешней системы или активации выключателя.

Отслеживание доступности определяет время работы агента и периоды успешной работы. Рассчитайте доступность как процент успешного ответа агентов на запросы. Отслеживайте доступность по сравнению с целями уровня обслуживания (SLO), включая упреждающее реагирование, когда доступность падает ниже целевых показателей.

Proactive Monitoring оценивает вашу организацию на наличие аномалий платформы и проблем использования ресурсов, которые могут повлиять на состояние инфраструктуры агента. Он открывает сигналы, прежде чем они перерастут в проблемы, отображаемые пользователю. Используйте его, чтобы опережать условия на уровне инфраструктуры (например, необычная деятельность API или тенденция потребления ресурсов к ограничениям платформы), которые могут ухудшить производительность агентов. Просмотрите его сигналы по сравнению с обычным рабочим базисом агентов, чтобы отличить аномалии, имеющие исковую силу, от ожидаемого изменения.

Отслеживайте качество ответов постоянно, обнаруживая ухудшение до влияния на бизнес-результаты. Если платформа предлагает встроенные инструменты оценки, используйте их вместо настраиваемых или ручных процессов. Начните с собственных инструментов тестирования и оценки. Центр тестирования Agentforce позволяет обслуживать многоразовые наборы тестовых заданий и запускать агентов по ним в пакете, проверяя, выбрал ли агент ожидаемую тему и действие и дал ли приемлемый ответ, а не создал и запустил собственный тестовый жгут. Она также поддерживает специалистов по оценке, включая готовые измерения качества и метод оценки качества разговора на основе LLM-as-judge, и позволяет автору настраиваемых специалистов по оценке для критериев организации. Используйте представительные диалоги в наборах тестов, чтобы оценка отображала реальное использование.

Точность ответа определяет, содержат ли ответы агента правильные сведения. Точная оценка требует известных утверждений ответа или проверки человеком. Для вопросов по факту с известными ответами автоматическая оценка сравнивает ответы агента с правильными ответами; сохраните их как тестовые задания в центре тестирования для повторяемой оценки. В открытых вопросах специалисты по оценке оценивают точность выбранных разговоров. Отслеживайте тенденции точности в динамике, определяя, улучшают или ухудшают производительность оперативные изменения, обновления модели или модификации базы Knowledge.

Релевантность ответа определяет, отвечают ли ответы агента на вопросы пользователя надлежащим образом, даже если они не совсем точны. Соответствующие ответы понимают намерение пользователя и предоставляют полезную информацию, даже если полный ответ невозможен. Оценивайте релевантность посредством собственных специалистов по оценке, при наличии, проверки человеком выбранных разговоров и пользовательских сигналов. Для агентов, основанных на базе Knowledge, нативный анализ качества извлечения может оценить актуальность контекста, релевантность ответа и верность (groundedness) ответов.

Ограждения определяют небезопасные, недопустимые или вредные реакции, включая предвзятость, оскорбительное содержимое, опасные советы и внеплановые реакции. Слой Einstein Trust применяет обнаружение токсичности к взаимодействиям LLM в среде выполнения, это ваша первая линия защиты. Улучшите мониторинг безопасности посредством фильтрации содержимого, ручной выборки проверки, механизмов отчетности пользователей и проверки справедливости, оценивая распределение результатов между демографическими группами.

Показатели удовлетворенности пользователей собирают субъективное качество взаимодействия. Отзывы Agentforce поступают в генеративные модели данных «Аудит на основе искусственного интеллекта» и «Отзывы» Einstein (GenAIFeedback/GenAIFeedbackDetail в Data 360). Эти модели собирают явные пользовательские сигналы — «большой палец вверх»/«низ», «принять/отклонить», «редактировать» и «дословные комментарии» — из человеческого или системного источника, а также запрос шлюза и данные создания.Сбор явных отзывов (вопросы до расширения, после окончания разговора и посредством последующих опросов) там, где это необходимо, и сочетание явных и скрытых сигналов для комплексной перспективы качества.

Salesforce предоставляет разные поверхности модели. Генерационный уровень предоставляет выполнение агентов диалогового рассуждения: Модели, размещенные в Agentforce, предоставляют готовые рассуждения в границах Salesforce Trust, а также предоставляют собственные ссылки LLM (BYOLLM) внешним LLM или поставщикам. Прогнозируемый уровень предоставляет структурированные оценки, на которых агенты основывают свои решения: BYOM извлекает прогнозируемые рейтинги нулевой копии из внешних платформ, а собственные модели Einstein производят автоматическую оценку и классификацию по объектам CRM. Вместе эти поверхности позволяют автономному агенту рассуждать на естественном языке, создавая бизнес-правило на основе структурированных статистических данных.

Отслеживайте отклонение модели, которое указывает на снижение производительности с течением времени или изменение условий, требующих адаптации. Просмотрите примечания к выпуску и протестируйте критические сценарии использования в безопасной среде перед запуском каждого основного выпуска в производство. Используйте матрицу выпуска и окно предварительного просмотра безопасной среды для раннего обнаружения проблем совместимости.

Понижение производительности происходит, когда точность, актуальность или безопасность агента ухудшаются с течением времени. Отслеживайте показатели качества в динамике, обнаруживая статистически значимые снижения. Дрифт производительности может быть результатом деградации модели, устаревшей базы Knowledge, быстрого несоответствия меняющимся схемам использования или дрейфа концепции, когда взаимосвязи между вводными данными и нужными выводами развиваются.

Установите базовую производительность сразу после первичного развертывания агента, оценивая точность, актуальность, безопасность и удовлетворенность в представительных тестовых сценариях. Периодически выполняйте повторную оценку по одинаковым тестовым сценариям, отображающим изменения производительности, не зависящие от смен схемы использования.

Предупреждение о превышении допустимых порогов показателями качества. Определите пороги на основе терпимости к влиянию бизнеса. Некоторые сценарии использования терпят незначительное ухудшение качества; другие требуют немедленного реагирования на любое снижение.

Отклонение распространения происходит, когда схемы ввода пользователя существенно меняются по сравнению с обучением или настройкой распределения данных. Ошибка распространения ухудшает производительность, когда агенты сталкиваются с типами ввода, для которых они не созданы. Отслеживайте вводные характеристики, включая длину вопроса, распределение тем, сложность языка и терминологию домена, обнаруживая значительные сдвиги.

Сравнение текущих вводных распределений с архивными базисами. Большие смены распространения могут обозначать новые сценарии использования, изменение поведения пользователя или развитие бизнес-процессов. Смены распространения могут требовать быстрых обновлений, расширения базы Knowledge или расширения возможностей агента.

Отклонение поведения происходит, когда схемы ответа агента меняются неожиданно. Отслеживайте характеристики ответа, включая среднюю длину ответа, частоту вызовов действий, частоту расширения и схемы ошибок. Значительные изменения в поведении могут свидетельствовать о актуальных проблемах, проблемах модели или основных системных изменениях.

Установите поведенческие базисы на раннем этапе производства, собирая обычные рабочие характеристики, например, регулярные схемы производительности, использование инструментов и пути решений. Эти базовые показатели становятся эталоном, по которому позже оценивается обнаружение аномалий. Сравните текущее поведение с базовыми показателями, предупреждая, когда отклонения превышают ожидаемые.

Автоматическое оповещение включает упреждающую реакцию на отклонение. Настройте предупреждения, запускающие при превышении пороговых значений дрейфа, запускающих расследование и потенциальное исправление, включительно с оперативным уточнением, обновлениями базы Knowledge, расширением набора тестов или переобучением модели BYOM.

Автоматическое обнаружение необычного поведения агента, требующего исследования.

Аномалии стоимости, включительно со скачками потребления маркеров, повышением уровня вывода или общим ускорением стоимости. Скачки стоимости могут указывать на оперативные проблемы, вызывающие чрезмерное создание маркера, злоупотребления или неправильное использование, приводящие к неожиданному использованию, или проблемы инфраструктуры, вызывающие избыточные вызовы.

Отслеживайте распределения потребления маркеров, обнаруживая выпадающие разговоры. Исследуйте разговоры, занимающие в 10 раз больше обычного количества маркеров, чтобы понять, представляют ли они законные краевые случаи или проблемы, требующие исправления.

Скачки уровня ошибок, включительно с резким увеличением уровня отказов, появлением новых типов ошибок, которые не существовали в базовом состоянии, или локализованными концентрациями ошибок, влияющими на определенных пользователей, агентов или сценариев использования. Всплески ошибок часто предшествуют проблемам ухудшения качества, которые могут наблюдаться клиентами. Упреждающее обнаружение включает исправление до широкого влияния.

Изменения схемы ответа, включительно с резкими смещениями в длине ответа, частотой вызова действия или изменениями частоты расширения. Изменения схемы могут указывать на оперативные проблемы, изменения поведения модели или изменение схемы использования.

Отказ от разговора увеличивается, когда пользователи отказываются от разговоров чаще, что говорит о снижении качества, увеличении задержки или функциональности. Отслеживайте отказ по этапу разговора, определяя, отказываются ли пользователи во время первичного взаимодействия, в середине разговора или после попытки выполнения задачи. Шаблоны отказа отображают определенные возможности улучшения.

Создайте архитектуру оповещений, балансирующую между быстрым уведомлением и усталостью оповещений. Немедленно перенаправляйте критические сбои агента инженерам по вызову. Перенаправляйте предупреждения об ухудшении качества группам, работающим с продуктами, для изучения в рабочие часы. Объедините незначительные аномалии в ежедневные рассылки для анализа трендинга.

Подсказки управления версиями, конфигурации и метаданные модели, включающие откат, тестирование A/B и контрольный журнал.

Шаблоны напоминаний — это многоразовые напоминания, созданные в Конструкторе подсказок, которые определяют цель, ограничения и рекомендации по фирменному стилю агента, а также структурные нули для динамических данных заземления, например, сведений о клиенте или продукте. Храните шаблоны напоминаний в Git вместе с кодом приложения, рассматривая напоминания как критическую логику приложения, которая заслуживает такой же строгости, как и код. Оперативные изменения проходят проверку кода, тестирование и контролируемое развертывание.

Используйте Конструктор подсказок для повторяющейся оперативной разработки с журналом версий и возможностями тестирования. При использовании шаблонов напоминаний в качестве действий агента предварительно просмотрите шаблон в Конструкторе подсказок для подтверждения правильности решения полей слияния. Потом используйте центр тестирования для выполнения комплексных тестов, которые подтверждают, что агент выбирает действие и создает правильные результаты.

Экспортируйте готовые к производству напоминания в управление версиями, создавая синхронизацию между разработкой Конструктора подсказок и ожидаемыми продажами развертывания под управлением источника.

Управление конфигурациями отслеживает выбор модели, параметры температуры, конфигурации извлечения и флажки функций. Храните конфигурации в виде кода, чтобы использовать значения среды, автоматизировать развертывания и обнаружить отклонение конфигурации.

Семантическая версия применяется к выпускам агентов. Основные версии обозначают разрывные изменения, например, измененные контракты ввода/вывода или значительно измененное поведение. Незначительные версии обозначают добавления или улучшения функций, поддерживающие совместимость. Версии исправления указывают на исправления ошибок. Нумерация версий сообщает о влиянии изменений операционным группам и пользователям.

Внедрите семантические версии для компонентов агента, включительно с шаблонами напоминаний, конфигурациями агентов и базами Knowledge. Номера версий в журналах включают корреляцию инцидентов с определенными развертываниями.

Документация об изменении собирает обоснование быстрых изменений, изменений конфигураций и обновлений модели. Задокументируйте изменения, причину их изменения, тестирование, подтвердившее изменение и существующие процедуры отката. Документация об изменении ускоряет расследование инцидентов и передачу Knowledge.

Ведите универсальный реестр версий модели, напоминаний, конфигураций и журнала развертывания.

Реестр модели записывает, какие версии модели развернуты, включительно с семейством моделей, определенной версией, состоянием точной настройки, средой развертывания (производственная, поэтапная и разработка), датой развертывания и ответственной рабочей группой. Реестр предоставляет единый источник истины для состояния инфраструктуры агента.

Отслеживание развертывания регистрирует каждое развертывание агента, включая версию развертывания, среду, отметку времени развертывания, пользователя развертывания, полученные утверждения и результат развертывания. Используйте журнал развертывания для оценки влияния при возникновении проблем (например, «какие агенты были развернуты до начала инцидента?») и для поддержки отчетов о соответствии.

Отслеживание зависимостей соотносит взаимосвязи между агентами, напоминаниями, базами Knowledge, действиями и интеграциями. При обновлении общедоступной базы Knowledge отслеживание зависимости определяет, какие агенты затронуты. При изменении внешней интеграции отслеживание зависимости определяет задействованных агентов.

Документируйте зависимости явно, а не обнаруживайте их во время инцидентов. Создайте карты зависимости, поддерживаемые в процессах разработки и развертывания.

Нерекомендуемые политики определяют жизненные циклы для версий модели, включительно с продолжительностью поддержки, временной шкалой нерекомендуемости и требованиями миграции. Четкие политики аннулирования управляют технической задолженностью, предотвращая неограниченную поддержку версий старых моделей. Установите расписание умаления, сообщающее о сроках достаточно заблаговременно, что позволит обеспечить запланированную миграцию, а не экстренное реагирование на вынужденные умаления. Хорошо коммуникабельный и поддерживаемый политикой минимальный период уведомления предоставляет достаточное время миграции для критических изменений.

Процедуры отката позволяют группам быстро восстанавливаться после проблемных развертываний. Процедуры отката документов для каждого агента и включают следующее:

  • Условия, запускающие откат
  • К какой версии вернуться
  • Как выполнить откат
  • Авторизация и выполнение отката
  • Какое тестирование подтверждает успешность отката и какие рабочие группы уведомлять.

Регулярно тестируйте процедуры отката в непроизводственных средах, чтобы убедиться в их работоспособности перед зависимостью от них во время производственных инцидентов. Отрепетируйте с помощью имитаций развертывания, чтобы рабочая группа точно знала, что делать. Непроверенные процедуры отката часто завершаются неудачей, когда это необходимо чаще всего.

Поддерживайте качество агентов посредством постоянного обучения, точной настройки и уточнения бизнес-правил.

Сбор отзывов систематически собирает отзывы пользователей, исправления отзывов, оценки качества и измерения результатов. Отзывы предоставляют сырье для улучшения. Без систематического сбора улучшение становится догадкой. Собирайте явные отзывы посредством вопросов, задавая вопросы до расширения, после окончания разговора или посредством дополнительных опросов. Собирайте скрытые отзывы посредством показателей выполнения, частоты расширения и схем повторных попыток. Сочетайте явные и скрытые сигналы, предоставляющие комплексную перспективу качества.

Курирование данных поддерживает высококачественные наборы данных обучения посредством курирования, проверки качества и проверки предвзятости. Качество данных обучения напрямую определяет качество модели. Плохие данные создают ненадежные модели; отличные данные обеспечивают исключительную производительность.

Курирование входов разговора в наборы данных обучения посредством:

  • Фильтрация на качество - включая высокорейтинговые разговоры и успешные результаты
  • Удаление проблемных примеров - в том числе нарушений правил безопасности и ошибок
  • Обеспечение репрезентативности - включая различные сценарии и краевые случаи
  • Дублирование - удаление почти идентичных примеров

Адаптация агентов к домену (специализированная лексика, уникальные бизнес-процессы, организация Knowledge) посредством создания с дополненным извлечением (RAG), основанного на Data 360, и оперативной настройки, пути Salesforce.

Генеративная модель не настроена в Salesforce; вы выбираете и настраиваете модели посредством моделей на основе искусственного интеллекта и Конструктора подсказок. Если заземления недостаточно, настройте внешне, потом подключите через BYOLLM.

Уточнение запросов итеративно улучшает напоминания на основе данных о производительности посредством Конструктора подсказок. Подсказка проектирования - это непрерывная практика, а не одноразовое упражнение. По мере развития схем использования, изменения бизнес-процессов и сдвига ожиданий пользователей, напоминания требуют корректировки, поддерживающей оптимальную производительность.

Установите регулярную каденцию оперативной проверки, изучая недавние разговоры, показатели качества и отзывы пользователей, определяющие возможности улучшения. Внедряйте оперативные изменения инкрементно посредством тестирования A/B, проверяющего улучшения перед полным развертыванием.

Автоматизация оценки выполняет оценку качества на проходящих тестах, что позволяет быстро оценивать кандидатов на улучшение. Автоматическая оценка предоставляет объективное измерение, дополняющее субъективную оценку человека.

Обслуживайте наборы тестов, охватывающие счастливые пути, краевые обращения, состязательные вводные данные и сценарии архивных проблем. Установите автоматизацию тестирования для выполнения сценариев тестирования в регулярной каденции. Добавьте автоматический мониторинг результатов, пороги и уведомления для предупреждения администраторов об аномалиях. Это автоматическое тестирование имеет решающее значение для обнаружения неблагоприятных последствий внешних факторов, таких как отклонение модели.

Постоянно расширяйте тестовые наборы по мере появления новых краевых обращений в производстве. Автоматизация тестирования является ключом, но также выполняйте периодические ручные выборочные проверки, разовые тесты и тестирование горилл, чтобы убедиться, что ваше агентское развертывание соответствует краевым обращениям.

Разверните изменения агента постепенно и отслеживайте качество перед полным развертыванием, чтобы ограничить радиус взрыва проблем. Когда изменение охватывает несколько областей (напоминания, конфигурацию модели, действия, заземление, интеграции), оно может ухудшить поведение так, как тестирование не выявило. Когда это происходит, итоговая регрессия качества редко указывает на одну очевидную первопричину. Отправляйте небольшие изменения по одному, чтобы регрессию можно было отследить к источнику, и сперва отпустите их на ограниченный отрезок трафика, чтобы сдержать влияние во время диагностики.

Флажки функции отключают развертывание от выпуска посредством развертывания агентов с отключенными функциями за конфигурацией. Внедрите флажки функций посредством логики, типов настраиваемых метаданных или настраиваемых параметров. Флажки функций включают тестирование в производственной среде, не открывая функции пользователям, постепенное развертывание в определенных сегментах пользователей, тестирование A/B сравнения внедрений и мгновенный откат, отключая флажки без развертывания.

Используйте флажки функций для значительных изменений агентов, где радиус взрыва сбоя может быть серьезным, например, Изменения, влияющие на важных для бизнеса агентов, Новые схемы рассуждений с неопределенным производственным поведением Интеграции с внешними системами, где схемы взаимодействия могут отличаться от тестирования.

Развертывания Canary выпускают изменения агента в маленьком поднаборе пользователей, сперва отслеживая уровень ошибок, показатели качества и производительность перед более широким развертыванием. Используйте наборы полномочий для управления развертываниями канарейки — ограничьте доступ агента к поднабору пользователей или отфильтруйте в логике оркестрации на основе атрибутов пользователя.

Отслеживайте и измеряйте уровень успеха, качество ответов и отзывы пользователей. Сравните канареечные показатели с контрольными группами, используя предыдущую версию агента. Разверните развертывание, только если канарейка демонстрирует эквивалентную или улучшенную производительность.

А/Б тестирование сравнивает варианты агента, оценивающие качество, стоимость и качество обслуживания пользователей. Тестирование A/B предоставляет эмпирические данные для принятия решений по улучшению. Разверните варианты в случайно выбранных поднаборах пользователей, обеспечивая статистическую достоверность. Измеряйте результаты в нескольких измерениях (точность, удовлетворенность, стоимость и задержка), предоставляя комплексное сравнение.

Определите критерии успеха и гипотезу перед началом тестов A/B. Четкие критерии предотвращают неоднозначные результаты, когда одни показатели улучшаются, а другие ухудшаются. Критерии успеха должны соответствовать бизнес-целям (например, «Вариант Б должен соответствовать точности варианта А в пределах 2% при снижении стоимости на 15%»).

Тестирование претендента-чемпиона развертывает улучшенные версии агента в поднаборах трафика по сравнению с текущими версиями. Схема «Чемпион-претендент» управляет риском улучшения, сохраняя проверенную версию в качестве резервной. Если соперник не справляется со своими обязанностями, восстановите чемпионство без влияния пользователя. Если претендент превосходит его, повысьте его до нового чемпиона.

Установите объективные критерии рекламной акции, включительно с минимальным размером выборки для статистической достоверности, порогами качества, которые должны быть превышены конкурентами, и продолжительностью оценки до принятия решений о рекламной акции. Документируйте решения рекламной акции, создавая контрольный журнал причин изменения версий агента.

Быстро устанавливайте обнаружение инцидентов, определяя операционные проблемы агента посредством комплексного мониторинга.

Режимы сбоев агента отличаются от традиционных сбоев приложения. Распространенные режимы сбоев включают:

  • Галлюцинации - создание правдоподобной, но некорректной информации
  • Ответы вне темы - неправильное понимание намерения пользователя
  • Чрезмерное потребление затрат - создание маркера отказа
  • Сбои времени ожидания - вывод слишком затянулся
  • Ошибки полномочий - попытка несанкционированных действий
  • Сбои интеграции - недоступность внешней системы
  • Нарушения безопасности - создание недопустимых содержимого

Обнаруживайте сбои посредством автоматического оповещения мониторинга уровня ошибок, ухудшения показателей качества, аномалий стоимости, увеличения задержки и расширения пользователей. Дополните механизмы самоотчетности пользователей, включительно с запросами отзывов и четкими рекомендациями по способу и месту предоставления отзывов, чтобы исправить обнаруженные пробелы в автоматизации.

Классификация серьезности инцидентов перенаправляет соответствующим исполнителям экстренной помощи. Критические инциденты указывают на производственную недоступность, влияющую на многих пользователей, риск повреждения данных от действий агента, нарушение безопасности или нарушения безопасности, требующие немедленного реагирования. Высокая серьезность указывает на ухудшение качества, влияющее на важных для бизнеса агентов или значительный перерасход средств. Средняя степень серьезности обозначает отдельные проблемы или приближающиеся пороговые значения, требующие исследования в рабочее время. Низкая серьезность указывает на незначительные проблемы, отслеживаемые вне процесса управления инцидентами.

Определите критерии серьезности на основе влияния пользователя, радиуса взрыва, риска целостности данных и срочности восстановления. Объективные критерии предотвращают недооценку реальных проблем и переоценку мелких проблем. Ведите документацию по результатам устранения инцидентов для постоянного улучшения процесса.

Первоначальные процедуры реагирования определяют немедленные действия по стабилизации ситуации. Процедуры включают:

  • Выключение неисправного агента - активация автоматического выключателя
  • Перенаправление пользователей в резервные варианты - человеческая передача, более простой агент, статические ответы
  • Сбор диагностической информации - недавние разговоры, журналы ошибок, показатели ресурсов
  • Уведомление заинтересованных лиц - инженеров по вызову, владельцев продуктов, пострадавших пользователей
  • Инициирование коммуникации об инцидентах - обновления страницы статуса, внутренние каналы координации
  • Задокументируйте процедуры первичного ответа в качестве инструкций, обеспечивающих быстрое выполнение без необходимости изучения инцидента.
  • Руководства должны выполняться инженерами по вызову без глубокого знания агента.

Предотвращение каскадных сбоев и сохранение частичных функций во время инцидентов агента.

Схема автоматического выключателя автоматически отключает неисправных агентов, предотвращающих повторные сбои и влияние пользователя во время решения проблем. Внедрите автоматические выключатели, отслеживающие уровень ошибок и размыкающие (отключающие агенты), когда уровень ошибок превышает порог для устойчивого периода.

Настройте автоматические выключатели с порогом ошибки, окном продолжительности и тестированием восстановления. Например, 50% ошибок с пятиминутным скользящим окном и периодическая пробная версия, запрашивающая тестирование восстановления агента. После открытия цепи перенаправьте запросы в резервные варианты. По истечении периода ожидания схема переходит в полуоткрытое состояние, позволяющее проходить пробные запросы. При последовательном выполнении пробных запросов замыкайте цепочку, возобновляя нормальную работу.

Иерархии резервных источников приводят к необратимому ухудшению состояния при сбое основных агентов. Создайте резервные последовательности, пытающиеся упростить параметры до достижения приемлемого ответа. Пример резервной иерархии: Основной сложный агент → Простой резервный агент → Статические ответы на вопросы → Человеческая передача.

Внедрите резервную логику в слой оркестрации, а не в агенты, включающие последовательное поведение в экосистеме агента. Регулярно тестируйте резервные пути, проверяя их работу при необходимости.

Когда агенты на основе искусственного интеллекта не могут обрабатывать запросы, человеческая передача распространяется на агентов-людей. Разработайте бизнес-процессы передачи, сохраняя контекст разговора, сообщая причину передачи, маршрутизируя соответствующим агентам-людям с соответствующими знаниями и отслеживая частоту передачи, открывая возможности улучшения.

Отслеживайте уровни расширения по теме, агенту и причине сбоя. Более высокий уровень обозначает пробелы в возможностях агента, требующие быстрых улучшений, расширения базы Knowledge или уточнения сценария использования.

Благодатное разложение сохраняет частичную функциональность при ухудшении работы. Если сложные рассуждения не удались, вернитесь к более простой логике. Если данные в реальном времени недоступны, оперируйте кэшированными данными. Если внешние интеграции не выполняются, работайте в режиме только для чтения. Изящная деградация позволяет системе продолжать работать с пониженной нагрузкой, а не выходить из строя полностью.

Выполните безупречные проверки пост-инцидентов, сосредоточившись на усовершенствованиях системы, а не на индивидуальной ошибке, создающей психологическую безопасность для честной оценки.

Восстановление временной шкалы создает подробную последовательность от начальных условий до первого сигнала, обнаружения, подтверждения, расследования, действий ответа, восстановления и проверки. Отметка времени каждого события, включающая анализ продолжительности каждого этапа, отображающий, где реакция на инцидент была задержана.

Добавьте в временную шкалу следующее:

  • Что было развернуто недавно (напоминания, конфигурации, модели, интеграции)?
  • Какие изменения наблюдались в схемах использования (внезапное увеличение трафика, новые типы разговоров)?
  • Какие внешние факторы повлияли (ухудшение качества обслуживания сторонних компаний, обновления платформы)?
  • Что сделало обнаружение медленнее идеального?

Идентификация причины определяет прямую техническую причину. Отличайте немедленную причину (время ожидания модели) от влияющих факторов (превышение ограничений по количеству маркеров при определенных схемах разговора). Анализ коренных причин предотвращает упрощенные выводы («У агента была ошибка») в пользу конкретных выводов, которые приводят к эффективному исправлению.

Используйте метод «Пять причин», детализируя симптомы до фундаментальных причин.

Пример поверхности: «Агент предоставил неверную информацию» → «Почему? Извлеченный контекст содержал устаревшие данные" → "Почему? База Knowledge не была обновлена последними изменениями продукта" → "Почему? Для группы, работающей с продуктами, не существует процесса запуска обновлений базы Knowledge» → Корневая причина: Отсутствует бизнес-правило, связывающее выпуски продуктов с обслуживанием базы Knowledge.

Влияние факторов определяет организационные, технологические или архитектурные условия, способствующие или усиливающие влияние инцидента. Распространенные факторы включают пробелы в мониторинге, которые позволяют проблемам сохраняться дольше, чем обнаруженные, пробелы в тестировании, которые оставляют сценарии сбоев открытыми, пробелы в документации, которые замедляют быструю диагностику, пробелы в автоматизации, которые вынуждают этапы восстановления вручную, и архитектурные пробелы, например, отдельные точки сбоя или отсутствующие резервы.

Анализ влияющего фактора обнаруживает возможности улучшения, выходящие за пределы непосредственного устранения первопричины. Большинство инцидентов имеют много факторов, влияющих на ситуацию, каждый из которых усиливает воздействие.

Анализ обнаружения позволяет определить, каким образом был обнаружен инцидент и можно ли было обнаружить его быстрее. Многие инциденты агентов первыми сообщаются пользователями, а не автоматическим мониторингом, что указывает на пробел в мониторинге. Определите: Какой сигнал должен был обнаружить проблему раньше? Какой мониторинг позволит ускорить обнаружение? Какие критерии предупреждения должны были сработать надлежащим образом?

Улучшения анализа обнаружения включают: Добавление отсутствующего покрытия мониторинга, настройка порогов предупреждений для устранения ложных отрицательных значений, пополнение контекста предупреждений для более быстрой сортировки и улучшение панелей мониторинга для проактивного определения проблем.

Оценка ответов позволяет определить, что прошло хорошо, а что медленнее или труднее, чем необходимо. Вопросы оценки ответа: Были ли рунбуки полезными и точными? Были ли пути эскалации четкими и эффективными? Были ли протестированы и готовы процедуры отката? Предоставляют ли инструменты необходимую диагностическую информацию? Была ли связь своевременной и эффективной?

Улучшения оценки ответов включают: обновление беговых книг с извлеченными уроками, уточнение критериев расширения, регулярное тестирование процедур отката, добавление диагностического инструментария и улучшение шаблонов связи инцидентов.

Элементы действий определяют конкретные, назначенные и ограниченные по времени улучшения, предотвращающие повторение или улучшение будущих ответных мер. Избегайте расплывчатых элементов действий, например, «улучшить мониторинг», в пользу определенных задач, например, «добавить предупреждение об уровне ошибок агента, превышающем 5% за 10-минутное окно, назначенное: Алекс, срок: 2 недели.

Отслеживайте выполнение элемента действия в последующих проверках, обеспечивая фактическое постоянное улучшение. Просматривайте открытые элементы действий из предыдущих инцидентов во время каждой проверки после инцидента. Низкий уровень выполнения указывает на постоянную ошибку процесса улучшения, требующую внимания.

Общий доступ Knowledge документирует проверки пост-инцидентов в общедоступной вики-версии, базе Knowledge или пространстве сотрудничества с присвоением тегов, поддерживающих анализ схемы в нескольких инцидентах. Ретроспективы инцидентов должны быть доступны для поиска по режиму сбоя, задействованным компонентам и периоду времени, позволяющему будущим ответчикам учиться на архивных инцидентах.

Предоставьте общий доступ к обзорам пост-инцидентов в широком диапазоне за пределами непосредственных реагирователей инцидентов. Организационное обучение требует распространения информации. Рекомендуем представить основные уроки по инцидентам на совещаниях рабочей группы или обеденных занятиях по распространению Knowledge и созданию коллективного потенциала.

Требуйте утверждения перед развертыванием производственных агентов, обеспечивающих проверку, оценку рисков и выравнивание заинтересованных лиц.

Контрольный список перед развертыванием проверяет готовность, включая:

  • Завершено комплексное тестирование - функциональность, качество, безопасность, производительность
  • Проверка безопасности утверждена - границы полномочий, доступ к данным, авторизация действий
  • Проверка соответствия - нормативные требования, соблюдение политики
  • Документация завершена - беговые книги, процедуры отката, пути расширения
  • Мониторинг настроен - показатели качества, уровни ошибок, отслеживание стоимости
  • Утверждение заинтересованных лиц получено - ответственный за продукт, безопасность, соответствие

Контрольный список предоставляет последовательные критерии оценки для всех агентов. Адаптируйте контрольный список для профиля риска агента различной глубины, в зависимости от важности агента, конфиденциальности данных и уровня автономии.

Оценка риска оценивает потенциальное воздействие сбоев агента, включая:

  • Радиус взрыва - сколько пользователей пострадали от сбоя
  • Конфиденциальность данных - к чему имеет доступ агент данных
  • Полномочие действия - какие изменения может внести агент
  • Зависимости интеграции - на кого влияет системный агент
  • Сложность восстановления - насколько сложный откат
  • Последствия соблюдения - какие правила применяются

Оценка риска определяет требования к утверждению. Агенты высокого риска требуют утверждения руководителя, проверки безопасности и постепенного развертывания, в то время как агенты низкого риска могут требовать коллегиальной проверки и стандартного тестирования.

Бизнес-правила утверждения перенаправляют запросы на развертывание через соответствующих проверяющих. Внедрите бизнес-правила утверждения посредством процессов утверждения Salesforce или внешних инструментов развертывания. Автоматизируйте, отслеживайте и проверяйте бизнес-процессы утверждения, чтобы включить отчетность о соответствии и расследование инцидентов.

Документируйте решения об утверждении, создавая контрольный журнал того, кто утверждал развертывания, какая информация использовалась при утверждении, какие условия или ограничения применялись и какие обязательства мониторинга были приняты.

Процедуры экстренного обхода позволяют быстро развертывать во время производственных инцидентов, когда обычные процессы утверждения могут задержать критические исправления. Чрезвычайные процедуры должны требовать утверждения руководителями, содержать документацию с обоснованием и инициировать ускоренную проверку изменений в чрезвычайных ситуациях после развертывания.

Отслеживайте экстренные развертывания отдельно от стандартных выпусков. Высокая частота развертывания указывает на проблемы процесса, требующие исследования.

Определите качественные ворота, которые должны пройти агенты перед развертыванием в производственной среде, предотвращая доступ проблемных агентов к пользователям.

Функциональное тестирование проверяет корректность выполнения агентами намеченных задач в репрезентативных сценариях. Протестируйте счастливые пути, охватывающие типичные взаимодействия, краевые случаи, охватывающие нечастые, но действительные сценарии, пути ошибок, проверяющие изящность обработки агентами недопустимых вводных данных и граничные условия, проверяющие, находится ли агент в пределах контролирующих ограничений, ограничений маркеров и ограничений объема данных.

Функциональное тестирование для агентов отличается от традиционного тестирования, поскольку недетерминистские результаты предотвращают точное совпадение. Протестируйте характеристики вывода (содержит обязательные сведения, поддерживает соответствующий тон, содержит необходимые цитаты), а не точный текст.

Тестирование качества ответа оценивает точность и актуальность ответа в сценариях тестирования. Тестирование качества требует человеческой оценки или наземных наборов данных с ожидаемыми результатами. Установите минимальные пороги качества, которым должны соответствовать агенты (например, "95% точности по набору удержанных тестов, ноль нарушений безопасности, проверка справедливости не показывает демографического неравенства, превышающего 5%"). Постоянно обслуживайте и расширяйте тестовые наборы по мере обнаружения новых краевых обращений.

Тестирование безопасности проверяет агентов на отклонение опасных, неэтичных или выходящих за рамки запросов. Тестирование безопасности пытается использовать состязательные вводные данные, включая:

  • Своевременные попытки инъекции - попытки переопределения инструкций
  • Попытки побега из тюрьмы - попытка обойти ограничения безопасности
  • Запрос на расширение - запрос на все более конфиденциальные действия
  • Выходящие за рамки запросы - попытки несанкционированных задач

Назначьте тестирование безопасности независимым участникам рабочей группы, которые не участвовали в создании агента. Для агентов высокого риска пригласите специалистов красной рабочей группы.

Тестирование производительности проверяет задержку, производительность и стоимость на соответствие ожиданиям. Тестирование при реалистичной нагрузке, включительно с параллельными разговорами, типичной продолжительностью разговора и предполагаемым объемом использования. Тестирование производительности отображает проблемы с ограничением регулятора, ограничения ресурсов и препятствия масштабируемости, невидимые в однопользовательском тестировании.

Измерьте потребление тестовой среды во время тестирования производительности и используйте его для проекции потребностей производственной мощности.

Тестирование безопасности проверяет границы полномочий, элементы управления доступом к данным и авторизацию действий. Тестирование безопасности подтверждает: агенты не имеют доступа к несанкционированным данным, агенты не могут выполнять несанкционированные действия, быстрый ввод не может расширить привилегии, а журнал проверки собирает все действия агента.

Интегрируйте сканирование безопасности статического кода в ожидаемые продажи развертывания посредством Salesforce Code Analyzer, который сканирует Apex, потоки, Lightning и Visualforce на наличие уязвимостей безопасности и может выполняться в непрерывной интеграции/развертывании (CI/CD) посредством интерфейса командной строки (CLI) или действия GitHub. Используйте специализированное тестирование безопасности на основе искусственного интеллекта/агента для обнаружения уязвимостей быстрого внедрения и рисков доступа к конфиденциальным данным, поскольку это угрозы ввода LLM среды выполнения, выходящие за пределы статического анализа кода.

Примените дисциплину управления изменениями к развертываниям агентов, обеспечивая документирование, проверку и передачу изменений.

Документация об изменении собирает:

  • Что изменилось - оперативные изменения, обновления конфигурации, изменения модели
  • Почему было сделано это изменение - повышение качества, оптимизация расходов, исправление ошибок
  • Какое тестирование подтвердило это изменение - результаты тестирования, оценки качества, сканирование безопасности
  • Какая процедура отката существует

Документация об изменении включает расследование инцидентов, составление отчетов о соответствии и передачу Knowledge. Документированные изменения создают организацию обучения, основанную на предыдущем опыте, а не на повторном поиске уроков.

Планирование коммуникации уведомляет заинтересованных лиц об изменениях агентов, включая задействованных пользователей, операционные группы, группы поддержки и бизнес-заинтересованных лиц. Сообщение должно содержать описание: что меняется, когда развертываются изменения, какие преимущества увидят пользователи, какие риски существуют и к кому обращаться по проблемам.

Установите шаблоны связи для разных типов изменений, стандартизирующих сообщения и сокращающих подготовку развертывания над головой.

Время планирования развертывания развертывания агентов в периоды низкого использования, информированные данными мониторинга событий, отображающими фактические схемы использования. Избегайте развертываний во время пикового использования, закрытия месяца, закрытия квартала или важных бизнес-событий. Сообщите окна развертывания, включительно с ожидаемой продолжительностью и временной шкалой решения об откате.

Рекомендуем запланировать серьезные изменения на начало-середину недели и избегать развертывания в конце недели, чтобы проблемы можно было решить с помощью адекватных ресурсов. Отдайте приоритет быстрому откату и сильному мониторингу после развертывания над любым фиксированным правилом календаря.

Изменение окон и заморозки защищают критические периоды бизнеса. Установите периоды замораживания изменений перед важными бизнес-событиями (конец финансового года, запуск продуктов и основные маркетинговые кампании), предотвращая проблемы, вызванные развертыванием, во время периодов с высокими ставками.

Календарь заморозки изменений документа ежегодно сообщает об ограниченных периодах достаточно заблаговременно, что позволяет группам планировать соответствующие действия. Чрезмерные заморозки замедляют скорость; недостаточные заморозки создают бизнес-риск.

Установите циклы обратной связи, соединяющие операционную телеметрию с улучшением агента.

Сбор отзывов пользователей собирает четкие отзывы посредством вопросов или дополнительных опросов. Собирайте скрытые отзывы посредством коэффициентов выполнения, расширения до агентов-людей, схем повторных попыток и дополнительных вопросов, обозначающих неудовлетворенность. Сочетайте явные и скрытые сигналы, предоставляя комплексную перспективу качества.

Собирайте отзывы встроенно, когда это происходит, а не позже. Задержка сбора отзывов уменьшает уровень ответов и вводит предвзятость отзыва.

Аналитика использования отображает реальные схемы разговоров, например, темы, вопросы и повторяющиеся тенденции. Они проверяют, зарабатывает ли сложность агента его сохранность, остаются ли возможности неиспользованными из-за плохой обнаруживаемости и проверяет ли реальное использование исходные предположения дизайна.

Запрос журналов разговоров, анализирующих типы вопросов, продолжительность разговоров, уровень успеха по теме и качество обслуживания пользователей по характеристикам разговоров. Анализ схемы использования направляет оперативную настройку, расширение базы Knowledge и расстановку приоритетов возможностей.

Анализ схемы ошибок определяет систематические проблемы качества, требующие исправления. Проанализируйте группировку журналов ошибок по типу ошибки, соответствующим пользователям, схемам разговоров и временному распределению. Схемы ошибок отображают оперативные проблемы, пробелы в базе Knowledge, проблемы интеграции или краевые обращения, требующие обработки.

Приоритизация исправления ошибок по частоте и влиянию. Частотные ошибки многих пользователей требуют немедленного внимания. Низкочастотные ошибки могут представлять приемлемые краевые случаи, в зависимости от влияния на бизнес и стоимости восстановления.

Мониторинг тенденций качества отслеживает точность, актуальность, безопасность и удовлетворенность в динамике обнаружения ухудшения до того, как оно станет серьезным. Установите качественные базисы после первичного развертывания агента. Отслеживайте текущее качество по сравнению с базовыми значениями, предупреждая о снижении тенденций сверх допустимых порогов.

Мониторинг качества определяет, улучшают или ухудшают производительность оперативные изменения, обновления модели или изменения базы Knowledge, включающие решения по улучшению на основе данных.

Отслеживайте эксперименты, систематически сообщая решения по улучшению с помощью эмпирических данных.

Рамочная программа экспериментов обеспечивает последовательную структуру для тестирования усовершенствований, включая:

  • Гипотеза - какое улучшение ожидается
  • Экспериментальное проектирование - способ развертывания вариантов
  • Показатели - какие результаты оцениваются
  • Размер выборки - сколько взаимодействий необходимо для статистической достоверности
  • Критерии успеха - какие результаты оправдывают продвижение

Эксперименты с документами перед выполнением, предотвращающие неоднозначное толкование результатов. Предопределенные критерии успеха позволяют принимать четкие решения о рекламной акции, избегая длительных споров о том, являются ли результаты "достаточно хорошими".

Журналы отслеживания вариантов, которые получили пользователи и варианты которых включают корреляцию результатов. Отслеживайте назначение вариантов в метаданных разговора, позволяющее анализировать качество, стоимость и удовлетворенность по варианту.

Статистическая достоверность обеспечивает достаточно длительное проведение экспериментов с достаточным объемом выборки для надежных выводов. Вычислите требуемый размер выборки перед экспериментами на основе ожидаемого размера эффекта, требований к статистической мощности и допустимого уровня ошибок. Недостаточное количество образцов приводит к шумным результатам, приводящим к неверным решениям.

Оптимизация многоруких бандитов динамически распределяет больше трафика между более производительными вариантами во время экспериментов. Многорукие бандитские подходы позволяют сократить издержки экспериментов, связанные с возможностями, уменьшая подверженность неполноценным вариантам при одновременном сборе достаточных данных для статистического анализа.

Каталог экспериментов регистрирует варианты, результаты и решения каждого эксперимента. Это останавливает рабочие группы от повторного тестирования неудачных подходов, распространяет обучение в организации и создает общую запись того, что действительно работает.

Оперативное совершенство для агентских систем требует расширения традиционных практик DevOps для учета уникальных характеристик искусственного интеллекта. Комплексная возможность наблюдения позволяет понять поведение новых агентов. Систематическое управление жизненным циклом обеспечивает качество, безопасность и контроль затрат. Процедуры реагирования на инциденты рассматривают режимы сбоев агента. Постоянное совершенствование трансформирует оперативный опыт в организационный потенциал.

Ключевые практические методы повышения эффективности работы в агентских системах:

  • Зарегистрируйте завершенные разговоры, включительно с вводными данными, выводами, трассировками рассуждений, действиями и результатами.
  • Отслеживайте качество ответа постоянно посредством показателей точности, релевантности, безопасности и качества обслуживания.
  • Определите отклонение модели и изменения в поведении посредством сравнения базиса и обнаружения аномалий.
  • Подсказки управления версиями, конфигурации и модели, включающие откат и тестирование A/B.
  • Внедрите постепенное развертывание с флажками функций и развертываниями канарейки, ограничивающими радиус взрыва.
  • Создайте автоматические выключатели и резервные иерархии, предотвращающие каскадные сбои агентов.
  • Выполните безупречные проверки пост-аварий, сосредоточившись на систематических улучшениях.
  • Создайте качественные ворота и процессы утверждения, предотвращающие попадание проблемных агентов в производство.
  • Создайте циклы обратной связи, соединяющие операционную телеметрию с улучшением агента.
  • Систематически отслеживайте эксперименты, используя эмпирические данные для принятия решений по улучшению.

Организации, инвестирующие в операционное совершенство для агентов, получают устойчивые конкурентные преимущества благодаря надежным и качественным возможностям искусственного интеллекта, которые постоянно развиваются в соответствии с бизнес-потребностями.

Опубликуйте отзыв о инфраструктуре с хорошей архитектурой.