Система AutoSynthData от ServiceNow превращает сбои в обучающие материалы

Система AutoSynthData от ServiceNow превращает сбои в обучающие материалы

Краткий ответ: AutoSynthData от ServiceNow CoreAI преобразует ошибки агентов и успехи обучающих агентов в проверенные синтетические задачи SFT, когда предприятиям необходима компетентность среды, а не просто общие эталонные оценки. Он устраняет пробелы, преобразуя их в карточки спецификаций возможностей, увеличивает объем проверяемой работы, а затем проверяет качество перед тонкой настройкой. По сообщению автора, EnterpriseOps Gym сохраняет свои позиции, если качество обучающих агентов, качество верификаторов и точность среды соответствуют друг другу.

Основные выводы:

Карты возможностей: Запись информации о сбоях на карты, чтобы генераторы никогда не видели исходные идентификаторы.

Проверка корректности работы верификатора: Предпочтительнее использовать проверки конечного состояния SQL, которые отклоняют измененные некорректные результаты.

Уровень сложности: Обучайте только тем задачам, которые целевой ученик решает редко, и которые обычно успешно решаются учителем.

Экспертная оценка: Необходимо проводить экспертную оценку важных политических решений и необратимых действий перед переобучением.

Движущаяся граница: После SFT проведите переоценку и перенесите целевую фазу в сторону оставшихся пробелов.

Корпоративные ИИ-агенты редко дают сбой из-за недостатка общих знаний. Сбой происходит из-за специфичности среды: политики обработки заявок, особенности схем, контракты инструментов, предустановленные базы данных, статьи базы знаний и межсистемные рабочие процессы, которые не похожи на примеры из учебников. Модель, которая хорошо показывает себя в открытых бенчмарках, все еще может зависнуть, когда следующий шаг должен учитывать окно изменений, связь с CMDB или проверку конечного состояния, а не чата.

ServiceNow CoreAI / ServiceNow-AI опубликовали AutoSynthData , чтобы напрямую устранить этот пробел. Автор, Эсаккивел Эсаккираджа, описывает конвейер, который преобразует ошибки целевого агента — вместе с успехами более сильного обучающего агента — в проверенные задачи синтетического обучения, адаптированные для корпоративных сред. Цель состоит не в том, чтобы собрать больше логов чата. Цель — многократно увеличить объем проверяемой работы, демонстрирующей те же возможности в новых условиях, чтобы контролируемая тонкая настройка могла устранить специфические для среды недостатки.

В этой статье подробно рассматривается основная идея, абстракция задач, цикл генерации и контроля качества, общая архитектура, а также результаты, представленные автором на примере EnterpriseOps Gym в гибридных и ITSM-средах. Статья придерживается того, что описывается в исследовании: постоянно обновляемая программа синтетических задач, а не утверждение о том, что для любого предприятия внезапно решаются все проблемы.

Почему экологическая компетентность важнее широких компетенций

Предприятиям нужны агенты, работающие в их среде — в их системах, правилах и состоянии данных. Широкие возможности — это не то же самое, что компетентность в работе с окружающей средой. Агент может знать, как обычно работает управление ИТ-услугами, и при этом не знать локальной политики, запрещающей определенные переходы, или инструмента, который обновляет связанную таблицу только после того, как существует необходимая запись.

Отдельные сбои информативны, но недостаточно полны в качестве обучающих данных. Один нарушенный путь указывает на слабость; он не предоставляет десятков ситуаций, близких к той, что наблюдалась бы вблизи, которые научили бы модель восстанавливаться в условиях вариаций. Командам необходимо множество новых задач, которые проверяют одни и те же возможности по-разному, остаются выполнимыми в рамках данной среды, реалистичны с точки зрения требований пользователя и поддаются проверке результатами.

Именно в этом заключается принцип работы AutoSynthData. Сбои становятся сигналами для карточек компетенций. Карточки становятся генераторами новых задач. Более сильный преподаватель демонстрирует успешные траектории. Фильтры и верификаторы определяют, что попадает в набор данных для контролируемой тонкой настройки. После обучения оценка смещает границу в сторону оставшихся пробелов. Цикл формируется на основе учебной программы, а не представляет собой разовый сброс данных.

Для специалистов важна правильная формулировка. Если вы храните только неудачные запросы, вы рискуете переобучиться на этих конкретных сущностях и формулировках. Если вы генерируете только неограниченные синтетические запросы, вы рискуете столкнуться с задачами, которые окажутся невыполнимыми, нереалистичными или непроверяемыми. AutoSynthData находится между этими крайностями: он очищает неудачные запросы, преобразуя их в спецификацию возможностей, а затем генерирует задачи, которые сохраняют основную суть, изменяя при этом поверхностную форму и управляемые параметры.

Форма практического задания: система, подсказка, проверяющий

Работоспособная абстракция для работы агента выглядит следующим образом: задача равна спецификации системы, запросу пользователя и верификатору. Каждый элемент содержит ограничения, которые обеспечивают обоснованность и достоверность синтетических данных.

Спецификация системы охватывает ограничения, политики и начальное состояние — например, начальные значения баз данных и статьи базы знаний. Она должна оставаться совместимой с доступными инструментами и состоянием. Произвольные ограничения сложности, игнорирующие контракты инструментов или реалистичность начальных значений, как правило, создают ненадежные задачи, которые приводят к неверному выводу.

Качество подсказок для пользователя оценивается с трех точек зрения. Осуществимость предполагает наличие допустимой траектории. Реализм оценивает, насколько правдоподобно пользователь запросил бы это. Сложность оценивает, выявляет ли задача существующие слабые стороны агента, а не то, что целевой объект уже надежно решает. Подсказка, которая тривиальна для целевого объекта, тратит впустую бюджет на обучение; подсказка, которая невыполнима, тратит впустую доверие к оценке.

Качество проверки зависит от согласованности, корректности и полноты. Слишком мягкие проверки позволяют пройти слабые траектории. Слишком жесткие ограничения одной траекторией приводят к отказу в проверке допустимых альтернативных решений. В корпоративных условиях часто предпочитают проверки на основе SQL или состояний, поскольку они оценивают ситуацию после выполнения агентом действия, а не точный путь, по которому агент прошел.

AutoSynthData опирается на эту триаду, поэтому сгенерированная работа остается обоснованной. Генераторы не изобретают самодельные тесты. Они создают задачи, которые могут быть выполнены в адаптере среды и оценены верификаторами, которые учитывают необходимые свойства конечного состояния.

От диагностической оценки до карт технических характеристик

Процесс начинается с диагностической оценки целевого агента и более опытного учителя в этой среде. Параллельные запуски показывают, где целевой агент терпит неудачу, а где учитель добивается успеха. Эти сравнительные примеры являются исходным материалом для разработки учебной программы.

Далее следует преобразование в отфильтрованные карточки с описанием возможностей. Карточка описывает проверяемую возможность, соответствующие инструменты или структуру рабочего процесса, где цель не срабатывает, а преподаватель добивается успеха, необходимые свойства конечного состояния и параметры, которые могут меняться при создании новых задач. Важно отметить, что генератор не получает исходных подсказок, сущностей, траекторий или сведений о верификаторе — только сами карточки.

Эта очистка — преднамеренный шаг против переобучения. Если бы генератор увидел точные номера неудачных заявок, идентификаторы статей базы знаний или трассировки учителя, у него возник бы соблазн перефразировать тот же эпизод. Карточки заставляют к абстракции: обучайте навыку в условиях контролируемых вариаций, а не в запомненном примере.

После создания карточек система генерирует на их основе новые задания. Затем учитель демонстрирует успешные траектории для контролируемой тонкой настройки. Эти демонстрации не являются свободными рекомендациями; это основанные на окружающей среде успешные примеры, которые проходят ту же проверку, что и те, которые важны для учебной программы.

Структура масштабирования состоит из двух фаз. Фаза определения целей фокусируется на проверенных образцах, находящихся вблизи пробелов — задачах с самым высоким уровнем сигнала, близких к месту, где слабый агент дает сбой. Фаза умножения создает новые варианты принятых целей. Умноженные образцы не могут инициировать дальнейшие раунды умножения, что ограничивает дрейф. Это правило небольшое, но важное: неограниченная рекурсивная вариация может отклоняться от возможностей, указанных на карте.

Общий контроллер, адаптер среды и движущаяся граница

С точки зрения архитектуры, AutoSynthData использует общий контроллер и адаптер среды. Контроллер координирует диагностику, сбор данных, генерацию, демонстрационные материалы для преподавателей, контрольные точки качества и пакетную проверку. Адаптер связывает эти этапы с конкретной корпоративной песочницей — инструментами, состоянием, политиками и верификаторами — так что один и тот же цикл управления может быть направлен на разные области без переписывания логики учебной программы с нуля.

После контролируемой тонкой настройки конвейер переоценивается. Затем учебная программа движется к устранению оставшихся пробелов: это движущаяся граница, а не статичный набор данных. Эксперименты, описанные в работе, сосредоточены на контролируемой тонкой настройке. Тот же цикл может быть использован для поддержки обучения с подкреплением в дальнейшем; это направление отмечено как запланированное, а не заявленное как завершенное.

Для корпоративных команд архитектурный подход заключается в модульности. Контроллеры не должны жестко задавать одну схему тикетов. Адаптеры должны предоставлять достаточно информации о состоянии и используемых инструментах, чтобы верификаторы могли быть полезными. В учебной программе результаты оценки следует рассматривать как следующий входной параметр, а не как одноразовую таблицу показателей.

EnterpriseOps Gym — это среда, в которой был продемонстрирован этот подход. Это крупномасштабная корпоративная среда для работы с агентами, включающая около 1150 задач, отобранных экспертами, в 8 областях, примерно 512 инструментов, около 164 таблиц базы данных, контейнеризированное выполнение, проверку результатов на основе SQL, операции, управляемые политиками, гибридные междоменные сценарии, тестирование на невыполнимость и отказ, а также долгосрочные траектории с сохранением состояния. Компания AutoSynthData не является изобретателем этой среды; она представляет собой площадку для стресс-тестирования цикла синтеза.

Контроль качества на уровне образцов, обеспечивающий надежность синтетических задач

Генерация без использования вентилей — вот почему данные синтетических агентов могут давать сбои. AutoSynthData описывает контроль качества на уровне образцов с помощью нескольких дополнительных проверок.

Фильтр сложности решателя направляет набор задач в сторону тех, которые сложны для целевой модели и решаемы для обучающей. Описанная конфигурация отдает предпочтение задачам, которые целевая модель решает не более чем в одной из трех попыток, в то время как обучающая модель успешно решает их как минимум в двух из трех. Именно в этом диапазоне контролируемые демонстрации могут научить чему-то, чего слабая модель еще не умеет.

Положительная проверка требует, чтобы эталонная траектория прошла проверку. Отрицательная проверка требует, чтобы мутированные неверные результаты не прошли проверку. Вместе они проверяют на прочность как сторону принятия, так и сторону отклонения проверки. Если проверяются только положительные результаты, то верификатор с либеральными критериями может допустить некорректные данные. Если проверяются только отрицательные результаты, то верификатор с чрезмерно жесткими критериями может отклонить корректную работу.

Цикл критики и исправления с ограничением на количество повторных попыток пытается исправить задачи, не прошедшие контрольные проверки, вместо того, чтобы немедленно отбрасывать все почти пройденные задачи. Ограничения на количество повторных попыток имеют значение: бесконечное исправление может привести к созданию все более искусственных ограничений просто для того, чтобы пройти контрольный список.

Затем на уровне пакета проводится мета-обзор всего набора материалов на предмет охвата, разнообразия, избыточности и несоответствия целевым показателям. Контрольные точки для выборок обеспечивают корректность отдельных элементов; пакетный обзор предотвращает концентрацию учебного материала на одном узком типе недостатков или клонирование почти идентичных элементов.

Эти параметры контроля объясняют, почему конвейер обработки данных может тратить часы на создание тысяч образцов, не рассматривая объем как замену соответствию. Скорость различается в зависимости от предметной области и размера преподавательского состава, но история контроля качества остается неизменной: диапазон сложности, положительная и отрицательная проверка, исправление с использованием ограничений, а затем мета-анализ.

Несбои в исходном виде против карт против проверенных наборов SFT

Это помогает сравнить, для чего хорош каждый артефакт. Необработанные журналы ошибок служат для диагностики. Карточки возможностей — это генеративные контракты. Проверенные наборы данных для контролируемой тонкой настройки — это то, на чём вы обучаете систему на практике.

Артефакт Что в нём содержится Сила Риск при использовании в изоляции
Необработанные журналы ошибок Подсказки, состояния, нарушенные траектории, контрасты с успехом учителя Выявляет реальные пробелы в работающей среде Слишком мало выборок; легко переобучить модель на основе сущностей и формулировок
Карты с техническими характеристиками Возможности, инструменты или рабочий процесс, контраст между неудачей и успехом, потребности конечного состояния, переменные параметры Очищенная от лишнего содержимого абстракция для генераторов без утечки оригиналов Карты без контроля качества всё ещё могут давать невыполнимые или тривиальные результаты при выполнении задач
Набор SFT, проверенный AutoSynthData Новые задания, а также демонстрации преподавателей, прошедшие проверку на сложность, проверку и оценку Оценка масштаба с учетом реализма, осуществимости и проверки результатов Всё ещё зависит от квалификации преподавателей, качества проверяющих и соответствия окружающей среде

В снимках Hybrid и ITSM на EnterpriseOps Gym авторы сообщали о запусках, в которых в качестве целевой модели использовалась Gemma-4-26B-A4B-it. В Hybrid эта целевая модель использовалась в паре с Qwen3.8-27B в качестве обучающей модели, и было получено около 2000 гибридных образцов примерно за 18 часов, при этом лучшая контрольная точка была достигнута в эпоху 5. Средний показатель Pass@1 вырос на 7,2 процентных пункта — примерно на 35 процентов в относительном выражении — при этом успешность проверки увеличилась с 63,01 процента до 68,55 процента, сократив разрыв в показателе Pass@1 с эталонной моделью примерно на 59 процентов.

В ITSM тот же целевой объект был объединен с DeepSeek-V4.1-Flash в качестве обучающего образца, и было получено около 1994 образцов примерно за 66 часов, что дольше отчасти объясняется большим размером обучающего образца и тем, что некоторые оптимизации конвейера еще не были внедрены. Средний показатель Pass@1 увеличился с 18,77% до 27,18%.

Домен Цель Учитель Образцы и среда выполнения Результаты, сообщенные автором
Гибридный Gemma-4-26B-A4B-it Qwen3.8-27B Примерно 2000 выборок за 18 часов; лучший результат в эпоху контрольных точек - 5 Средний показатель Pass@1 +7,2 pp (~35% относительно); успешность проверки 63,01% - 68,55%; ~59% разрыва между Pass@1 и эталонным значением устранено
ITSM Gemma-4-26B-A4B-it DeepSeek-V4.1-Flash Примерно 1994 образца за ~66 часов Средний балл за тест 1: 18,77% против 27,18%

Рассматривайте эти цифры как результаты исследования компании, проведенного в данном тренажерном зале по протестированным областям, а не как независимое подтверждение третьей стороной и не как универсальную гарантию для предприятия. Результаты достигаются там, где совпадают сила преподавателя, качество проверяющего и соответствие среды.

Что специалистам следует перенять из цикла

Даже если ваша система не является исследовательским конвейером ServiceNow, принцип работы применим и к другим системам. Начните с парной оценки целевой системы, максимально приближенной к производственной, и более опытного «учителя» в точной песочнице. Преобразуйте ошибки сравнения в карточки возможностей, которые удаляют идентификаторы и траектории. Сгенерируйте задачи, которые варьируют допустимые параметры, сохраняя при этом необходимые свойства конечного состояния. Пусть «учитель» продемонстрирует успешные результаты. Установите уровни сложности, используйте положительную и отрицательную проверку, ограниченное исправление и анализ разнообразия пакетов. Доработайте, переоцените и продвиньте границы возможного.

Обратите особое внимание на проектирование верификатора. Проверки результатов SQL в стиле EnterpriseOps Gym и операции, управляемые политиками, демонстрируют, почему сами по себе критерии чата неэффективны для работы с состоянием. Если ваш верификатор не может отличить измененные неверные результаты от правильных окончательных, синтетическое масштабирование усилит шум.

Также следует уважать принцип умножения: варианты принятых целей не должны бесконечно порождать новые варианты, не возвращаясь к проверенным ядрам. Дрейф происходит незаметно. Учебная программа, которая постепенно изобретает все более экзотические ограничения, может по-прежнему проходить поверхностные фильтры, оставляя при этом исходные возможности недостаточно подготовленными.

Наконец, рассматривайте гибридную междисциплинарную работу как первоклассный стресс-тест. Обычные пользователи не ограничиваются одним инструментом. Гибридные задачи, долгосрочные перспективы и тестирование на отказ или нецелесообразность — вот где проявляется компетентность в работе с различными средами, или же она с треском проваливается.

Оговорки, ограничения и тщательная оценка выгоды

Результаты, представленные автором на EnterpriseOps Gym, являются информативными сигналами, а не гарантией успеха. Опубликованные преимущества гибридных решений и ITSM относятся к этим областям и парам моделей в описанной конфигурации. Другие области, более слабые «учителя», более «шумные» верификаторы или более низкая точность среды могут уменьшить или свести на нет этот эффект.

Качество зависит от трех столпов, которые нельзя обойти стороной ни одной маркетинговой уловкой. Сила учителя определяет потолок для демонстраций. Качество верификатора определяет достоверность меток и фильтров. Точность среды определяет, сохранятся ли усвоенные модели поведения при взаимодействии с производственными системами, правилами и состоянием данных.

В экспериментах AutoSynthData акцент делается на контролируемой тонкой настройке. Обучение с подкреплением отмечается как возможное последующее использование того же цикла, запланированное, но не реализованное в представленной работе. Читателям не следует путать готовый к использованию в учебных программах механизм обработки данных с утверждением о завершенном обучении с подкреплением.

Читателям также не следует путать конвейер синтеза с самой площадкой для тестирования. EnterpriseOps Gym предоставляет тщательно отобранные задачи, инструменты, таблицы, контейнеризацию и среду верификации. AutoSynthData использует подобную среду для превращения сбоев в ценные обучающие данные. Следует точно указать оба компонента: площадка для тестирования нагружает агентов; конвейер увеличивает количество обучаемых задач на основе выявленных пробелов.

В рамках экспериментальной среды также нет бесплатного обеда ни в плане вычислительного, ни в плане календарного времени. Гибридный синтез занял несколько часов для примерно двух тысяч образцов; ITSM потребовалось больше времени при использовании более ресурсоемкого учителя и более ранней конфигурации конвейера. Командам следует заложить в бюджет средства на вывод учителя, повторные попытки при критике или исправлении, а также повторную оценку после каждого этапа обучения.

Разработка учебных программ для команд корпоративных агентов

Основная идея AutoSynthData носит скорее учебный, чем чисто генеративный характер. Сбои диагностируют. Карты абстрагируют. Генерация умножается. Контроль качества проверяет. SFT обновляет целевой показатель. Переоценка расширяет границы возможного. Такая последовательность рассматривает улучшение агента как серию уроков, основанных на окружающей среде, а не как единый автономный дамп трассировок.

Подход к разработке учебных программ меняет то, как руководители распределяют усилия. Вместо того чтобы просить только больше заданий или больше ручных аннотаций, следует спрашивать, какие навыки по-прежнему не справляются с вариативностью, обладают ли эти навыки четко определенными свойствами конечного состояния и может ли более опытный преподаватель надежно продемонстрировать их. Если преподаватель не может добиться успеха достаточно часто, синтетическая стратегия обучения будет прививать ненадежное поведение. Если свойства конечного состояния нечеткие, проверяющие будут спорить с допустимыми стратегиями.

Это также меняет то, как вы говорите об успехе. Частичное устранение разрыва в показателе Pass@1 по сравнению с эталонной моделью в гибридной среде или повышение показателя ITSM Pass@1 с 10-15 до 20-25 в отчетах авторов — это прогресс в оценке компетентности в конкретной среде. Это не доказательство того, что решены все рабочие процессы, все политики или все случаи отказа. Используйте терминологию «постоянно меняющаяся граница»: оставшиеся пробелы становятся следующим этапом «Цель», а не второстепенным этапом.

При проектировании программ сочетайте этот цикл с проверкой человеком там, где ставки высоки — политика безопасности, необратимые действия, регулируемые данные — в то время как автоматизированные контрольные пункты должны обрабатывать большой объем четко определенных проверок состояния. Синтетические данные работают лучше всего, когда среда может дать ответ «да» или «нет» с ясностью, подобной SQL. Они испытывают трудности, когда успех — это субъективное мнение.

Заметки о дизайне: сложность, реализм и отказ

Целенаправленное обучение с учетом сложности задач заслуживает более пристального внимания. Отдавая предпочтение задачам, которые целевой ученик решает не более чем в одной трети случаев, мы избегаем обучения, основанного на пустяках. Требование к учителю успешно справляться как минимум с двумя третями задач исключает демонстрационные примеры, где всё решается случайным образом. Такой диапазон представляет собой практичный компромисс между сложностью и обучаемостью.

Реализм остается более мягким, но все же важным критерием. Корпоративные пользователи запрашивают то, что соответствует их ролям и системам. Генераторы, управляемые только сложностью, могут изобретать сложные многокритериальные головоломки, которые ни один оператор не стал бы запрашивать. Карточки возможностей, перечисляющие переменные параметры, помогают, но людям или мета-рецензентам все еще необходимо выявлять сюрреалистические запросы.

Тестирование на отказ и невыполнимость, присутствующее в общей архитектуре EnterpriseOps Gym, напоминает командам, что компетентность включает в себя умение говорить «нет». Конвейер, оптимизированный только для завершаемых задач, может недостаточно обучать отказу. При расширении циклов в стиле AutoSynthData следует включать карточки, где правильным конечным свойством является безопасный отказ в соответствии с политикой, а не только успешное изменение состояния базы данных.

Траектории с сохранением состояния на длительном горизонте поднимают еще один вопрос проектирования. Демонстрации для преподавателей должны оставаться согласованными при многочисленных вызовах инструментов. Верификаторы, проверяющие только последнюю строку таблицы, могут пропустить промежуточные нарушения политики. Полнота в проектировании верификатора означает охват свойств, которые действительно определяют успех данной возможности, включая ограничения, которые должны оставаться верными на протяжении всего процесса, а не только в конце.

Заключительное резюме

AutoSynthData от ServiceNow CoreAI / ServiceNow-AI, автором публичной статьи о котором является Эсаккивел Эсаккираджа, представляет собой конвейер, который преобразует сбои целевого агента и успехи обучающего агента в проверенные задачи синтетического обучения для корпоративных сред. Он абстрагирует сбои в очищенные карточки спецификаций возможностей, генерирует новые задачи, не раскрывая исходные подсказки или траектории, собирает демонстрации обучающего агента и обеспечивает контроль качества на уровне выборки и пакета перед контролируемой тонкой настройкой.

Практическая модель мышления представляет собой задачу как спецификацию системы, запрос пользователя и верификатора — с балансом между осуществимостью, реализмом и сложностью, а также с верификаторами, которые не слишком лояльны и не привязаны к одному пути. Этапы «цель, затем умножение», правило «нет дальнейшего начального значения» для умножаемых выборок, общий контроллер плюс адаптер среды и переоценка после SFT создают гибкую границу для оставшихся пробелов.

В EnterpriseOps Gym авторы представили результаты гибридного тестирования с использованием Gemma-4-26B-A4B-it и Qwen3.8-27B, которые показали примерно две тысячи выборок за восемнадцать часов и значительное увеличение показателей Pass@1 и успешности верификации, сократив большую часть разрыва с эталонной моделью. В ITSM с DeepSeek-V4.1-Flash в качестве обучающей модели показатель Pass@1 вырос с 18,77% до 27,18% примерно на 1994 выборках за более длительный период. Рассматривайте эти цифры как результаты исследований в конкретных областях, зависящие от точности обучающей модели, верификации и среды, и рассматривайте обучение с подкреплением как запланированное расширение цикла, а не как завершенное утверждение.

Запомните хотя бы одну фразу: корпоративные агенты совершенствуются, когда ошибки превращаются в абстрагированные, многократно повторяющиеся и проверенные уроки внутри систем, с которыми им приходится работать ежедневно, а не когда команды просто повторяют одну и ту же неисправную задачу.

Практический пример: расширение сложных сценариев ITSM из замороженного набора ошибок в стиле Gym

Сценарий

Команда разработчиков корпоративной платформы в Великобритании — представьте себе среднюю по размеру группу по эксплуатации финансовых услуг, использующую ITSM в стиле ServiceNow с окнами внесения изменений, связями CMDB и переходами, управляемыми политиками, — имеет агент, работающий в производственной среде, который постоянно сталкивается с одними и теми же типами задач: обновлениями между таблицами, которые должны соответствовать предварительным условиям утверждения, поиском информации в статьях базы знаний, который противоречит локальным ограничениям на внесение изменений, и гибридными запросами, которые затрагивают ITSM и смежные инструменты эксплуатации.

Они замораживают частный набор инструментов, аналогичный EnterpriseOps Gym (изолированная песочница, проверка результатов SQL-запросов, заполненные таблицы, правила политик), чтобы результаты были сопоставимы от недели к неделе. Диагностические запуски показывают, что целевой агент терпит неудачу там, где более сильный преподаватель добивается успеха. Руководство хочет получить больше обучающего сигнала без повторного воспроизведения одних и тех же номеров заявок и идентификаторов сущностей. AutoSynthData (или эквивалентный цикл синтеза на основе неудач, если конвейер исследований в их стеке ограничен) — подходящий вариант: преобразовать ошибки сравнения в очищенные карточки спецификаций возможностей, сгенерировать новые задачи, собрать демонстрации преподавателя, а затем — что крайне важно — провести проверку синтетических трасс человеком перед любым переобучением.

В Gym Pass@1 ничего не поставляется отдельно. Синтезированные данные рассматриваются как потенциальная учебная программа, а не как свободная истина.

Что нужно помощнику

  • Доступ к замороженному адаптеру среды в стиле Gym: инструменты, начальное состояние, политики и SQL-верификаторы (или эквивалентные верификаторы на основе состояния).
  • Парные журналы оценок: невыполнение целевых задач в сравнении с успехами учителя в выполнении тех же заданий.
  • Схема карточки, которая отражает возможности, инструменты/структуру рабочего процесса, контраст между успехом и неудачей, необходимые свойства конечного состояния и допустимые параметры вариативности — без исходных подсказок, сущностей, траекторий или внутренних механизмов верификатора.
  • Перед тем как что-либо покинет песочницу или попадёт в поле ввода генератора, необходимо проверить наличие персональных данных и соблюдение правил политики (идентификаторы заявок, имена пользователей, названия конфигурационных элементов, регулируемые поля).
  • Очередь для проверки человеком синтетических задач и результатов работы учителя (осуществимость, реализм, корректность верификатора, случаи отказа/неосуществимости).
  • Четкие условия остановки: этапы «Цель», затем «Умножение»; умноженные образцы не используются в качестве инициаторов дальнейших раундов умножения.

Пример инструкции

Платформа передает управление оператору учебной программы (или помощнику по организации, который только составляет карточки и пакеты для повторения — он не занимается переобучением или продвижением моделей):

«Проведите диагностический тест Pass@1 на замороженных срезах ITSM и Hybrid, сравнивая их с нашей текущей целевой системой и назначенным учителем. Для каждого сравнения, где целевая система не проходит проверку, а учитель успешно справляется как минимум с двумя из трех попыток, составьте очищенную карточку спецификации возможностей: назовите возможности, перечислите соответствующие инструменты, укажите необходимые свойства конечного состояния и перечислите управляемые параметры (диапазон приоритетов, связанный класс CI, флаг окна изменений, тип конфликта знаний). Удалите номера заявок, идентификаторы пользователей, имена CI и исходные траектории. Сгенерируйте пакет новых задач для целевой фазы только из этих карточек. Попросите учителя продемонстрировать успехи. Примените диапазон сложности (целевая система ≤1/3, учитель ≥2/3), положительную и отрицательную проверку, а также ограниченную критику/исправление. Подготовьте пакет для проверки, состоящий из 5% стратифицированных выборок, плюс все карточки отказов/невыполнимости. Не начинайте SFT, пока два рецензента не подпишут пакет и не пройдут проверку на наличие персональных данных. После SFT на контрольной точке-кандидате проведите повторную оценку на замороженном наборе задач и на контрольной группе». Набор точных совпадений, который мы никогда не использовали для генерации. Отчет о покрытии по классам ошибок и частоте регрессии по сравнению с предыдущей контрольной точкой в ​​производственной среде. Не повышайте рейтинг на основе только оценки Gym

Как это проверить

  1. Базовая блокировка: Записывайте показатели успешности Pass@1 и верификации для замороженного набора тестов по классам ошибок (порядок предварительных условий, отказ в окне изменений, гибридный кросс-инструментный подход, конфликт знаний). Сохраняйте набор тестов и начальные значения неизменяемыми на протяжении всего цикла.
  2. Проверка карточек: выборочно убедитесь, что генераторы никогда не получают исходные подсказки, сущности или данные от преподавателей — только карточки.
  3. Пример контроля качества: Подтвердите, что положительные траектории проходят проверку верификаторами, а искаженные неверные результаты — нет. Отклоняйте задачи, которые являются тривиальными для целевой группы или представляют собой сложную задачу для учителя.
  4. Экспертная оценка: Рецензенты отмечают каждый образец как «оставить/исправить/отклонить» на основе осуществимости, реалистичности и безопасности политики. Отслеживается согласованность мнений рецензентов по общему подмножеству.
  5. Точное совпадение с контрольной группой: После проверки кандидатов на роль SFT, оцените контрольную группу реальных (или ранее замороженных) задач, которые никогда не использовались в качестве входных данных для карточек или генерации. Отдельно оцените почти идентичные перефразированные версии обучающих задач, чтобы выявить поверхностное запоминание.
  6. Регрессионный барьер: любой класс ошибок, который ухудшается по сравнению с предыдущей контрольной точкой в ​​производственной среде, блокирует продвижение по службе до тех пор, пока не будет объяснено или исправлено.

Результат

Не нужно здесь придумывать собственные процентные показатели для оценки качества выпечки. Используйте план измерений и помечайте опубликованные результаты исследований как «Заявление статьи» при их цитировании.

План оценки (что должна отчитаться эта команда):

  • Показатель охвата классов отказов: доля диагностированных классов пробелов, в которых было получено ≥N принятых задач на целевом этапе после контроля качества (определите N заранее, например, 20 принятых задач на класс).
  • Точное совпадение с контрольной точкой: Pass@1 / успешность проверки на нетронутой контрольной точке до и после проверки кандидата SFT (те же начальные значения, тот же верификатор).
  • Показатель регрессии: количество классов отказов, в которых значение Pass@1 превышает значение предыдущей контрольной точки в производственной среде; блокировка, если какой-либо класс критически важных для безопасности элементов демонстрирует регрессию.
  • Результативность проверки: показатели сохранения/исправления/отбраковки в пакете проверки человеком; если показатель отбраковки резко возрастает, приостановите функцию «Умножение» и исправьте карты или верификаторы.
  • Количество неудачных проверок: число образцов, не прошедших проверку на наличие персональных данных/политики конфиденциальности до утверждения результатов проверки (цель: ноль образцов, попавших в набор SFT).

ЗАЯВЛЕНИЕ В СТАТЬЕ (сообщение автора на EnterpriseOps Gym — не результат измерений этой команды): Гибридные запуски с Gemma-4-26B-A4B-it в качестве целевого объекта и Qwen3.8-27B в качестве обучающего объекта дали около 2000 образцов примерно за 18 часов, при этом средний показатель Pass@1 вырос примерно на 7,2 процентных пункта, а успешность проверки увеличилась с 63,01% до 68,55%. ITSM с DeepSeek-V4.1-Flash в качестве обучающего объекта увеличил средний показатель Pass@1 с 18,77% до 27,18% примерно на 1994 образцах за более длительный период (~66 часов). Рассматривайте эти данные как сигналы, полученные в результате исследований в конкретных областях и парах объектов, а не как универсальную гарантию для производственного стека в Великобритании.

Примерная схема программы (предположения, а не измеренные результаты): Если команда принимает около 2000 образцов, прошедших контроль качества, для одного цикла ITSM, закладывает в бюджет выводы преподавателей и их проверку в рамках 5% стратифицированной выборки и повышает квалификацию только в том случае, если отобранные образцы не приводят к снижению качества критически важных для безопасности занятий, то «результатом», на который они могут с уверенностью заявить, является зрелость процесса — проверенная учебная программа, очищенные трассировки и сопоставимые изменения в замороженном наборе тестов, — а не обещанный процентный прирост.

Что может пойти не так?

  • Рассматривая синтез как свободную истину: отказ от человеческой проверки или отрицательной верификации позволяет либеральным верификаторам допускать некорректные результаты в больших масштабах.
  • Утечка сущностей: передача в генератор исходных идентификаторов билетов или данных о местонахождении преподавателя приводит к переобучению алгоритма путем перефразирования; существуют карточки, предотвращающие это.
  • Неограниченное умножение: предоставление возможности умножаемым выборкам инициировать последующие раунды отклоняется от заявленной возможности.
  • Доставка результатов Gym-core: Повышение рейтинга связано с ростом количества замороженных версий Pass@1, в то время как объем трафика из резервных или теневых производственных сред ухудшился.
  • Слабый потолок для учителя: если учитель не может преодолеть порог успеха в ≥2/3 баллов, SFT проводит ненадежные демонстрации.
  • Нечеткие верификаторы: вместо проверок на основе состояний, критерии оценивают беглое выполнение неправильных заданий в финальной части как успешное.
  • Недостаточный отказ от обучения: оптимизация только для завершаемых мутаций делает окно изменений и снижение эффективности политики ненадежными.
  • PII escape: Синтетические подсказки, которые после поверхностной проверки возвращают реальные CI-объекты или имена пользователей.

Практический вывод

Используйте циклы в стиле AutoSynthData — или эквивалентный шаблон синтеза на основе сбоев, если конвейер ServiceNow CoreAI недоступен в вашей системе, — для многократного увеличения количества сложных, проверяемых случаев ITSM на основе выявленных пробелов. Разделите данные на карточки возможностей, установите уровень сложности и проведите положительную/отрицательную проверку, удалите персональные данные и проведите проверку образцов человеком перед тестированием. Измерьте охват классов сбоев, точное совпадение на контрольной группе и скорость регрессии. Приводите данные Gym только в качестве внешнего контекста исследования. Данные синтеза используются в учебных целях, а не являются гарантией: проверяйте образцы, держите набор тестов в неизменном виде для справедливого сравнения и никогда не используйте только оценку Gym.

Часто задаваемые вопросы

Что такое AutoSynthData и для решения какой задачи он предназначен?

AutoSynthData — это конвейер ServiceNow CoreAI / ServiceNow-AI, описанный Эсаккивелом Эсаккираджа, который объединяет ошибки целевого агента с успехами более сильного обучающего агента в проверенные задачи синтетического обучения для корпоративных условий. Он фокусируется на компетентности среды — локальных политиках, схемах, инструментах и ​​состоянии — а не на общих знаниях. Цель состоит в том, чтобы многократно увеличить объем кропотливой, проверяемой работы, чтобы контролируемая тонкая настройка могла устранять специфические для среды пробелы, вместо того чтобы снова и снова запускать одну и ту же неработоспособную задачу.

Почему компетентность в вопросах окружающей среды отличается от способности к работе с широкими моделями?

Агенты корпоративных систем часто сталкиваются с трудностями из-за особенностей самой среды: политики обработки заявок, особенности схем, контракты инструментов, базы данных с предустановленными данными и межсистемные рабочие процессы. Модель, которая выглядит надежной в открытых тестах производительности, может все еще зависать на этапе внесения изменений, при взаимодействии с CMDB или при проверке конечного состояния верификатором. Широкие возможности — это не то же самое, что знание того, как ваши системы, правила и состояние данных ведут себя при переходах, регулируемых политиками.

Какую практическую форму задачи использует AutoSynthData?

Рабочей структурой является задача, состоящая из спецификации системы, запроса пользователя и верификатора. Спецификация системы содержит ограничения, политики и начальное состояние, такое как начальные значения базы данных и статьи базы знаний. Запросы пользователя оцениваются по выполнимости, реалистичности и сложности. Верификаторы в идеале должны опираться на проверки результатов на основе SQL или состояний, чтобы оценивать мир после выполнения агентом действия, а не только точный путь, пройденный агентом.

Как обработанные карты с техническими характеристиками предотвращают переобучение?

Диагностические тесты сравнивают ситуации, когда целевой показатель не срабатывает, а преподаватель добивается успеха, а затем преобразуют эти случаи в отфильтрованные карточки с описанием возможностей. Карточка содержит информацию о возможностях, инструментах или структуре рабочего процесса, сравнении неудач и успехов, необходимых свойствах конечного состояния и параметрах, которые могут варьироваться. Генератор никогда не видит исходных подсказок, сущностей, траекторий или деталей верификатора — только карточки, — поэтому новые задачи задействуют ключевые навыки, не перефразируя заученный эпизод.

Что представляют собой этапы «Целевое продвижение» и «Умножение» в конвейере обработки данных?

На этапе определения целей основное внимание уделяется проверенным образцам, расположенным вблизи пробелов — задачам с самым высоким уровнем сигнала, где слабый агент дает сбой. На этапе умножения создаются новые варианты принятых целей. Умноженные образцы не могут инициировать дальнейшие раунды умножения, что сдерживает отклонение от заявленной возможности. После контролируемой тонкой настройки переоценка направляет учебную программу на оставшиеся пробелы, рассматривая их как постоянно меняющуюся границу, а не как статичный массив данных.

Как контроль качества на уровне образцов обеспечивает достоверность синтетических задач?

Фильтр сложности решателя отдает предпочтение задачам, которые целевой алгоритм решает не более чем в одной из трех попыток, в то время как учитель успешно решает их как минимум в двух из трех. Положительная проверка требует наличия эталонной траектории для успешного прохождения; отрицательная проверка требует наличия измененных неверных результатов для провала. Цикл критики и исправления с ограничением количества повторных попыток пытается исправить ошибки, близкие к провалу, а мета-проверка на уровне пакета проверяет охват, разнообразие, избыточность и неудавшиеся целевые алгоритмы по всему набору данных.

Какую архитектуру использует AutoSynthData в корпоративных доменах?

Он объединяет общий контроллер с адаптером среды. Контроллер выполняет диагностику, сбор карточек, генерацию, демонстрации для преподавателей, контроль качества и пакетную проверку. Адаптер подключает эти шаги к конкретной песочнице — инструментам, состоянию, политикам и верификаторам — так что один и тот же цикл управления может указывать на разные области без переписывания логики учебной программы с нуля.

Что представляет собой EnterpriseOps Gym в контексте данного исследования?

EnterpriseOps Gym — это крупномасштабная корпоративная среда для тестирования агентов, используемая в качестве испытательного полигона, включающая около 1150 задач, отобранных экспертами, в 8 областях, примерно 512 инструментов, около 164 таблиц баз данных, контейнеризированное выполнение, проверку результатов на основе SQL, операции, управляемые политиками, гибридные сценарии и долгосрочные траектории с сохранением состояния. AutoSynthData не позиционируется как изобретатель этой среды; среда демонстрирует цикл синтеза в действии.

Какие результаты, по сообщениям авторов, наблюдаются в гибридных и ITSM-средах?

В EnterpriseOps Gym гибридные запуски с Gemma-4-26B-A4B-it в качестве целевого объекта и Qwen3.8-27B в качестве обучающего объекта дали около 2000 результатов примерно за 18 часов, при этом средний показатель Pass@1 вырос примерно на 7,2 процентных пункта, а успешность проверки увеличилась с 63,01% до 68,55%. В ITSM с DeepSeek-V4.1-Flash в качестве обучающего объекта средний показатель Pass@1 вырос с 18,77% до 27,18% примерно на 1994 результатах за более длительный период. Рассматривайте эти результаты как сигналы, полученные в ходе исследования конкретных пар объектов, а не как универсальную гарантию работоспособности.

Каких ошибок следует избегать командам при использовании циклов синтеза из ошибок?

Не следует воспринимать синтетические данные как абсолютную истину и обходить стороной проверку человеком и отрицательную верификацию. Избегайте ввода в генератор оригинальных идентификаторов билетов или данных о преподавателях, использования многократно скопированных выборок для запуска последующих раундов или продвижения на Gym Pass@1 в одиночку, когда снижается уровень неконтролируемого или теневого трафика. Также следует наблюдать за слабыми преподавателями, находящимися ниже уровня успешности, за нечеткими критериями оценки в чате вместо проверок на соответствие уровню, за случаями отказа из-за недостаточной подготовки и за утечкой персональных данных после поверхностной проверки.

Ссылки

  1. Hugging Face — AutoSynthData — huggingface.co
  2. EnterpriseOps Gym — enterpriseops-gym.github.io
  3. arXiv — arxiv.org
  4. GitHub — EnterpriseOps-Gym — github.com
Контрольный опрос
1. Какую основную проблему решает AutoSynthData от ServiceNow CoreAI?

2. Почему AutoSynthData преобразует ошибки в отфильтрованные описания возможностей?

3. Какой диапазон сложности предпочитает описанный фильтр решателя для задач обучения?

4. Как устроен контур управления AutoSynthData в разных средах?

5. Какое из изменений Pass@1, о котором сообщил автор в EnterpriseOps Gym Hybrid, относится к целевому объекту Gemma-4-26B-A4B-it?


Вернуться в блог