ServiceNow, 기업용 에이전트 훈련 데이터 자동 생성 시스템 'AutoSynthData' 공개
ServiceNow CoreAI는 기업 환경에 특화된 에이전트 훈련 데이터를 자동으로 생성하는 AutoSynthData를 개발했다. 이 시스템은 모델의 약점을 파악하고, 이를 개선할 수 있는 현실적이고 실행 가능한 작업을 생성 및 검증하여 모델 성능을 향상한다.
핵심 요약
- AutoSynthData는 기업 에이전트의 역량 격차를 해소할 훈련 데이터를 생성한다.
- 대상 모델의 실패와 교사 모델의 성공을 기반으로 학습 커리큘럼을 동적으로 조정한다.
- 생성된 작업은 실현 가능성, 현실성, 난이도 및 검증기의 일관성을 충족해야 한다.
- 샘플 및 배치 수준의 엄격한 품질 관리와 수리 과정을 통해 데이터 품질을 확보한다.
- 1모델 약점 식별
- 2역량 사양 카드 생성
- 3훈련 작업 생성 및 확장
- 4샘플 및 배치 검증
- 5모델 훈련 및 재평가
기업 에이전트 훈련 데이터 자동화
ServiceNow CoreAI는 기업 환경에 최적화된 에이전트 훈련 데이터를 자동으로 생성하는 시스템인 AutoSynthData를 개발했다. 이 시스템은 대상 모델의 특정 약점을 식별하고, 이를 개선하는 데 필요한 새로운 훈련 작업을 생성 및 검증하는 과정을 자동화한다. AutoSynthData는 모델이 학습해야 할 내용을 결정하기 위해 대상 모델의 실패 사례와 더 강력한 교사 모델의 성공 사례를 활용한다. 모델의 성능이 향상됨에 따라 시스템은 학습 커리큘럼을 동적으로 조정하여 모델이 여전히 어려워하는 영역에 집중하도록 한다.
기업 환경에서 에이전트는 특정 시스템, 내부 규칙, 그리고 데이터 상태에 따라 복잡한 작업을 수행해야 한다. 광범위한 역량을 갖춘 모델이라도 특정 워크플로우 처리, 도구 오용, 또는 제약 조건 미준수와 같은 기업 특유의 환경에서 약점을 드러낼 수 있다. 이러한 약점을 효과적인 훈련 데이터로 전환하는 것은 기존에 어려운 과제였다. AutoSynthData는 이러한 역량 격차를 해소하고, 실제 기업 환경에서 에이전트가 직면할 수 있는 다양한 시나리오를 반영한 고품질 훈련 데이터를 제공하는 것을 목표로 한다.
훈련 작업의 구성과 요구사항
AutoSynthData가 생성하는 훈련 작업은 `(system specification, user prompt, verifier)`의 세 가지 핵심 요소로 구성된다. 시스템 사양은 에이전트가 작동해야 하는 제약 조건, 즉 시스템 지침, 환경 정책, 그리고 필요에 따라 초기 데이터베이스 상태나 지식 문서 등을 정의한다. 이 사양은 환경의 도구, 상태 및 지원되는 작업과 호환되어야 하며, 명확하고 인위적인 난이도를 유발하는 제약은 피해야 한다.
사용자 프롬프트는 사용자가 에이전트에게 기대하는 바와 사용자 수준의 제약 조건을 명시한다. 생성된 작업은 세 가지 속성을 만족해야 한다. 첫째, '실현 가능성'으로, 현재 환경에서 사용자 프롬프트를 만족시키고 시스템 사양을 준수하는 최소한 하나의 실행 경로가 존재해야 한다. 둘째, '현실성'으로, 사용자 프롬프트는 대상 환경에서 사용자가 실제로 요청할 법한 내용이어야 한다. 셋째, '난이도'로, 훈련을 위해 현재 에이전트의 약점을 노출할 수 있을 만큼 충분히 도전적이어야 한다. 이미 안정적으로 해결되는 작업은 새로운 훈련 신호를 거의 제공하지 않는다.
검증기는 에이전트의 결과 궤적이 작업을 성공적으로 완료했는지 판단하는 역할을 한다. 검증기는 '일관성'을 가져야 하며, 사용자 프롬프트, 시스템 사양, 작업별 환경 상태와 일치해야 한다. 또한 '건전성'을 갖춰 작업을 만족시키지 못하거나 관련 제약 조건을 위반하는 궤적을 거부해야 한다. 마지막으로 '완전성'을 통해 특정 참조 궤적에만 얽매이지 않고 유효한 모든 솔루션을 수용해야 한다. 이러한 검증기의 속성은 훈련 과정에서 매우 중요하며, 부실한 검증기는 잘못된 행동을 보상하고, 지나치게 제한적인 검증기는 유효한 솔루션을 처벌할 수 있다.
데이터 생성 및 품질 관리 프로세스
AutoSynthData는 대상 모델을 환경에서 진단 작업으로 평가하여 모델이 어려움을 겪는 패턴을 식별하는 것으로 시작한다. 이 과정에서 더 강력한 교사 모델이 어떤 작업이 해결 가능한지, 그리고 성공적인 행동이 무엇인지 특성화하는 데 도움을 준다. 이러한 분석을 통해 얻은 역량 격차는 새로운 실행 가능한 작업으로 전환되며, 각 작업은 환경 내에서 검증된 후 후속 훈련에 사용된다. 업데이트된 모델을 다시 평가함으로써 남아있는 격차를 파악하고 다음 데이터 생성 라운드를 안내한다.
훈련 데이터 생성은 '타겟(Target)'과 '멀티플라이(Multiply)'의 두 단계로 진행된다. 타겟 단계에서는 식별된 역량 사양으로부터 핵심 훈련 샘플 세트를 생성한다. 작업자들은 독립적인 작업을 병렬로 생성하며, 각 후보 작업은 검증, 실행, 솔버 평가, 수리 과정을 거쳐 수락된다. 멀티플라이 단계에서는 수락된 핵심 샘플의 새로운 변형을 생성하여 데이터셋을 확장한다. 각 변형은 고유한 사용자 요청, 환경 상태, 엔티티 구성, 참조 궤적 및 검증기를 가지며, 동일한 검증 및 실행 검사를 통과해야 한다. 이 과정에서 곱해진 샘플이 다른 곱해진 샘플의 시드가 되는 것은 방지하여 데이터셋의 일관성과 품질을 유지한다.
AutoSynthData는 생성 제어와 환경별 실행을 분리하여 구현되었다. 공유 컨트롤러는 생성, 품질 관리, 커버리지 및 데이터셋 구성을 조정하며, 어댑터는 환경 실행, 작업 및 상태 관리, 참조 재생, 결정론적 검증, 솔버 실행 및 작업 프로파일링을 담당한다. 이러한 분리된 구조는 훈련 규모의 데이터셋을 효율적으로 구축할 수 있도록 지원한다. 모든 후보 작업은 실행 가능성, 솔루션의 유효성, 그리고 검증기가 성공과 실패를 명확히 구분하는지 여부를 확인하는 엄격한 검사를 거친다.
엄격한 검증을 통한 데이터 품질 확보
AutoSynthData는 두 가지 수준에서 데이터 품질을 검토한다. 첫째, 개별 후보 샘플은 훈련 데이터셋에 포함되기 전에 품질 관리 루프를 통과해야 한다. 난이도 측정을 위해 솔버 평가를 수행하며, 대상 모델이 3회 시도 중 1회 이하로 해결하고 강력한 솔버가 3회 중 2회 이상 해결하는 작업을 선호한다. 또한 '긍정적 검증'을 통해 의도된 솔루션이 생성된 작업을 해결하는지 확인하고, '부정적 검증'을 통해 관련 없는 잘못된 결과가 실패하는지 확인한다. 실패한 후보는 비평가(critic)에게 전달되어 불일치 상태, 불가능한 워크플로우, 잘못된 작업 구성, 약한 검증기 로직 등을 진단하고, 진단 결과에 따라 수리 과정을 거친다.
둘째, 배치 수준 검토를 통해 데이터셋 전체의 유용성과 다양성을 확보한다. 메타 검토는 수락된 샘플, 거부된 샘플, 그리고 각 배치 전반의 생성 동작을 분석한다. 이를 통해 과도하게 대표되는 작업군, 누락된 역량 차원, 반복적으로 나타나는 예시, 그리고 반복적으로 실패하는 특정 목표 등을 식별한다. 컨트롤러는 수락된 데이터셋의 커버리지를 추적하고, 과도하게 대표되는 영역의 생성을 줄이며, 격차에 더 많은 작업을 지시한다. 이러한 조정은 유용한 학습 신호, 작업 품질, 커버리지, 다양성, 그리고 낮은 중복성을 균형 있게 맞추는 데 기여한다.
실험 결과 및 적용 한계
ServiceNow CoreAI는 EnterpriseOps Gym 환경에서 AutoSynthData의 효과를 검증했다. Hybrid 도메인 실험에서는 Gemma-4-26B-A4B-it를 대상 모델로, Qwen3.8-27B를 교사 모델로 사용하여 약 18시간 동안 2,000개의 합성 훈련 샘플을 생성했다. 이 데이터셋으로 Gemma 모델을 미세 조정한 결과, Pass@1 평균이 7.2%포인트 향상되어 35%의 상대적 개선을 보였으며, 검증기 성공률은 63.01%에서 68.55%로 상승했다. 이는 Gemma와 참조 모델 간의 원래 Pass@1 격차의 59%를 해소하는 결과이다.
ITSM 도메인에서도 AutoSynthData를 적용하여 Gemma-4-26B-A4B-it를 대상 모델로, DeepSeek-V4.1-Flash를 교사 모델로 사용했다. 약 66시간 동안 1,994개의 합성 훈련 샘플을 생성했으며, Pass@1 평균이 18.77%에서 27.18%로 상승하여 두 번째 도메인에서도 성능 향상을 입증했다. ITSM 환경에서의 생성 시간이 Hybrid보다 길었던 주된 이유는 더 큰 교사 모델을 사용했고, 파이프라인 최적화가 이루어지기 전이었기 때문이다.
AutoSynthData는 모델의 개선에 따라 유용한 훈련 분포가 변화한다는 점을 고려한다. 합성 데이터 생성은 대상 모델의 역량 경계 근처에 있는 작업을 찾는 과정으로 간주된다. 즉, 약점을 노출할 만큼 충분히 어렵지만, 교사 모델이 신뢰할 수 있는 시연을 제공할 만큼 해결 가능한 작업을 생성하는 데 중점을 둔다. 현재는 SFT(Supervised Fine-Tuning)에 초점을 맞추고 있으나, 향후 강화 학습(Reinforcement Learning)에도 동일한 메커니즘을 적용하여 현재 정책에 도전하고 신뢰할 수 있는 학습 신호를 제공하는 작업을 생성하는 방안을 계획하고 있다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Hugging Face Blog
AutoSynthData: Generating Training Data for Enterprise Agents
원문 발행: 2026-10-02 13:01:31
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 2024-2025 개발자 설문조사 회고: AI 활용 증가 속 변화하는 개발 환경과 인식 · Stack Overflow Blog · 2026-10-01
- 엔비디아, cuObject 및 SCADA Server SDK로 AI 스토리지 접근성 확대 · NVIDIA Developer Blog · 2026-10-01
- 마이크로소프트, 전력망 우주 기상 위험 예측 머신러닝 시스템 공개 · Microsoft Research · 2026-10-01
- AI 생성 단백질에 워터마크를 삽입하는 SynthID Bio 공개 · Google DeepMind · 2026-10-01
- 2024년 및 2025년 개발자 설문조사 결과 분석: AI 활용 증가와 변화하는 개발 환경 · Stack Overflow Blog · 2026-09-30
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.