Ai2, GPU 클러스터 스케줄링에 예산 기반 시스템 도입
Ai2는 GPU 클러스터의 효율성과 연구 영향력을 높이기 위해 기존 우선순위 스케줄러를 GPU 시간 예산, 계층적 공정 공유, 시간 분할 계약 기반 시스템으로 교체하여 자원 할당의 투명성과 예측 가능성을 개선했다.
핵심 요약
- Ai2는 GPU 자원 할당의 비효율성을 해결하고자 스케줄러를 개선했다.
- 새로운 시스템은 GPU 시간 예산, 계층적 공정 공유, 시간 분할 계약을 도입한다.
- 이를 통해 GPU 스쿼팅, 우선순위 인플레이션, 운영 부담이 크게 감소했다.
- 디버그 워크로드 대기 시간 단축 및 전반적인 큐 대기 시간 개선 효과를 보였다.
- 1워크로드 제출 및 설정
- 2공정 공유 스케줄링
- 3최소 실행 시간 보장
- 4할당량 기반 실행 지속
- 5선점 및 재큐잉
GPU 자원 할당 방식의 변화
Ai2의 AI 인프라 팀은 GPU 클러스터 스케줄링 시스템을 개선했다. 2026년 10월 9일 공개된 정보에 따르면, 기존의 우선순위 기반 스케줄러를 GPU 시간 예산, 계층적 공정 공유 할당, 그리고 시간 분할 계약을 포함하는 새로운 시스템으로 교체했다. 이 변화는 GPU 시간 할당에 대한 논의를 사례별 운영 작업에서 투명하고 행정적인 예산 책정 프로세스로 전환하는 것을 목표로 한다.
새로운 시스템 도입으로 연구 프로젝트에 GPU 시간을 할당하는 방식이 근본적으로 변경되었다. 이는 GPU 자원의 가용성, 점유율, 영향력, 활용률이라는 네 가지 핵심 지표 중 '영향력'을 개선하는 데 중점을 둔다. 특히 가장 가치 있는 워크로드가 자원을 할당받는 빈도를 높이는 데 기여한다.
변화의 배경과 기존 시스템의 한계
Ai2는 수천 대의 NVIDIA H100, B200, B300 GPU를 관리하며, 약 150명의 내부 연구원이 LLM 및 VLM 훈련, 로봇 공학 RL 시뮬레이션 등 다양한 AI 도메인 연구에 활용한다. 그러나 GPU 시간 수요가 공급을 2~3배 초과하는 상황에 직면해 있었다. 이러한 자원 부족은 기존 우선순위 기반 스케줄러의 문제점을 더욱 부각시켰다.
기존 시스템에서는 사용자들이 필요할 때 연결할 수 있도록 아무 작업도 하지 않는 워크로드를 유지하는 'GPU 스쿼팅' 현상이 발생했다. 이는 낮은 지연 시간으로 디버깅 워크로드를 실행하기 어려웠기 때문이다. 또한, 모든 워크로드가 'HIGH' 우선순위를 사용하게 되는 '우선순위 인플레이션'으로 인해 낮은 우선순위 워크로드는 GPU 시간을 전혀 할당받지 못했다. 비선점형 워크로드의 존재는 유지보수 시 온콜 엔지니어들이 워크로드 종료를 협상하는 데 많은 시간을 소요하게 만들었다. 이러한 문제들은 공유 자원 경쟁에서 개별 최적화가 전체 최적화를 저해하는 '공유지의 비극'으로 인식되었다.
새로운 스케줄링 시스템의 구체적 작동 방식
새로운 시스템은 GPU 시간 예산 개념을 도입한다. 팀에 물리적인 GPU를 할당하는 대신, 전체 GPU 시간의 일정 부분을 할당하는 방식이다. 관리자는 연구 프로젝트의 전략적 중요도에 따라 GPU 시간을 할당하며, 이는 계층적 시스템을 통해 관리자가 책임지는 프로젝트와 연구원에게 비례적으로 배분된다. 모든 GPU 시간 요청은 예산으로 지원되어야 선점으로부터 보호되며, 예산이 없는 요청은 보호되지 않는다. 이로써 스쿼팅과 같은 비효율적인 행위는 팀 예산을 소모하게 하여 불이익을 준다.
GPU 시간 예산과 함께 계층적 공정 공유 스케줄러가 도입되었다. 이 스케줄러는 Hadoop Fair Scheduler, SLURM의 Fair Tree, YARN의 Fair Scheduler와 유사한 알고리즘을 사용한다. 연구 프로그램 구조를 반영하는 트리와 관리자가 설정한 예산(가중치)을 입력으로 활용하며, 슬라이딩 룩백 윈도우(기본값 7일) 동안의 점유율을 추적한다. 이를 통해 할당량 미달 그룹의 워크로드를 초과 그룹보다 우선순위로 정렬하여, 충분한 수요를 가진 그룹은 할당된 GPU 시간을 받을 수 있도록 한다.
스케줄러는 '할당된 점유율'과 '할당되지 않은 점유율'을 구분한다. 할당된 점유율은 예산에 청구되며, 워크로드 소유자의 할당량에 영향을 미치고 최소 실행 시간 동안 선점으로부터 보호된다. 반면 할당되지 않은 점유율은 예산에 청구되지 않고 선점으로부터 보호되지 않으며, 할당된 요청에 의해 언제든지 선점될 수 있다. 이는 할당량이 수요와 일치하지 않을 때도 GPU를 완전히 점유 상태로 유지하는 데 기여한다.
또한, '스케줄링 계약'을 통해 시간 분할 기능이 추가되었다. 워크로드는 최소 실행 시간(minimum runtime)을 선언해야 하며, 이 시간 동안 선점으로부터 보호된다. 최소 실행 시간 이후에는 스케줄러가 자동으로 재조정하고 재개 가능한 워크로드를 재큐잉할 수 있다. 최소 실행 시간을 0으로 설정하면 할당되지 않은 GPU 시간을 사용하며, 예산에 청구되지 않지만 항상 선점될 수 있다. 이 계약은 실행 중인 워크로드를 자동으로 제거하고 재큐잉하여 공정 공유를 수렴시키고 스쿼팅을 억제하며, 비정상 호스트의 워크로드를 자동으로 비워 유지보수 활동을 자동화하는 데 활용된다.
개발자 및 사용자 경험에 미치는 영향
새로운 시스템 도입 후, Ai2는 여러 긍정적인 변화를 확인했다. 30일 테스트 기간 동안 팀들은 할당된 GPU 시간의 98%를 받았으며, 15개 팀 중 13개 팀이 95% 이상을 받았다. 클러스터 점유율은 변경 전후 모두 98%로 유지되었고, 할당되지 않은 GPU 시간(전체 전달 시간의 18%)을 활용하여 높은 점유율을 유지했다. 한 연구원은 새로운 스케줄러가 “30%의 추가 컴퓨팅 자원을 확보한 느낌”을 준다고 언급했다.
특히 디버그 워크로드의 대기 시간이 크게 단축되었다. 시뮬레이션에서는 p90 대기 시간이 6시간에서 5분으로 단축될 것으로 예측했으나, 실제 운영에서는 2시간에서 30초로 더욱 크게 단축되었다. 전반적인 큐 대기 시간도 개선되어, 가장 큰 H100 클러스터에서 중앙값 대기 시간은 5분에서 24초로, p90 대기 시간은 약 1/3 (2.8시간에서 1.8시간) 감소했다. 이는 스쿼팅 감소, 우선순위 인플레이션 해소, 온콜 엔지니어의 수동 개입이 필요한 수리 작업 74% 감소로 이어졌다.
적용 조건, 제약 및 향후 계획
Ai2는 새로운 시스템 도입 전, 스케줄링 정책 변경의 예상치 못한 결과를 예측하기 위해 시뮬레이션 환경을 구축했다. 이 시뮬레이터는 워크로드 세트와 제출 일정을 입력으로 받아 선점 및 GPU 할당 결정을 시뮬레이션하며, 룩백 윈도우 길이, 최소 실행 시간의 최대값(8시간으로 설정)과 같은 구성 요소를 테스트하는 데 사용되었다. 시뮬레이션은 과거 제출 데이터와 구성된 시나리오를 기반으로 실행되었으며, 디버그 워크로드 시뮬레이션에는 수동으로 구축된 테스트 데이터가 필요했다.
그러나 모든 사용 사례가 개선된 것은 아니다. 인터랙티브 세션의 경우, 기존에는 최대 일주일 동안 세션을 유지할 수 있었으나, 시간 분할로 인해 보호된 실행 시간이 8시간으로 제한되었다. 세션이 선점되면 상태를 수동으로 재구축해야 하는 문제가 발생했다. 이에 Ai2는 데이터 준비 작업에 초점을 맞춘 CPU 전용 클러스터에 투자하고, CPU 전용 워크로드를 위한 복원 가능한 세션(restorable sessions)을 구축하여 이 문제를 해결할 계획이다.
또한, 용량 단편화(capacity fragmentation)로 인해 가장 큰 워크로드의 큐 대기 시간이 증가할 가능성을 조사 중이다. 최소 실행 시간 보호가 기존에 선점 가능한 메커니즘에 의존하던 작업에 적용되면서, 대규모 작업 스케줄링이 어려워질 수 있다는 직관이 있다. Ai2는 시뮬레이션 도구를 사용하여 이 문제를 재현하고 실제 운영 환경에서 측정하고 있다. 장기적으로는 부트스트래핑, 체크포인트, 훈련 애플리케이션 자체의 효율성을 높여 스케줄링된 시간의 가치를 극대화하는 활용률(utilization) 개선을 목표로 한다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Hugging Face Blog
Impactful scheduling for GPU clusters
원문 발행: 2026-10-10 00:20:29
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 인공지능 도구 도입과 해커톤의 역할 변화 · GitHub Blog · 2026-10-10
- 5단계 워크플로우로 로봇 시뮬레이션용 SimReady 자산 생성 지원 · NVIDIA Developer Blog · 2026-10-09
- LLM 에이전트의 생산 환경 적용을 위한 성숙도 모델 · Stack Overflow Blog · 2026-10-09
- KDD 컵 2026 데이터 에이전트 경쟁에서 배우는 신뢰할 수 있는 데이터 분석 에이전트 구축 전략 · NVIDIA Developer Blog · 2026-10-09
- AI 에이전트의 정상 종료 신호가 실제 작업 완료를 증명하지 못하는 구조적 원인과 해결책 · Stack Overflow Blog · 2026-10-08
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.