NVIDIA, 쿠버네티스 노드 플릿 관리를 위한 오픈소스 솔루션 'NodeWright' 공개
NVIDIA는 쿠버네티스 노드 운영체제를 선언적으로 구성하고 안전하게 업데이트하는 오픈소스 솔루션 'NodeWright'를 발표했다. 이 도구는 워크로드 중단 없이 대규모 호스트 인프라를 관리하며, NVIDIA AI Cluster Runtime(AICR)과 통합되어 AI 워크로드에 최적화된 노드 관리를 지원한다.
데빈 · AI 기술 에디터 ·
NVIDIA는 쿠버네티스 노드 운영체제(OS)를 선언적으로 구성하고 안전하게 업데이트하는 오픈소스 솔루션인 'NodeWright'를 공개했다. NodeWright는 쿠버네티스 네이티브 패키지 관리자로, 대규모 호스트 인프라를 수정하고 유지보수하는 데 사용된다. 이 솔루션은 NVIDIA DSX OS의 일부이며, 이전에 NVIDIA 내부 프로덕션 환경에서 'Skyhook'이라는 이름으로 운영되었다.
기존에는 쿠버네티스 노드, 특히 GPU 노드의 커널 설정, 시스템 패키지, 스토리지 레이아웃, 보안 에이전트 및 호스트 수준 튜닝을 관리하는 것이 큰 과제였다. 많은 팀이 Ansible 플레이북, 맞춤형 스크립트, 수동 런북을 사용했지만, 새로운 클러스터가 다른 리전에 배포되거나 커널 업그레이드로 인해 문제가 발생하거나 CVE(Common Vulnerabilities and Exposures)를 전체 플릿에 적용해야 할 때 어려움이 있었다. 특히 GPU 노드는 하드웨어 희소성, 교체 시간, 장기 실행 학습 작업 재스케줄링의 어려움 때문에 워크로드 중단 없이 변경 사항을 적용하는 것이 중요했다.
NodeWright는 이러한 문제를 해결하기 위해 설계되었다. 기존의 구성 관리 도구(Ansible, Puppet 등)는 개별 머신 관리에 중점을 두어 쿠버네티스 워크로드의 특성을 인지하지 못했다. 이로 인해 노드 변경 시 코돈(cordon), 워크로드 드레인(drain), PodDisruptionBudgets(PDB) 존중과 같은 쿠버네티스 프리미티브를 고려하지 않아 워크로드 중단이 발생할 수 있었다. NodeWright는 이러한 격차를 해소하며, 설치부터 구성, 업그레이드, 제거에 이르는 호스트 수준 변경의 전체 라이프사이클을 관리하면서 쿠버네티스 프리미티브를 준수한다.
NodeWright는 오퍼레이터, 커스텀 리소스, 패키지의 세 가지 주요 구성 요소로 작동한다. 오퍼레이터는 NodeWright 커스텀 리소스를 감시하고 노드 전반의 변경 라이프사이클을 관리하는 쿠버네티스 컨트롤러이다. 패키지는 실제 수정 사항(스크립트, 구성, 바이너리)을 담는 컨테이너 이미지이며, 실패 시 롤아웃을 중단하는 검증 스크립트도 포함한다. NodeWright 커스텀 리소스를 적용하면, 오퍼레이터는 각 대상 노드에서 코돈(Cordon), 대기(Wait), 드레인(Drain), 적용 및 구성(Apply and configure), 인터럽트(Interrupt), 언코돈(Uncordon)의 순서로 작업을 오케스트레이션한다. 이 과정에서 `podNonInterruptLabels`를 통해 중단되어서는 안 되는 워크로드를 보호하고, `PodDisruptionBudgets`를 존중하여 워크로드 중단을 최소화한다.
NodeWright 패키지는 `sysctl` 및 GRUB 매개변수 설정, 크래시 덤프 수집 구성, 논리 볼륨 생성, 보안 에이전트 설치, CVE 완화 등 다양한 호스트 수준 작업을 수행할 수 있다. NodeWright는 각 노드의 모든 패키지 상태와 시맨틱 버전을 추적하여 신규 설치, 업그레이드, 다운그레이드를 구분한다. 또한 패키지는 의존성을 선언할 수 있으며, NodeWright는 이를 사용하여 올바른 실행 순서를 결정한다. 검증 기능은 패키지 라이프사이클에 내장되어 있어, 적용, 구성, 업그레이드, 제거 및 인터럽트 후 작업마다 예상 노드 상태를 확인하고 실패를 쿠버네티스를 통해 보고한다. 이는 취약한 커널 모듈이 로드된 상태를 감지하고 패키지를 실패로 표시하여 운영자에게 즉각적인 가시성을 제공한다.
대규모 환경에서 안전한 롤아웃을 위해 NodeWright는 `DeploymentPolicy` 리소스를 제공한다. 이 리소스를 통해 레이블로 선택된 노드 그룹인 '컴파트먼트(compartments)'를 정의하고, 각 컴파트먼트별로 고유한 중단 예산과 롤아웃 전략을 설정할 수 있다. 롤아웃 전략에는 고정(Fixed), 선형(Linear), 지수(Exponential) 방식이 있으며, 각 전략은 다음 배치로 진행하기 위한 최소 성공률을 정의하는 배치 임계값(batch threshold)을 포함한다. 선택적으로 연속적인 배치 실패 시 해당 컴파트먼트의 롤아웃을 중단하는 실패 임계값(failure threshold)도 설정할 수 있다. 이를 통해 단일 카나리 노드에서 시작하여 점진적으로 전체 플릿으로 업데이트를 확장할 수 있으며, 문제가 발생하면 업데이트가 자동으로 중단되어 오류가 확산되는 것을 방지한다.
NodeWright는 NVIDIA AI Cluster Runtime(AICR)과 통합되어 기능한다. AICR은 드라이버, 오퍼레이터, 커널, 시스템 구성의 검증된 조합을 버전이 고정된 레시피로 캡처하여 제공한다. AICR의 컴포넌트 카탈로그는 NodeWright 오퍼레이터와 환경별 튜닝을 포함하는 NodeWright 커스터마이징을 고정하고, 이를 Helm, Argo CD, Flux 또는 Helmfile을 위한 배포 준비 번들로 렌더링한다. NodeWright는 이러한 레시피의 호스트 수준 부분을 실행 중인 노드에 적용한다. 또한, NVCRE(NVIDIA Cluster Readiness Engine)는 워크로드 전 검증을 통해 가속화된 인프라가 프로덕션 준비가 되었는지 확인하고, NVSentinel은 런타임 오류를 모니터링하고 코돈, 드레인, 완화 작업을 지원하여 GPU 가속 쿠버네티스 클러스터의 프로비저닝, 유지보수, 자가 치유를 돕는다.
NodeWright는 Helm을 통해 모든 쿠버네티스 클러스터에 설치할 수 있으며, OCI 아티팩트로 배포된다. 사용자는 NodeWright 커스텀 리소스를 정의하고 원하는 패키지를 지정하여 노드를 레이블로 타겟팅하면 된다. NodeWright는 Apache 2.0 라이선스 하에 제공되며, DSX OS의 모듈형 오픈소스 프로젝트 포트폴리오의 일부이다. 다만, NodeWright는 NVIDIA GPU Operator나 NVIDIA Network Operator를 대체하는 것이 아니라, 이들 아래의 호스트 OS 계층을 관리하는 역할을 수행한다. NVIDIA는 커뮤니티의 참여를 독려하며, 특히 아직 카탈로그에 포함되지 않은 하드웨어 및 클라우드 조합에 대한 패키지 개발과 새로운 튜닝 프로파일 공유에 관심을 표명하고 있다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
NVIDIA Developer Blog · Michelle Horton
Manage Kubernetes Node Fleets with NodeWright
원문 발행: 2026-09-24 03:25:49
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- AWS DevOps Agent와 AgentCore Evaluations를 활용한 에이전트 모니터링 · AWS Machine Learning Blog · 2026-09-12
- 구글 클라우드 API 게이트웨이, 모델 라우팅 기능 공개 미리보기 출시 · Google Developers Blog · 2026-09-06
- HeyGen, 구글 클라우드 TPU 기반 아바타 IV 모델 구동 · Google Developers Blog · 2026-09-06
- 구글 클라우드, vLLM 서비스 엔진에 TPU 지원 통합 · Google Developers Blog · 2026-09-06
- AWS 기반 생성형 AI를 활용한 지원 운영 고도화 · AWS Machine Learning Blog · 2026-09-03
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.