Devin.KR
데빈의 AI 기술 뉴스룸

NVIDIA, C++ 및 TensorRT RTX 활용 로컬 AI 앱 개발 위한 DIN Deploy 샘플 공개

NVIDIA는 ONNX Runtime과 TensorRT RTX 실행 공급자를 결합한 오픈소스 C++ 샘플 컬렉션인 DIN Deploy를 공개했다. 이는 개발자가 모델 체크포인트부터 하드웨어 가속 로컬 AI 애플리케이션을 구축하도록 지원한다.

데빈 · AI 기술 에디터 · 5분 읽기

핵심 요약

  • DIN Deploy는 ONNX Runtime과 NVIDIA TensorRT RTX를 활용한 C++ 샘플이다.
  • 모델 체크포인트를 ONNX로 변환하여 로컬 C++ 애플리케이션에 통합한다.
  • 자동 음성 인식, 이미지 분할, 이미지 생성 등 다양한 AI 작업을 지원한다.
  • GPU 가속을 통해 CPU 대비 최대 200배 이상 빠른 성능을 제공한다.
  1. 1모델 체크포인트 확보
  2. 2ONNX 모델 변환
  3. 3C++ 애플리케이션 통합
  4. 4하드웨어 가속 실행
한눈에 보는 흐름 · Devin.KR 이 기사 내용을 바탕으로 정리한 도식입니다.

로컬 AI 앱 개발 간소화

NVIDIA는 로컬 애플리케이션에 AI 모델을 통합하는 과정을 간소화하기 위해 오픈소스 C++ 샘플 컬렉션인 'DIN Deploy(Do Inference Now Deploy)'를 공개했다. DIN Deploy는 ONNX Runtime과 NVIDIA TensorRT RTX 실행 공급자를 결합하여, 개발자가 모델 체크포인트부터 Windows 및 Linux 환경에서 하드웨어 가속을 지원하는 네이티브 애플리케이션을 구축할 수 있도록 돕는다.

이 솔루션은 휴대 가능한 모델 형식, 신뢰할 수 있는 런타임, 그리고 대상 시스템 전반에서 작동하는 가속 기능을 제공하여 AI 모델 배포의 격차를 해소한다. ONNX Runtime API는 WinML 2.0을 통해서도 접근할 수 있다.

모델 변환 및 배포의 분리

DIN Deploy의 각 샘플은 Hugging Face에서 모델 체크포인트를 다운로드하고 이를 ONNX 아티팩트로 변환하는 Python 익스포터로 시작한다. 애플리케이션 측면은 ONNX Runtime(ORT)을 기반으로 구축된 네이티브 C++ CLI로 구성된다. 이러한 분리 구조는 모델 변환 로직을 배포 로직과 독립적으로 유지하여, 개발자가 모델별 런타임 없이도 내보낸 모델을 로컬 애플리케이션에 통합할 수 있도록 한다.

대부분의 샘플 코드는 C++에서 ONNX Runtime 세션 및 텐서 API를 사용한다. CUDA API 및 커널을 포함한 공급업체별 코드는 선택적 가속 경로에서만 나타난다. 필요한 ONNX Runtime 텐서 API를 지원하는 실행 공급자는 공유 코드를 실행할 수 있다. ONNX Runtime의 복사 텐서 API는 공유 코드에서 전용 공급업체 API 사용 없이 데이터 지역성을 관리할 수 있도록 지원한다.

다양한 AI 작업 및 성능

DIN Deploy는 다양한 AI 작업을 지원한다. 자동 음성 인식(ASR)의 경우, OpenAI Whisper를 통해 오프라인 전사 기능을 제공하며, NVIDIA Parakeet TDT 및 NVIDIA Nemotron ASR Streaming을 통해 스트리밍 파이프라인을 지원한다. 이 샘플들은 GPU 가속을 활용하여 오디오를 네이티브 애플리케이션으로 처리하고 전사 결과를 반환하는 방법을 보여준다.

이미지 및 비디오 작업에서는 Meta SAM 2.1 샘플이 대화형 마스킹을 지원하며, 모델 출력을 네이티브 애플리케이션에서 선택, 추적 및 기타 컴퓨터 비전 워크플로우에 사용할 수 있는 분할 마스크로 변환한다. FLUX.2-klein-4B 샘플은 프롬프트 기반 이미지 생성을 제공하며, Vulkan 및 DirectX와의 그래픽스 API 상호 운용성을 포함하여 애플리케이션이 GPU 상주 리소스를 교차 공급업체 셰이더 인터페이스와 통합할 수 있도록 한다.

또한 FLUX.2-klein-4B 샘플은 NVIDIA Model Optimizer를 사용한 훈련 후 양자화(PTQ)를 통해 양자화된 ONNX 모델을 생성하는 방법을 시연한다. 양자화는 하드웨어에 따라 다르지만, ONNX 인터페이스가 변경되지 않으므로 양자화된 모델은 애플리케이션 코드 변경 없이 드롭인(drop-in) 방식으로 대체할 수 있다.

DGX Spark에서 측정한 DIN Deploy 워크로드 성능 비교에 따르면, GPU는 CPU 대비 최대 206.41배(FLUX.2-klein-4B) 또는 58.5배(Whisper-tiny) 빠른 성능을 보였다. 오디오 결과는 실시간 배수로 보고되며, 예를 들어 Nemotron ASR Streaming은 GPU에서 38.3 FPS를 달성한 반면 CPU에서는 0.5 FPS에 그쳤다.

개발자 및 사용자 영향

DIN Deploy는 개발자가 AI 모델을 로컬 C++ 애플리케이션에 통합하는 과정을 크게 간소화한다. 모델 변환과 배포 로직을 분리함으로써 개발 복잡성을 줄이고, 최소한의 공급업체별 코드 변경으로 TensorRT RTX를 통한 하드웨어 가속에 접근할 수 있도록 한다. ONNX 모델의 재사용성을 높여 다양한 실행 공급자 환경에서 활용도를 확장한다.

사용자 측면에서는 GPU 가속을 통해 더 빠르고 효율적인 로컬 AI 애플리케이션을 경험할 수 있다. 자동 음성 인식, 이미지 분할, 이미지 생성 등 광범위한 AI 기능을 자신의 기기에서 직접 활용할 수 있게 된다.

적용 조건 및 제약

DIN Deploy를 사용하려면 Windows 또는 Linux 운영체제(x86-64 및 Arm64 변형 포함)가 필요하며, TensorRT RTX 가속을 위해서는 NVIDIA GPU가 필수적이다. 시작하려면 저장소의 CMake 프리셋을 사용하여 프로젝트를 구성하고 빌드한 다음, 모델을 ONNX로 내보내고 TensorRT RTX와 함께 CLI를 실행하거나 코드를 자체 애플리케이션에 복사하여 파이프라인 구현을 사용할 수 있다. CMake는 기본적으로 ONNX Runtime과 TensorRT RTX를 다운로드한다.

DirectX는 Windows에서만 사용할 수 있으며, 양자화는 하드웨어에 따라 다르지만 ONNX 인터페이스가 변경되지 않아 애플리케이션 코드 변경 없이 양자화된 모델을 사용할 수 있다. 이 솔루션은 주로 NVIDIA GPU 환경에서의 하드웨어 가속에 초점을 맞추고 있다.

데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.

출처 · 원문 확인

NVIDIA Developer Blog · Luca Spindler

Build Local AI Apps with C++ and NVIDIA TensorRT RTX Samples

원문 발행: 2026-10-02 02:59:27

원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.

댓글 0

아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.

댓글을 남기려면 로그인이 필요합니다.

← 전체 소식 개발 도구 둘러보기