공식 기술글 공개일: 2026년 9월 9일 · 확인일: 2026년 9월 13일
NVIDIA가 Dynamo를 이용한 멀티모달 추론의 Encode-Prefill-Decode(EPD) 분리 방식을 설명하는 기술글을 공개했습니다. 새 모델 출시 소식이 아니라 이미지 처리와 언어 모델 실행을 배치하는 방법에 관한 개발 소식입니다.
EPD 분리가 다루는 문제
공식 글은 비전 인코딩과 언어 모델의 prefill·decode 작업을 분리하여 각 작업의 대기열·배치·확장을 따로 다루는 방식을 설명합니다. 이미지가 많은 요청이 동일 워커의 다른 요청을 지연시키는 상황을 주요 배경으로 제시합니다. NVIDIA 공식 기술글
인코더 워커를 나눈다는 것이 언제나 별도 GPU를 전용으로 배정한다는 뜻은 아닙니다. NVIDIA는 같은 GPU에 워커를 함께 두는 구성과 다른 GPU 계층에 인코더를 배치하는 구성을 구분합니다. 입력 미디어 양, 출력 길이와 모델 구성에 따라 효과가 달라진다고 설명합니다. EPD 구성 설명
첫 응답 시간과 전체 완료 시간 구분하기
다음은 위 내용을 읽을 때 사용할 개발 관점의 해석입니다. 이미지 검사가 시작된 뒤 첫 글자가 보이는 시간과, 검사 결과 전체가 완성되는 시간은 다른 지표입니다. 짧은 상태 메시지에서는 첫 응답이 빨라지는 효과가 크게 느껴질 수 있지만 긴 보고서를 생성한다면 이후 생성 단계가 전체 시간을 지배할 수 있습니다.
따라서 “응답이 빨라졌다”는 결과만 보기보다 첫 토큰 시간, 출력이 이어지는 간격과 전체 완료 시간을 나눠 측정하는 것이 좋습니다. 글의 성능 수치를 자기 시스템의 보장값으로 사용하지 말고, 입력과 출력 조건이 실제 서비스와 비슷한지 먼저 비교해야 합니다.
카메라·IoT 서비스에서 제안하는 평가
다음 항목은 자체 평가 제안이며 NVIDIA의 실험을 재현한 결과가 아닙니다. 장치 상태를 텍스트로 조회하는 요청과 카메라 이미지를 분석하는 요청을 같은 서비스에서 처리한다면, 두 종류를 따로 보낼 때와 섞어서 보낼 때를 비교할 수 있습니다.
| 시험 입력 | 확인할 질문 |
|---|---|
| 텍스트 상태 조회만 | 기본 지연과 처리 가능한 요청 수는 얼마인가? |
| 단일 이미지와 짧은 답변 | 이미지 처리 구간이 전체 시간에서 차지하는 비중은? |
| 여러 이미지와 긴 보고서 | 입력 처리와 출력 생성 중 어디에서 시간이 늘어나는가? |
| 텍스트·이미지 혼합 | 이미지 부하 때문에 상태 조회도 늦어지는가? |
각 조건에서 같은 모델·출력 길이 제한·동시 요청 수를 유지하고, 느린 요청의 지연도 함께 기록합니다. GPU 배치만 바꿔 놓고 모델이나 입력 크기까지 달라지면 무엇 때문에 결과가 달라졌는지 구분하기 어렵습니다.
배치 변경 전에 볼 운영 정보
카메라 서비스의 지연에는 이미지 획득, 전송, 디코딩과 모델 실행이 모두 포함될 수 있습니다. 작업을 분리한 뒤에도 앞단에서 이미 대부분의 시간을 쓰고 있다면 사용자가 체감하는 개선은 제한적일 수 있습니다. 각 구간의 시작·완료 시각을 먼저 기록하면 최적화 대상을 고르는 데 도움이 됩니다.
워커를 추가하면 큐와 결과 전달 경로도 늘어납니다. 요청 ID로 이미지 입력과 결과를 연결하고, 워커가 응답하지 않을 때의 시간 제한과 취소 정책을 확인해야 합니다. 성능 시험과 함께 잘못된 이미지, 연결 중단, 입력 폭주에서 최종 오류가 어떻게 전달되는지도 살펴볼 수 있습니다.
이번 소식의 실무적 의미는 입력과 출력의 성격에 맞춰 추론 단계를 평가할 수 있다는 데 있습니다. 이 글에서는 Dynamo나 특정 GPU로 별도 벤치마크를 수행하지 않았습니다. 구체적인 구현과 실험 구성은 공식 글에 연결된 문서·저장소에서 확인하세요.