AI 추론 라이브러리와 런타임의 종류와 특징

학습이 끝난 AI 모델을 실제 서비스나 장치에서 실행하기 위해서는 모델 파일만 가지고는 부족하다. 모델의 연산을 실제 CPU, GPU, NPU 등의 하드웨어에서 수행하도록 연결해 주는 추론 런타임이 반드시 필요하다.

구조는 단순하다. AI 모델에서 시작해 AI 추론 라이브러리를 거쳐 CPU, GPU, NPU 같은 하드웨어로 전달되어 결과가 나온다. 이 중간 다리 역할을 하는 런타임이 무엇이냐에 따라 실제 구동 속도와 효율이 크게 달라진다.



llama.cpp 기반 CPU 로컬 LLM 추론

앞서 살펴본 것처럼 CPU 환경에서 대형 모델을 돌릴 때 가장 먼저 마주하는 AI 추론 라이브러리 프로젝트가 바로 llama.cpp다.

이 라이브러리는 CPU에서 LLM을 실행하는 대표적인 오픈소스 도구다. GGUF 포맷과 다양한 양자화 방식을 활용해 저사양 환경에서도 모델을 구동할 수 있다. x86 CPU의 AVX 명령어와 ARM의 NEON을 적극 활용하며, 필요에 따라 GPU와 혼합해서 쓰는 것도 가능하다.

실제로 로컬 환경에서 대형 모델을 가볍게 테스트할 때 추가적인 인프라 구축 비용을 아껴준다. C/C++ 기반으로 작성되어 가볍고 의존성이 적기 때문에, 임베디드 장치나 개인 PC에서 빠르게 실행 파일을 빌드하여 붙여보기에 유리하다.

거대한 서버 자원을 동원하기 어려운 개발 단계나 개인 연구 환경에서 가장 진입 장벽이 낮은 도구다. 무거운 프레임워크를 가볍게 구성 할 수 있어 현장에서 즉시 디버깅하기에도 직관적이다.

관련 링크:llama.cpp 공식 GitHub

  • 총평: CPU 기반 로컬 LLM 추론에서 널리 사용되는 대표적인 오픈소스 추론 엔진이다. 하드웨어 아키텍처 한계상 대규모 동시 요청 처리나 초고속 토큰 생성 속도 측면에서는 고성능 GPU 스택에 비해 밀리기 때문이다.


ONNX Runtime 다양한 하드웨어 호환성

실무에서 자주 쓰이는 ONNX Runtime은 특정 하드웨어에 종속되지 않는다는 강력한 장점이 있다.

이 AI 추론 라이브러리는 Execution Provider라는 구조를 통해 다양한 하드웨어에서 모델을 실행한다. CPU뿐만 아니라 CUDA, TensorRT, OpenVINO, DirectML, 모바일 엣지 환경까지 유연하게 연결된다. 같은 추론 API를 그대로 유지하면서 실행 하드웨어만 바꿔 끼울 수 있어 범용성이 높다.

모델을 ONNX라는 표준 형식으로 변환해 두면 다양한 하드웨어 환경에서 동일한 추론 API를 활용할 수 있어 배포와 유지보수가 편리하다. 모델을 표준 포맷으로 고정해 두고, 현장 서버의 하드웨어 스펙이 바뀌더라도 코드 수정 없이 백엔드 실행 모듈만 교체하면 된다는 실용적인 이점이 있다.

다양한 벤더의 하드웨어를 혼용하는 기업 인프라 환경에서 유지보수 비용을 크게 낮춰준다. 특정 칩셋에 종속되지 않는 독립적인 아키텍처를 구성할 때 핵심적인 역할을 담당한다.

관련 링크:ONNX Runtime 공식 홈페이지

총평: 하드웨어 제조사를 가리지 않고 다양한(CPU, GPU, NPU)에서 일관된 API로 모델을 돌릴 수 있는 엄청난 범용성을 가졌으나, 특정 하드웨어에 100% 최적화된 전용 런타임에 비해서는 미세한 오버헤드가 발생할 수 있다.


OpenVINO 인텔 하드웨어 최적화 추론

인텔 환경을 주력으로 쓴다면 OpenVINO가 핵심 선택지가 된다.

인텔 CPU뿐만 아니라 내장 GPU와 NPU까지 폭넓게 지원하는 AI 추론 라이브러리다. 단일 장치 실행에 멈추지 않고 AUTO나 HETERO 같은 방식을 통해 하드웨어를 유연하게 선택하거나 작업을 분산할 수 있다. 인텔 하드웨어의 특성에 맞춘 저수준 최적화가 잘 되어 있어, CPU에서 엣지 NPU로 이어지는 흐름을 구현하기에 적합하다.

인텔 CPU가 탑재된 일반 PC나 서버 환경에서 별도의 고성능 그래픽카드 없이도 극대화된 연산 효율을 뽑아낼 수 있다. 모델 양자화와 그래프 최적화 기능을 자체적으로 강력하게 지원하여, 배포 시점에 모델 용량을 줄이고 처리 속도를 눈에 띄게 끌어올린다.

특히 엣지 컴퓨팅이나 산업용 PC처럼 인텔 기반 하드웨어가 고정되어 있는 현장에서 독보적인 성능을 발휘한다. 하드웨어 리소스가 제한된 환경에서 AI 추론의 병목을 최소화하는 데 실질적인 도움을 준다.

관련 링크:OpenVINO 공식 홈페이지

총평: 인텔 하드웨어에서 가장 강력한 최적화를 제공하지만, 인텔 이외의 하드웨어에서는 활용 범위가 제한적이다.


vLLM 대규모 LLM 서버 서빙

llama.cpp가 로컬 PC나 개인 장치에 초점을 맞춘다면, vLLM은 대규모 서버 환경을 위한 AI 추론 라이브러리다.

수많은 사용자의 요청이 동시에 들어올 때 이를 효율적으로 처리하는 구조와 OpenAI 호환 API를 제공한다. llama.cpp가 로컬 환경에서 LLM을 실행하는 데 강점이 있다면, vLLM은 여러 사용자의 요청을 동시에 처리해야 하는 서버 환경에서 LLM을 효율적으로 서빙하는 데 초점을 둔다. 서버 환경에서 다중 요청을 안정적으로 소화해야 할 때 주로 찾게 된다.

대규모 동시 접속 환경에서 메모리 낭비를 줄여주는 핵심 기술이 적용되어 있다. 메모리 관리 기법을 통해 대화형 서비스에서 발생하는 불필요한 자원 소모를 막고, 단위 시간당 처리할 수 있는 토큰 처리량을 극대화한다.

실제 상용 서비스를 운영하는 백엔드 서버에서 대형 언어 모델을 API 형태로 안정적으로 서빙할 때 사실상의 표준처럼 쓰인다. 트래픽 변동이 심한 프로덕션 환경에서 서버 자원을 효율적으로 태우는 데 필수적이다.

관련 링크:vLLM 공식 GitHub

  • 총평: 동시 다발적인 사용자 트래픽을 처리하는 대규모 서버 환경에서 메모리 효율과 처리 속도를 극단적으로 끌어올려 주며 프로덕션 환경 검증이 가장 잘 된 서빙 엔진같다.


TensorRT-LLM 엔비디아 GPU 최적화

GPU 진영에서 고성능을 뽑아내야 할 때는 엔비디아의 TensorRT-LLM AI 추론 라이브러리가 쓰인다.

앞서 다룬 CPU 추론 스택들과는 정반대 지점에 있는 대표적인 GPU 전용 최적화 라이브러리다. 하드웨어의 성능을 한계까지 끌어올려 대규모 모델의 응답 속도를 극대화하는 데 특화되어 있다. 결국 CPU에 최적화된 방식과 GPU에 최적화된 방식이 서로 다를 수밖에 없는 이유다.

엔비디아 하드웨어 아키텍처의 특성을 깊게 파고들어 연산 커널을 융합하고 지연 시간을 최소화한다. 대형 모델을 다룰 때 발생하는 메모리 병목을 하드웨어 레벨에서 우회하며, 대규모 클러스터 환경에서 최고 수준의 처리 성능을 보장한다.

비용이 높더라도 무조건적인 속도와 대규모 처리량을 확보해야 하는 엔터프라이즈 AI 인프라의 핵심 축을 담당한다. GPU 자원을 가장 극단적으로 짜내어 효율을 만들어내는 전문적인 스택이다.

관련 링크:TensorRT-LLM NVIDIA Developer

  • 총평: 엔비디아 GPU 하드웨어의 성능을 뼈 속까지 쥐어짜 내어 상상 이상의 추론 속도와 처리량을 뽑아내기 때문에, NVIDIA GPU 환경에서 LLM의 추론 성능과 처리량을 극대화하기 위한 대표적인 최적화 스택이다.


ExecuTorch 모바일 엣지 AI 실행

물리적인 장치나 임베디드 환경으로 시선을 넓히면 ExecuTorch AI 추론 라이브러리가 등장한다.

거대한 데이터센터용 서버 모델보다는 모바일 기기, 임베디드 장치, 엣지 하드웨어에서 AI를 직접 실행하는 데 목적을 둔다. 제한된 전력과 자원 안에서 모델을 가볍게 구동하기 위한 구조를 갖춘다.

파이토치 생태계와 긴밀하게 연결되어 있어, 연구 단계에서 학습한 모델을 모바일이나 임베디드 타겟 기기로 곧바로 이식하기 수월하다. 엣지 장치에서 실행할 수 있도록 경량화된 런타임 구조를 제공한다.

스마트폰, 웨어러블, 스마트 홈 기기 등 네트워크 연결이 불안정하거나 실시간 응답이 필수적인 온디바이스 AI 환경에서 실질적인 실행 대안을 제시한다. 클라우드를 거치지 않고 기기 자체에서 모델을 돌리는 구조를 완성한다.

관련 링크:ExecuTorch 공식 홈페이지

  • 총평: 모바일 및 엣지 환경에 특화되어 가볍고 임베디드 장치 제어에 탁월하지만, 복잡하고 거대한 언어 모델을 모바일에서 단독으로 돌리기에는 여전히 하드웨어적 제약이 따른다.


Apple MLX 애플 실리콘 전용 프레임워크

맥이나 애플 실리콘 환경을 활용한다면 MLX AI 추론 라이브러리를 빼놓을 수 없다.

애플 실리콘의 통합 메모리 구조를 활용하도록 설계된 머신러닝 프레임워크다. 파이썬뿐만 아니라 C, C++, Swift API를 지원해 맥 환경에 깊게 녹아든다. 다만 전반적인 서버 생태계보다는 애플 기기 중심의 실험에 가깝다.

Apple Silicon의 통합 메모리 구조를 활용해 CPU와 GPU 사이의 데이터 이동 비용을 줄이고, 동일한 메모리 공간에서 연산을 수행할 수 있도록 설계됐다. 애플 실리콘의 하드웨어 특성을 그대로 이어받아, 맥북 환경에서 로컬 모델을 실험하고 구동할 때 독보적인 직관성과 속도를 보여준다.

애플 생태계 내에서 개인 개발자나 연구원들이 로컬 LLM이나 비전 모델을 가볍게 테스트하고 검증하는 용도로 자리를 잡아가고 있다. 맥북 하나로 온디바이스 AI 실험을 완결 짓고 싶을 때 유용한 도구다.

관련 링크:Apple MLX 공식 GitHub

  • 총평: 애플 실리콘의 통합 메모리 구조를 극한으로 활용해 맥 환경에서는 엄청난 효율과 속도를 보여주지만, 애플 실리콘의 통합 메모리 구조를 적극 활용할 수 있다는 장점이 있지만, Apple Silicon 중심의 프레임워크라는 점에서 다른 하드웨어 환경으로의 확장에는 제약이 있다.


주요 AI 추론 라이브러리 비교

라이브러리주요 환경성능 별점핵심 목적관련 링크
llama.cppCPU / GPU★★★★☆ (4.0)로컬 LLM 추론GitHub
ONNX RuntimeCPU / GPU / NPU / Edge★★★★☆ (4.5)범용 모델 실행공식 홈페이지
OpenVINOCPU / GPU / NPU★★★★☆ (4.0)인텔 최적화 추론공식 홈페이지
vLLMGPU / CPU★★★★★ (4.8)LLM 서버 및 대규모 서빙GitHub
TensorRT-LLMNVIDIA GPU★★★★★ (5.0)고성능 LLM 추론Developer
ExecuTorch모바일 / Edge★★★★☆ (4.0)온디바이스 AI공식 홈페이지
MLXApple Silicon★★★★☆ (4.2)애플 환경 AIGitHub

AI 추론 라이브러리의 선택 기준

AI 추론 라이브러리는 단순히 모델을 실행하는 프로그램이 아니다. 모델과 하드웨어 사이에서 연산을 최적화하고, CPU와 GPU, NPU의 성능을 실제 서비스로 연결하는 핵심 소프트웨어 계층이다. 무엇을 쓰느냐에 따라 인프라 구성과 비용이 완전히 달라진다.


[글에서 사용한 머리 아픈 용어]

  • Execution Provider: ONNX Runtime에서 특정 하드웨어의 연산 장치와 통신할 수 있도록 연결해 주는 백엔드 실행 모듈입니다.
  • 추론 런타임: 학습이 끝난 AI 모델 파일을 하드웨어가 이해할 수 있는 명령어로 변환하고 실제로 연산이 실행되도록 관리하는 소프트웨어 실행 환경입니다.

※ 특정 산업이나 자산에 대한 투자 판단은 본인의 책임 하에 신중히 결정하시기 바랍니다.

0%