LLM KV Cache는 왜 계속 메모리를 추가로 요구하는가?

LLM KV Cache

LLM을 실행할 때 모델의 크기만 확인하고 필요한 메모리를 계산하면 실제 실행 환경에서는 예상과 다른 결과가 나온다.모델의 가중치는 로딩이 끝나면 크게 변하지 않지만, 추론 과정에서 사용하는 KV Cache는 Context가 늘어날수록 계속 증가하기 때문이다. 그 중심에 있는 것이 LLM KV Cache다.LLM KV Cache는 LLM의 토큰 생성 속도를 높이기 위해 반드시 필요한 구조이면서, 동시에 추론 과정에서 메모리를 계속 … 더 읽기

AI 추론 엔진은 어떻게 만드는가

AI 추론 엔진

대부분의 사람은 AI 모델을 다운로드하면 곧바로 AI를 실행할 수 있다고 생각한다. 하지만 모델 파일은 실행 프로그램이 아니다. 모델에는 수많은 가중치와 텐서가 저장되어 있을 뿐이고, 이를 CPU나 GPU에서 실제 연산으로 바꾸어 토큰을 생성하려면 별도의 실행 구조가 필요하다. 나 역시 CPU에서 LLM을 직접 실행하는 Runtime을 개발하면서 이 문제를 처음부터 다시 살펴보게 되었다. 처음에는 Matrix 연산에서 시작했지만, Tensor와 … 더 읽기

AI 추론 라이브러리와 런타임의 종류와 특징

AI 추론 라이브러리와 런타임

학습이 끝난 AI 모델을 실제 서비스나 장치에서 실행하기 위해서는 모델 파일만 가지고는 부족하다. 모델의 연산을 실제 CPU, GPU, NPU 등의 하드웨어에서 수행하도록 연결해 주는 추론 런타임이 반드시 필요하다. 구조는 단순하다. AI 모델에서 시작해 AI 추론 라이브러리를 거쳐 CPU, GPU, NPU 같은 하드웨어로 전달되어 결과가 나온다. 이 중간 다리 역할을 하는 런타임이 무엇이냐에 따라 실제 구동 … 더 읽기

CPU AI 추론 원리 그리고 방법

CPU AI 추론 원리와 방법

인공지능은 고가의 GPU가 없어도 CPU와 RAM만으로 추론할 수 있다. CPU 멀티코어와 메모리 대역폭, 양자화 기술을 활용하면 경량 AI 모델을 저비용으로 실행할 수 있으며, 이는 GPU와 CPU의 역할을 분산해 AI 인프라 비용을 낮추는 방법이 될 수 있다. 나아가 CPU 기반 추론은 Edge AI와 Physical AI로 확장하기 위한 중요한 기반이 된다. CPU AI 추론 기본 원리 인공지능 … 더 읽기

AI Computer Use 뜻, 정의 그리고 AI Agent가 컴퓨터를 직접 조작하는 시대

AI Computer Use 정의뜻

AI가 텍스트로 답하는 것을 넘어 화면을 직접 보고 마우스와 키보드를 조작하는 시대가 열렸다. AI Computer Use는 화면을 이해하고 필요한 작업을 스스로 수행하는 기술이다.이제 AI Agent는 API가 없는 웹사이트와 프로그램까지 직접 조작하며 인간의 컴퓨터 사용 방식을 대신하기 시작했다. AI Agent와 API·Tool 현대적인 디지털 서비스들은 개발자를 위해 API라는 정돈된 통로를 열어둔다. 애플리케이션끼리 서로 데이터를 주고받으며 매끄럽게 맞물리도록 … 더 읽기

AI Agent 시대, 대한민국의 디지털 생태계는 살아남을 수 있을까

AI Agent 시대 대한민국의 디지털 생태계

인공지능의 경쟁력은 더 똑똑한 모델을 만드는 데 있지 않다. 사용자의 말을 알아듣고 직접 일을 처리하는 에이전트와, 그 뒤에 촘촘하게 엮인 생태계 싸움에서 판도가 갈린다. AI Agent란 무엇인가? 챗봇에서 실행형 AI로의 진화 지금까지 생성형 AI의 역할은 대개 질문에 답을 해주는 선에 머물러 있었다. 사용자가 무언가를 물어보면 AI는 방대한 데이터를 뒤져 정보를 찾아내고 글을 요약하거나 코드를 짜주었다. … 더 읽기

2026년 중국 AI 모델 성능 비교

2026 중국 AI 모델 성능비교

2026년 중국 AI 모델 성능은 더 이상 미국 AI를 뒤쫓는 추격자라는 말만으로 설명하기 어렵다. 일부 모델은 미국 최상위 모델과 직접 비교할 수 있는 수준까지 올라왔고, 낮은 비용과 오픈웨이트 전략, 빠른 서비스 적용을 앞세워 실제 개발 시장에서도 영향력을 확대하고 있다. DeepSeek를 비롯해 Tencent, Xiaomi, Z.ai, MiniMax, Moonshot AI 등 여러 기업이 동시에 글로벌 시장에서 경쟁하고 있다. … 더 읽기

AI Engineering의 시작은 모델 선택이다.

AI Engineering 의 시작은 모델 선택이다

서비스 목적에 맞는 모델을 고르는 일은 AI 개발의 성패를 가르는 첫 단추다. 비용과 속도부터 프롬프트 준수 능력까지 실제 현업에서 부딪히는 기준들을 짚어본다. AI 서비스를 처음 만들 때 개발자들이 가장 먼저 마주하는 고민은 모델 선택이다. 무조건 성능이 뛰어난 모델을 쓰면 감당하기 힘들 정도로 운영비가 불어난다. 반대로 비용만 아끼려다 보면 사용자 이탈이 생겨 곤란해진다. 현업에서 서비스를 굴려보면 … 더 읽기

Gemini Robotics ER 2, 로봇의 두뇌는 어떻게 진화했나?

gemini robotics ER 2

제미나이 로보틱스 ER 2(Gemini Robotics ER 2)는 로봇이 단순히 움직이는 단계를 넘어, 현실 공간을 이해하고 스스로 계획하며 판단하는 체화 추론(Embodied Reasoning) 모델이다. 물리적 세계에서 장기 작업을 수행하기 위한 로봇의 두뇌 역할을 담당한다. 기존 로봇은 계획을 모두 끝낸 뒤 움직였다. 반면 Gemini Robotics ER 2는 작업을 수행하는 동안에도 다음 행동을 계속 계산한다. 즉, 움직이면서 동시에 생각하는 … 더 읽기

제미나이 로보틱스 2(Gemini Robotics 2), 1세대와 무엇이 달라졌나?

gemini robotics 2, 1세대와 차이점

구글 딥마인드가 내놓은 제미나이 로보틱스 2(Gemini Robotics 2)는 단순한 제어 기술의 업데이트를 넘어, AI가 가상 세계를 벗어나 물리적 현실에서 실제로 일하는 실행 계층으로 진화했음을 보여주는 결정적 분기점이다. 제미나이 로보틱스 2(Gemini Robotics 2), 1세대 차이점 분석 왜 2세대가 나왔을까 1세대 로보틱스 모델은 언어와 시각 정보를 바탕으로 로봇의 행동을 지시하는 가능성을 보여주었다. 하지만 복잡하고 긴 호흡의 작업을 … 더 읽기

0%