LLM KV Cache는 왜 계속 메모리를 추가로 요구하는가?

LLM KV Cache

LLM을 실행할 때 모델의 크기만 확인하고 필요한 메모리를 계산하면 실제 실행 환경에서는 예상과 다른 결과가 나온다.모델의 가중치는 로딩이 끝나면 크게 변하지 않지만, 추론 과정에서 사용하는 KV Cache는 Context가 늘어날수록 계속 증가하기 때문이다. 그 중심에 있는 것이 LLM KV Cache다.LLM KV Cache는 LLM의 토큰 생성 속도를 높이기 위해 반드시 필요한 구조이면서, 동시에 추론 과정에서 메모리를 계속 … 더 읽기

AI 추론 엔진은 어떻게 만드는가

AI 추론 엔진

대부분의 사람은 AI 모델을 다운로드하면 곧바로 AI를 실행할 수 있다고 생각한다. 하지만 모델 파일은 실행 프로그램이 아니다. 모델에는 수많은 가중치와 텐서가 저장되어 있을 뿐이고, 이를 CPU나 GPU에서 실제 연산으로 바꾸어 토큰을 생성하려면 별도의 실행 구조가 필요하다. 나 역시 CPU에서 LLM을 직접 실행하는 Runtime을 개발하면서 이 문제를 처음부터 다시 살펴보게 되었다. 처음에는 Matrix 연산에서 시작했지만, Tensor와 … 더 읽기

AI 추론 라이브러리와 런타임의 종류와 특징

AI 추론 라이브러리와 런타임

학습이 끝난 AI 모델을 실제 서비스나 장치에서 실행하기 위해서는 모델 파일만 가지고는 부족하다. 모델의 연산을 실제 CPU, GPU, NPU 등의 하드웨어에서 수행하도록 연결해 주는 추론 런타임이 반드시 필요하다. 구조는 단순하다. AI 모델에서 시작해 AI 추론 라이브러리를 거쳐 CPU, GPU, NPU 같은 하드웨어로 전달되어 결과가 나온다. 이 중간 다리 역할을 하는 런타임이 무엇이냐에 따라 실제 구동 … 더 읽기

CPU AI 추론 원리 그리고 방법

CPU AI 추론 원리와 방법

인공지능은 고가의 GPU가 없어도 CPU와 RAM만으로 추론할 수 있다. CPU 멀티코어와 메모리 대역폭, 양자화 기술을 활용하면 경량 AI 모델을 저비용으로 실행할 수 있으며, 이는 GPU와 CPU의 역할을 분산해 AI 인프라 비용을 낮추는 방법이 될 수 있다. 나아가 CPU 기반 추론은 Edge AI와 Physical AI로 확장하기 위한 중요한 기반이 된다. CPU AI 추론 기본 원리 인공지능 … 더 읽기

Context Engineering(컨텍스트 엔지니어링), 좋은 AI는 좋은 Context에서 시작한다.

context engineering 좋은 AI는 좋은 context에서 시작된다

AI의 성능은 프롬프트만으로 결정되지 않는다. 실제 서비스 수준을 좌우하는 것은 컨텍스트의 품질이다. 이러한 컨텍스트를 설계하고 관리하는 기술이 바로 Context Engineering(컨텍스트 엔지니어링)이다. 질문만으로 답을 찾지 못하는 이유 흔히 사용자가 질문을 던지면 AI가 곧바로 정답을 꺼내온다고 생각한다. 실제 개발 환경에서는 완전히 다른 방식으로 작동한다. 사용자의 질문은 가공되지 않은 원석에 불과하다. 여기에 인공지능이 참고해야 할 주변 정보가 더해져야 … 더 읽기

중국 AI 반도체 기술은 어디까지 왔을까? 화웨이 어센드가 보여준 현실

중국 AI 반도체 어디까지 왔나

중국 AI 반도체 기술은 미국에 뒤처져 있다는 평가를 받는다. 그러나 이들은 미세 공정 경쟁 대신 설계부터 생산, 패키징까지 이어지는 독자적인 AI 생태계를 통째로 구축하는 다른 길을 선택했다. 미래 AI 시장은 성능 경쟁과 함께 자립된 공급망 경쟁이 동시에 진행되며, 미국과 중국을 중심으로 한 두 개의 AI 생태계가 형성될 가능성이 커지고 있다. 미국이 중국 반도체의 손발을 묶은 … 더 읽기

일상화되어 버린 중국 AI 기술, 그리고 중국 AI 제품 시장

중국 AI 기술 일상화 중국 AI 제품 시장의 현실

최근 중국은 기술 연구실에 머물던 인공지능을 일반 소비자가 구매하는 중국 AI 제품으로 빠르게 전환시키고 있다. 국내에서는 연구개발이나 시범 사업의 형태로 접하는 경우가 많은 AI 기능들이, 중국에서는 이미 10만 원대 하드웨어에 탑재되어 판매되는 사례를 어렵지 않게 찾아볼 수 있다. 결국 미래 AI 경쟁은 모델의 지능 순위가 아니라, 누가 더 저렴하고 빠르게 물리적 제품에 AI를 이식하느냐의 싸움으로 … 더 읽기

화웨이 어센드(Huawei Ascend)의 반격, 엔비디아 독주에 브레이크가 걸리기 시작했다

화웨이 어센드(Huawei Ascend) 엔비디아-독주-브레이크

화웨이 어센드(Huawei Ascend)는 일반 PC용 그래픽카드가 아니라 AI 서버에 장착되는 AI 반도체다.데이터센터에서 수백~수천 개를 연결해 ChatGPT 같은 AI를 학습하고 서비스를 제공하는 데 사용된다.즉, 우리가 AI에게 질문하면 뒤에서 답을 계산해 주는 ‘AI 전용 엔진’이라고 생각하면 된다. 화웨이 어센드는 단순한 AI 반도체가 아니라, 미국의 수출 규제에 맞서 중국이 구축한 독자적인 AI 생태계의 중심 축이다. 핵심 경쟁력은 단일 … 더 읽기

AI Token 비용 줄이는 방법, API와 AI 코딩 도구 최적화 전략

한글-프롬프트-최적화-전략

AI Token 비용 줄이는 방법은 생성형 AI를 업무에 활용하는 기업과 개발자라면 반드시 알아야 할 최적화 전략이다. ChatGPT나 Claude 같은 AI는 글자 수가 아니라 토큰(Token) 수를 기준으로 비용을 계산한다. 같은 의미라도 한글과 영어의 토큰 수는 크게 달라질 수 있으며, 프롬프트 구조를 조금만 개선해도 API 비용과 응답 속도를 함께 줄일 수 있다. 이러한 문제를 해결하기 위해 현업에서는 … 더 읽기

MCP(Model Context Protocol), 피지컬 AI가 세상과 연결되는 방법

AI가-세상과-연겨되는-인터페이스-MCP

생각만 하던 인공지능이 마침내 현실 세계의 기계를 움직이기 시작했다.그동안 디지털 화면에 갇혀 있던 AI 두뇌에 현실과 연결되는 강력한 손발이 생겼다.그 핵심 열쇠인 MCP(Model Context Protocol)가 바꾸어 놓을 피지컬 AI의 미래와 그 이면을 알아본다. AI가 똑똑해도 공장 설비를 못 멈춘 이유 인공지능은 그동안 방대한 지식을 뽐냈지만 정작 현실의 기계 하나 제대로 움직이지 못했다. 챗GPT에게 공장 온도가 … 더 읽기

0%