양자화 2

[기술동향] LLM 추론 최적화 핵심 기술: 양자화, KV 캐시, 추론 칩

kt cloud Azure전환TF 이영호 님 📝 요약 SUMMARY 이 글에서는 에이전틱 AI 확산에 따른 LLM 추론 최적화와 양자화, KV 캐시, 추론 전용 칩의 변화를 다룹니다.제한된 인프라에서 성능과 비용을 함께 고려해야 하는 방향을 정리합니다.#에이전틱AI #LLM추론 #양자화 #KV캐시 #추론전용칩최근 AI 산업의 패러다임은 '학습(Training)' 단계를 넘어 '추론(Inference)'의 효율화로 완전히 넘어가고 있습니다. 이는 단순히 사용자의 질문에 한 번 답하고 끝나는 챗봇을 넘어, AI가 스스로 문맥을 파악하고 연속적인 작업을 수행하는 '에이전틱 AI(Agentic AI)' 시대가 본격적으로 열렸기 때문입니다. Deloitte에 따르면 2023년 전체 AI 컴퓨팅의 약 1/3..

[Tech Series] kt cloud AI 검색 증강 생성(RAG) #4 : 임베딩(Embedding)과 벡터 인덱싱 기술

[ kt cloud 마케팅커뮤니케이션팀 김지웅 님 ] 📋 요약 이 글에서는 RAG 시스템의 핵심 구성 요소인 임베딩 원리, 다국어 모델 선정 전략,그리고 HNSW·DiskANN·GPU 가속·양자화 등 벡터 인덱싱 최적화 기법을 다룹니다.모델의 표현력과 인프라 검색 효율 사이의 트레이드오프를 이해하는 것이실무 RAG 시스템의 품질과 운영 비용을 동시에 결정짓는다는 점을 정리합니다. #RAG #벡터임베딩 #HNSW #DiskANN #양자화들어가며 💭안녕하세요, kt cloud 테크 마케터 김지웅 입니다. 🙋‍♂️RAG를 구축하다 보면 지난 3편에서 다룬 '청킹' 다음으로 반드시 마주하는 거대한 산이 하나 있어요.“문서를 잘게 쪼개긴 했는데, 이걸 도대체 어떤 기준으로 수치화하고(임베딩), 수억 개..