GPU인프라 2

[기술동향] LLM 추론 최적화 핵심 기술: 양자화, KV 캐시, 추론 칩

kt cloud Azure전환TF 이영호 님 📝 요약 SUMMARY 이 글에서는 에이전틱 AI 확산에 따른 LLM 추론 최적화와 양자화, KV 캐시, 추론 전용 칩의 변화를 다룹니다.제한된 인프라에서 성능과 비용을 함께 고려해야 하는 방향을 정리합니다.#에이전틱AI #LLM추론 #양자화 #KV캐시 #추론전용칩최근 AI 산업의 패러다임은 '학습(Training)' 단계를 넘어 '추론(Inference)'의 효율화로 완전히 넘어가고 있습니다. 이는 단순히 사용자의 질문에 한 번 답하고 끝나는 챗봇을 넘어, AI가 스스로 문맥을 파악하고 연속적인 작업을 수행하는 '에이전틱 AI(Agentic AI)' 시대가 본격적으로 열렸기 때문입니다. Deloitte에 따르면 2023년 전체 AI 컴퓨팅의 약 1/3..

[기술동향] 2026 피지컬 AI 확산과 AI 데이터센터(AIDC) 인프라 전망

[ kt cloud Cloud 컨설팅팀 심대섭 님 ] 📋 요약 이 글에서는 피지컬 AI의 핵심 개념과 현장 운영 루프, 그리고 이를 뒷받침하는AI 데이터센터(AIDC) 인프라의 설계 요건과 2026년 전망을 다룹니다.GPU 중심의 단편적 시각을 넘어 스토리지·네트워크·전력·냉각까지 통합 설계가실제 확산 속도와 운영 경쟁력을 결정짓는 핵심 변수임을 정리합니다.#피지컬AI #AIDC #AI데이터센터 #GPU인프라 #엣지AI운영 1. CES 2026에서 로봇은 왜 다시 주목받았을까요?CES 2026에서 로봇이 다시 주목받은 건, 이제 로봇이 ‘보여주는 기술’에서 ‘현장에 쓰는 기술’로 옮겨가고 있기 때문입니다. 흥미로운 장면은 일부 보도에서 자동차 회사인 현대차의 전시가 “자동차 전시”보다 ..