[CloudNeta] Hands-On LLM Serving 5주차 part 2 - LLM 서빙의 발전
이 글은 5주차 연재의 두 번째 편입니다.
- part 1 - 실전 LLM 최적화
- part 2 - LLM 서빙의 발전 (이 글)
들어가며
10장 요약 및 핵심설명
9장에서는 측정과 벤치마크를 바탕으로 LLM 서빙을 최적화하는 실전 절차를 살펴보았습니다. 10장에서는 그 범위를 확장해 시맨틱 캐싱과 성능 프로파일링, 멀티모달 서빙처럼 빠르게 발전하는 LLM 서빙 기술을 다룹니다.
또한 제한된 자원을 활용하는 엣지 AI와 이기종 컴퓨팅, 여러 어댑터를 효율적으로 제공하는 Multi-LoRA, 강화학습 과정의 모델 서빙까지 살펴봅니다. 각 기술이 새로운 워크로드에서 어떤 성능·비용·운영 문제를 해결하는지 이해하는 것이 목표입니다.
아래 내용은 10장에서 다룰 주제와 조사 방향을 정리한 개요입니다. 구체적인 성능 수치와 구현 선택은 관련 자료와 실험을 확인한 뒤 보완합니다.
10장 LLM 서빙의 발전
시맨틱 캐싱
시맨틱 캐싱은 요청 문자열이 완전히 같을 때만 적중하는 캐시의 범위를 넓혀, 의미가 유사한 요청의 이전 결과나 중간 표현을 재사용할 수 있는지 살펴보는 주제입니다. 기존 Prefix caching과 비교해 어떤 단위의 데이터를 저장하고 어떤 기준으로 유사성을 판단하는지 정리합니다.
먼저 임베딩 생성, 유사도 검색, 캐시 적중 판정과 응답 재사용의 흐름을 확인합니다. 이후 유사도 임계값에 따른 오답 가능성, 캐시 무효화, 개인정보와 테넌트 격리, 임베딩 검색 비용을 조사해야 합니다. 실제 도입 여부는 캐시 적중률과 추가 검색 지연시간을 함께 측정해 판단합니다.
성능 프로파일링
성능 프로파일링은 전체 처리량이나 평균 지연시간만 보는 대신 요청 큐, CPU, GPU 커널, 메모리 대역폭, KV 캐시와 네트워크 중 어느 구간에서 시간이 소비되는지 분해하는 과정입니다.
10장에서는 vLLM 지표와 GPU 프로파일러를 이용해 병목을 찾는 흐름을 정리할 예정입니다. 확인할 항목은 TTFT와 ITL, GPU 사용률과 메모리 사용량, 커널별 실행 시간, CPU-GPU 동기화, 배칭 상태와 OOM입니다. 사용할 도구와 수집 방법, 프로파일링 오버헤드는 이후 환경에 맞춰 확인합니다.
멀티모달 서빙
멀티모달 서빙은 텍스트 외에 이미지나 오디오 같은 입력을 함께 처리하는 모델을 서비스하는 주제입니다. 텍스트 토큰만 다루는 서빙과 달리 입력 전처리, 모달리티별 인코더, GPU 메모리 이동, 입력 크기와 처리 시간이 함께 고려되어야 합니다.
이 절에서는 멀티모달 입력이 요청 길이와 배칭, KV 캐시, TTFT에 미치는 영향을 조사합니다. 이미지 해상도나 오디오 길이를 어떻게 제한할지, 전처리를 어디에서 수행할지, 모달리티가 다른 요청을 어떤 방식으로 묶을지는 모델과 프레임워크별로 확인해야 합니다.
엣지 및 이기종 컴퓨팅
엣지 환경은 데이터센터 GPU보다 메모리, 전력, 냉각과 네트워크 조건이 제한적일 수 있습니다. 이기종 컴퓨팅에서는 CPU, GPU, NPU 또는 서로 다른 세대의 가속기가 한 서비스 안에서 역할을 나눌 수 있으므로, 모델 배치와 데이터 이동 비용을 함께 검토해야 합니다.
조사할 내용은 모델 일부의 오프로딩, 정밀도와 모델 크기 조정, 장치별 전처리·추론 분담, 전력당 처리량과 장애 대응입니다. 어떤 구성이 항상 유리한지는 하드웨어와 워크로드에 따라 달라지므로, 장치 호환성·메모리 사용량·지연시간·전력 측정을 통해 확인합니다.
Multi-LoRA 서빙
LoRA는 하나의 기본 모델에 작은 어댑터를 추가해 작업이나 고객별 동작을 제공하는 방식입니다. Multi-LoRA 서빙은 기본 모델을 여러 요청이 공유하면서 요청별 LoRA 어댑터를 선택하는 구조와 그 운영 방법을 다룹니다.
확인할 항목은 어댑터 로딩과 캐시, 요청별 어댑터 스케줄링, 여러 어댑터를 함께 처리할 때의 GPU 메모리와 커널 효율, 어댑터 간 데이터 격리입니다. 어댑터 수와 동시 요청 수가 늘어날 때 처리량과 지연시간이 어떻게 변하는지는 별도 벤치마크로 검증해야 합니다.
강화학습 환경의 LLM 서빙
강화학습에서는 정책 모델이 생성한 여러 응답을 환경에 전달하고 보상이나 평가 결과를 다시 학습 과정에 사용하는 반복이 필요합니다. 이때 서빙 시스템은 일반 사용자 요청과 다른 동시성, 생성 길이, 결과 수집과 동기화 요구를 가질 수 있습니다.
10장에서는 강화학습 환경에서 모델 추론을 담당하는 롤아웃 워커와 학습 워커의 역할, 요청 생성 처리량, GPU 자원 분할과 데이터 전달 흐름을 조사할 예정입니다. 특정 프레임워크나 최적화 기법의 우수성을 확정하기보다, 학습 안정성·샘플 생성 속도·자원 활용률·통신 비용을 어떤 방식으로 평가할지 먼저 정리합니다.
10장 주제별 확인 방향
| 주제 | 우선 확인할 질문 | 검증할 지표 |
|---|---|---|
| 시맨틱 캐싱 | 의미 유사성 판정과 응답 재사용의 정확성은 어떻게 보장하는가? | 캐시 적중률, 추가 검색 지연시간, 오답률 |
| 성능 프로파일링 | 병목이 큐, 커널, 메모리, 네트워크 중 어디에 있는가? | TTFT, ITL, GPU 활용률, 커널 시간 |
| 멀티모달 서빙 | 모달리티별 전처리와 입력 크기를 어떻게 관리하는가? | TTFT, 메모리, 처리량, 입력별 지연시간 |
| 엣지·이기종 컴퓨팅 | 장치별 역할 분담이 전체 비용과 지연시간에 어떤 영향을 주는가? | 전력당 처리량, 메모리, 지연시간, 호환성 |
| Multi-LoRA | 여러 어댑터를 공유 모델 위에서 어떻게 스케줄링하는가? | 어댑터 로딩 시간, 처리량, 메모리, 격리 |
| 강화학습 환경 서빙 | 롤아웃 생성과 학습 사이의 자원·통신 병목은 무엇인가? | 샘플 생성률, 학습 대기시간, GPU 활용률 |
현재 10장은 각 주제의 정의와 문제 설정을 잡는 단계입니다. 이후 공식 문서와 논문, 구현체의 동작을 확인하고 작은 재현 실험을 수행한 뒤, 이 개요를 실제 구성과 측정 결과로 확장합니다.