LM Studio MTP로 로컬 LLM 추론 속도 2배 높이기: Gemma 4 & Qwen3 세팅 완전 가이드
로컬에서 LLM을 돌리다 보면 결국 속도의 벽을 만난다. 모델 크기를 키울수록 응답이 느려지고, 빠른 소형 모델로 타협하면 품질이 아쉽다. MTP(Multi-Token Prediction) 기반 Speculative Decoding은 이 딜레마를 꽤 영리하게 피해가는 방법이다. 품질은 그대로 두고 속도만 높이는 기법인데, 이제 LM Studio에서 UI 몇 번 클릭만으로 켤 수 있다. LM Studio가 v0.3.10에서 Speculative Decoding을 정식 도입한 것은 2025년 … 더 읽기