Ollama와 llama.cpp, 같은 엔진인데 왜 속도가 다를까
로컬 LLM을 써본 사람이라면 한 번쯤 이런 의문을 품는다. Ollama가 내부적으로 llama.cpp를 쓴다고 하는데, 왜 직접 llama.cpp를 빌드해서 실행하면 더 빠른 경우가 생기는 걸까. 같은 엔진 위에서 돌아가는 거라면 결과도 같아야 하지 않나. 사실 Ollama는 llama.cpp를 그대로 가져다 쓰지 않는다. 정확하게는 llama.cpp의 C++ 코어를 Go로 작성된 서버 레이어로 감싼 형태다. 사용자가 ollama run 명령을 실행하면 … 더 읽기