간단한 로컬 LLM TEST
AI 에이전트 시대가 도래했습니다.
이 시기는 “토큰을 충분히 준비해야 한다”는 의미로,
사용량이 많아질수록 비용도 늘어납니다.
평소 “싸고 좋은 것은 없다는 말이 맞다”라고 생각해 왔습니다.
그러나 IT 분야에서는 "싸고 좋은 것은 많은데 불편해서 못 쓴다"고 생각합니다.
로컬 모델이 무료인 것처럼 보이지만 성능 대비 비용과 기회비용 등을
종합해 보면 GPT, Claude, Gemini 같은 클라우드 서비스가 더 경제적입니다.
그럼에도 OPEN CODE, Hermes Agent 와 같은 오픈소스에
로컬 LLM을 연결해 24시간 돌려 보고 싶다는 욕구가 있었습니다.
그러던 중 최근 시간적 여유가 생겨서 로컬LLM 등을 테스트 해 보았습니다.
[시스템 사양]
프로세서 Intel(R) Core(TM) i7-14700F(2.10 GHz)
설치된 RAM 16.0GB(15.8GB 사용 가능)
그래픽 카드 AMD Radeon RX 9060 (8 GB)
저장소 932 GB 중 614 GB이(가) 사용됨
시스템 종류 64비트 운영 체제, x64 기반 프로세서
[운영 체제]
windows 11에서 LM Studio 0.4.20 사용
[시험 모델]
로컬 LLM
gemma-4-26B-A8B-IT-QAT-GGUF
gpt-oss-20b-GGUF
Nvdia-Nemotron-3-Nano-4b-GGUF
Qwen3-Coder-30B-A3B-lnstruct-GGUF
대형 모델
Claude SonNet 5.0 중간 등
[시험 출제 및 채점 모델]
Gpt 5.5 Sol 중간
[시험 분야]
파이썬 : 4단계
TypeScript : 1 단계
[시험 결과]
파이썬(4단계 마지막 문제 점수)
gemma-4-26B-A8B-IT-QAT-GGUF : 94점
gPT-oss-20b-GGUF : 97점
Nvdia-Nemotron-3-Nano-4b-GGUF : 18점
Qwen3-Coder-30B-A3B-lnstruct-GGUF : 리소스 부족으로 중단 시킴
Claude Sonet 5.0 중간 : 88점
TypeScript(1단계 점수)
gemma-4-26B-A8B-IT-QAT-GGUF : 89점
gPt-oss-20b-GGUF : 54점
Claude SoNnet 5.0 중간 : 98점
Gemini Pro 3.1 : 98점
Qwen3.7 plus : 57점
구글 Ai Studio : 58점
KIMI K3 : 99점
GLM-5.2 : 92점
개인적인 결론은
더 좋은 시스템 사양에서 더 성능 높은 로컬 LLM이라면
사용해 볼 가치가 있을 것 같습니다.
하지만 나와 같은 시스템이라면 추천하지 않습니다.
대형 LLM 서비스를 사용하는 것이 모든 면에서 유리하다고 생각합니다.
그럼에도 불구하고, 현재 시스템 환경에서 하나를 선택하자면
나는 GPT OSS 20b 모델을 고르겠습니다.
메모리 자원을 거의 전부 사용하지만, 멀티태스킹이 가능하며,
응답 속도가 그다지 중요하지 않다면, 재미삼아 사용하는 것은 괜찮습니다.
그리고 성능이 높은 모델에게는 작업 계획서를 작성하도록 하고
하위 모델(특히 로컬 LLM)에게 구현을 맡겼는데,
이해를 못하고 에러를 발생시키거나 품질이 저하되는 경우도 있었습니다.
참고하시기 바랍니다.
개인적 호기심에서 진행한 테스트 입니다.
이 결과가 모델 고유의 성능을 평가하는 기준은 아닙니다.
재미이니 재미로 봐주시기 바랍니다.
즐거운 주말 보내세요.
황
하
김
오
레
댓글 0