LLM 벤치마크 비교: 모델별 성능 지표를 한눈에 보는 가이드

Photo of author

By 요담

llm 벤치마크 비교 LLM 벤치마크 비교는 모델 선택 전에 성능 지표를 같은 기준으로 맞춰 보는 작업입니다. 점수가 높아도 과쉬우면 순위가 거의 붙습니다. 선택 기준이 코딩인지 한국어 지식인지에 따라 볼 지표도 달라집니다. 배포 형태와 요금, 지연 시간은 벤치마크 점수 밖에 있으니 따로 점검합니다.

2026년 기준으로 원본 MMLU·HumanEval·GSM8K·HellaSwag는 프론티어 모델이 천장 근처에 몰립니다. 실무 비교에는 MMLU-Pro, GPQA Diamond, Humanity’s Last Exam, LiveCodeBench, SWE-bench를 함께 보는 편이 안전합니다.

주요 LLM 벤치마크 종류와 측정 항목

llm 벤치마크 비교 관련 화면
(사진 출처: velog.io)

LLM 벤치마크는 과제 유형마다 측정 항목이 다릅니다. 지식형은 다지선다 정답률을 보고, 수학형은 풀이 정확도를 보며, 코드형은 단위 테스트 통과율을 봅니다. 같은 모델이라도 벤치마크가 바뀌면 순위가 흔들릴 수 있으니 한 숫자만 보고 고르지 않는 것이 좋습니다. 한국어 원본 시험과 영어 번역 문항도 난이도와 오염 위험이 같지 않습니다.

프론티어 비교에서는 포화된 원본 세트를 보조 지표로만 두고, 더 어려운 후속 세트를 앞에 두는 방식이 흔합니다. 지식·추론은 MMLU-Pro와 GPQA Diamond, Humanity’s Last Exam을 보고, 코딩은 LiveCodeBench와 SWE-bench를 봅니다.

리더보드 제목만 같아도 버전과 채점 스크립트가 다르면 숫자가 호환되지 않습니다. 인용할 때는 평가 연월을 같이 적습니다.

MMLU, GSM8K, HumanEval 핵심 지표

MMLU는 STEM·인문·사회·전문 분야 등 57개 학문 과목의 4지선다 문항 약 16,000개 이상으로 광범위한 지식을 측정합니다. HumanEval은 164개 Python 함수 생성 과제를 단위 테스트로 채점하는 코드 생성 벤치마크입니다. GSM8K는 초등 수준 수학 문장제를 풀어 정확도를 봅니다. 세 지표는 모두 익숙한 점수라 홍보에 자주 등장하지만, 2026년 프론티어 구간에서는 변별력이 약합니다.

LXT 집계(2026년 2월 기준)에서 GPT-5.3 Codex의 MMLU와 HumanEval은 각각 약 93%로 보고됩니다. 두 벤치마크는 포화로 분류됩니다. 점수가 높아도 과제 난이도가 이미 천장에 가깝다는 뜻입니다.

GSM8K 역시 프론티어에서는 천장에 가깝습니다. 수학 변별이 필요하면 더 어려운 추론 세트를 따로 봐야 합니다.

한국어·멀티모달 벤치마크 차이

KMMLU는 번역이 아니라 한국어 원본 시험 문항 35,030개, 45개 전문 과목으로 구성된 한국어 MMLU형 벤치마크입니다. 논문 보고에서 공개 최고점은 50.54%, GPT-4는 59.95%, HyperCLOVA X는 53.40%이며 인간 평균 62.6%보다 낮습니다. 영어 MMLU 고득점만으로 한국어 실무 품질을 단정하기 어렵습니다.

멀티모달 평가는 텍스트 지식 점수와 별개입니다. 이미지·문서·화면을 읽고 답하는 과제에서는 시각 이해와 지시 따르기가 함께 들어갑니다. 텍스트 벤치마크만 보고 멀티모달 제품 성능을 같은 순위로 옮기면 오해가 생깁니다.

음성·영상 과제는 또 다른 축입니다. 텍스트 KMMLU 점수와 음성 인식 품질을 한 줄로 합치면 안 됩니다.

대표 모델 벤치마크 점수 비교

LXT 집계(2026년 2월 기준)를 보면 상용 프론티어 모델의 원본 MMLU와 HumanEval 점수는 이미 90%대에 모여 있습니다. GPT-5.3 Codex는 MMLU와 HumanEval이 각각 약 93%로 포화 구간에 들어갑니다. 같은 표에서 Gemini 3.1 Pro의 GPQA Diamond는 94.3%로 최고점 근처이며 해당 벤치마크는 포화에 근접한 상태로 표시됩니다. 그래서 모델 성능 비교는 포화된 점수보다 아직 벌어진 GPQA Diamond, LiveCodeBench, SWE-bench 쪽을 먼저 확인하는 것이 좋습니다.

표는 공개 집계의 한 시점일 뿐입니다. 모델 업데이트가 잦으니 날짜를 고정해 두고 다시 확인해야 합니다.

모델·지표점수상태(2026년 2월 LXT 등)
GPT-5.3 Codex · MMLU약 93%포화
GPT-5.3 Codex · HumanEval93%포화
Gemini 3.1 Pro · GPQA Diamond94.3%포화 근접
KMMLU · GPT-459.95%인간 평균 62.6% 미만
KMMLU · 공개 최고점50.54%상용·인간 평균보다 낮음

오픈소스 vs 상용 모델 성능 격차

KMMLU 논문이 보여 주는 격차가 대표적입니다. 공개 최고점은 50.54%이고 GPT-4는 59.95%, HyperCLOVA X는 53.40%로, 인간 평균 62.6%에는 못 미칩니다. 영어 코딩·지식 벤치마크에서는 상용 프론티어가 천장에 가깝고 한국어 전문 과목에서는 공개 모델과 상용 모델 모두 여유가 남아 있습니다. 오픈소스 선택은 절대 점수보다 언어와 과제 적합성을 같이 봐야 합니다.

공개 가중치 모델이 영어 MMLU에서 상용 모델에 근접해도, KMMLU처럼 원어 시험에서는 격차가 다시 벌어질 수 있습니다. 라이선스와 로컬 배포가 필요하면 오픈소스를 쓰되, 한국어 전문 질의는 별도 평가를 권합니다.

코딩 과제에서도 단위 테스트 통과와 저장소 패치 성공은 난이도가 다릅니다. HumanEval 고득점이 SWE-bench 강점을 보장하지는 않습니다.

벤치마크 해석 시 주의할 점

점수가 같아도 채점 방식과 샷 수, 도구 사용 허용 여부가 다르면 비교가 성립하지 않습니다. 원본 MMLU·HumanEval·GSM8K·HellaSwag는 2026년 프론티어 구간에서 변별 매트릭스에서 빼는 집계도 있습니다. 학습 데이터 오염과 리더보드 과적합도 점수 인플레를 만듭니다. 업무에 쓸 때는 내부 질의·코드 저장소·한국어 문서로 재현 테스트를 하는 것이 안전합니다.

공식 카드에 적힌 최고점만 복사하지 말고, 평가 날짜와 모델 스냅샷, 도구 사용 여부를 같이 적어두세요. 멀티모달 제품은 텍스트 벤치마크와 별도 세트로 보는 것이 맞습니다. 점수가 높은 모델이 내부 보안 정책이나 지연 시간 조건에는 맞지 않을 수도 있습니다.

샘플 수가 적은 벤치마크는 오차 폭이 큽니다. GPQA Diamond처럼 문항이 어려운 세트는 소수 문항 차이로 순위가 뒤집힐 수 있습니다.

LLM 벤치마크 비교 정리와 결론

LLM 벤치마크 비교의 핵심은 높은 점수 하나가 아니라 과제 적합성입니다. 원본 MMLU와 HumanEval은 참고용으로 두고, 프론티어 변별은 MMLU-Pro, GPQA Diamond, Humanity’s Last Exam, LiveCodeBench, SWE-bench로 옮기는 것이 맞습니다. 한국어 업무라면 KMMLU처럼 원어 시험 지표를 반드시 곁들입니다. 표 숫자만 믿지 말고 실제 질의와 코드로 한 번 더 확인하십시오.

내부 업무 데이터로 재현한 결과가 리더보드와 다르면 리더보드가 아니라 재현 결과를 따르십시오. 모델 교체 주기마다 같은 문항 세트로 다시 재는 습관이 점수 해석 오류를 줄입니다.

정리하면, LLM 벤치마크 비교는 포화 여부를 먼저 가리고 언어·코딩·추론 축을 나눠 보는 절차입니다. 그다음 내부 데이터로 재현해 최종 선택을 확정하면 됩니다.

요담

글쓴이

요담

AI를 실무에 활용할 수 있도록 도움드리는 요담입니다.