
안녕하세요👋 워크플로우 아키텍트, 수월한입니다.
지난 글에서 정체불명의 무료 모델 Ox Alpha가 DeepSWE 벤치마크에서 80% 통과율을 기록했다는 소식을 전해드리면서, 이 수치가 113문제 중 딱 10문제만 돌려 본 결과라 편차가 클 수 있다고 미리 짚어드렸습니다. 그리고 며칠 지나지 않아 그 우려가 실제로 확인됐습니다.
혹시 "무료인데 벤치마크까지 1등이라니" 하는 마음으로 Ox Alpha를 이미 업무 파이프라인 한쪽에 슬쩍 끼워 넣어 보셨나요? 아니면 팀 채팅방에 공유된 80%라는 숫자만 보고 "이 정도면 우리도 써볼 만하지 않을까" 하고 마음이 기울진 않으셨나요?
화제가 된 숫자와 실제로 재현되는 숫자는 생각보다 자주 어긋납니다. 특히 표본 10개짜리 테스트는 운이 좋으면 실력보다 후하게, 운이 나쁘면 실력보다 박하게 나올 수 있는 크기입니다. 반대로 같은 벤치마크를 문제 113개 전부 풀어보면 우연이 끼어들 자리가 확 줄어듭니다. 이 차이를 모르고 화제성 수치 하나만 보고 도입을 결정하면, 실제 업무에 투입한 뒤에야 소문보다 낮은 성능에 당황하게 됩니다.
오늘은 Ox Alpha의 DeepSWE 80%가 며칠 만에 어떻게 58%대로 내려왔는지, 그리고 또 다른 화제 지표인 킹벤치 87.5%는 어디까지 믿어도 되는지 차근차근 연결해서 정리해 드리겠습니다.
- 핵심 변화: 화제였던 Ox Alpha의 DeepSWE 80% 통과율이 113문제 전체 완주 결과 58~63%대로 정정됐습니다.
- 실무 적용: 벤치마크 수치를 볼 때는 표본 크기, 측정자 수, 독립 트래커 등재 여부를 함께 확인해야 합니다.
- 기대 효과: 화제성 수치에 흔들리지 않고 실제 업무 도입 여부를 판단할 수 있습니다.
80%라는 숫자, 어디서 나왔나
DeepSWE는 장기 소프트웨어 엔지니어링 능력을 재는 벤치마크로, 전체 문제가 113개입니다. 독립 개발자 Ben Davis가 Ox Alpha로 이 중 10문제만 직접 테스트해 본 결과를공개하면서 80% 안팎의 통과율이라는 수치가 퍼졌습니다. Claude Fable 5(65%), GLM-5.3(62%), GPT-5.6-sol(52%)보다 앞선다는 비교치까지 함께 퍼지면서, 무료 모델이 유료 모델을 앞질렀다는 소문이 하루 만에 커뮤니티를 채웠습니다.
문제는 이 80%가 113문제 중 10문제, 즉 전체의 9%도 안 되는 표본에서 나온 수치라는 점입니다. Davis 본인도 표본이 작아 편차가 클 수 있다고 밝혔지만, 화제성 숫자는 이런 단서 없이 그대로 인용되고 공유됐습니다. 뒤에서 볼 정정치와 비교하기 위한 기준점으로, 이 80%가 정확히 어떤 조건에서 나온 숫자인지 먼저 짚고 넘어가겠습니다.
113문제를 다 풀어보니 벌어진 일
며칠 뒤, 다른 개발자 두 명이 각자 DeepSWE 113문제 전부를 Ox Alpha에 돌려 봤습니다. HuggingNews의 보도에 따르면 @henryzhangumich와 @apples_jimmy가 각각 측정한 결과는 58.4%(66/113)였고, 다른 소스에서는 63%대로도 보고됩니다. 두 결과 모두 화제였던 80%와는 20%p 넘게 차이가 납니다.
흥미로운 지점은 이 58~63%대가 Claude Opus 4.8의 DeepSWE 성적(약 59%)과 거의 비슷한 수준이라는 사실입니다. 즉 Ox Alpha는 화제만큼 압도적인 1등이 아니라, 기존 상위권 모델과 나란히 서는 정도의 성능이라는 뜻입니다.
2026년 8월 26일, Z.ai가 Ox Alpha의 정체는 자사의 신모델 GLM-5.3-Flash라고 공식 확인했습니다. 공교롭게도 이 글에서 비교 대상으로 언급한 GLM-5.3이 바로 그 이전 세대 모델이었던 셈입니다. 정체 공개의 전체 맥락은 Ox Alpha 정체 공개, GLM-5.3-Flash가 남긴 세 가지 신호에서 확인하실 수 있습니다.
| 측정 | 문제 수 | 통과율 | 성격 |
|---|---|---|---|
| Ben Davis 테스트 | 10 / 113 | 약 80% | 개인 표본, 화제성 수치 |
| 독립 재현(2건) | 113 / 113 | 58.4~63%대 | 전체 완주, 재현 결과 |
| Claude Opus 4.8 | 113 / 113 | 약 59% | 참고용 기존 상위권 모델 |
왜 숫자가 이렇게 벌어졌을까
동전을 10번 던지면 8번 앞면이 나오는 일이 그렇게 드물지 않습니다. 하지만 같은 동전을 100번 던졌을 때도 80번 앞면이 나온다면, 그건 우연이 아니라 진짜 실력(혹은 편향)입니다. DeepSWE 10문제와 113문제의 관계도 비슷합니다. 표본이 작을수록 우연히 쉬운 문제가 몰리거나, 운 좋게 몇 번 맞아떨어질 확률이 커집니다.
Ox Alpha의 사례가 특별한 게 아니라, 어떤 AI 모델이든 소규모 표본으로 벤치마크를 돌리면 생길 수 있는 구조적인 현상입니다. 그래서 "화제성과 검증된 성능은 다른 문제"라는 원칙은 이번에도 그대로 적용됩니다.
킹벤치 87.5%도 같은 방식으로 걸러 읽기
DeepSWE 정정치가 퍼지는 동안, 또 다른 벤치마크인 킹벤치(Kingbench)에서 Ox Alpha가 87.5%를 기록해 GLM-5.3(91.25%)에 이어 2위라는 수치도 함께 돌았습니다. 그런데 킹벤치를 다룬 정리 글을 보면, 이 벤치마크는 "공식적으로 발표된 방법론이 없는 커뮤니티 자체 집계"이며 "독립적으로 검증되지 않았다"고 명시돼 있습니다.
킹벤치 자체가 표준 벤치마크가 아니다 보니 애초에 이런 독립 트래커들이 추적 대상으로 삼지도 않습니다. 숫자가 그럴듯해 보여도, 누가 어떤 기준으로 채점했는지 확인할 방법이 없다면 DeepSWE의 10문제 표본과 비슷한 무게로만 받아들이는 편이 안전합니다.
화제 벤치마크를 실무에서 거르는 3가지 확인법
앞으로 어떤 모델이든 화제가 된 벤치마크 수치를 보게 되면, 아래 세 가지를 순서대로 확인해 보세요.
첫째, 전체 문제 수 대비 표본 크기입니다. 113문제 중 10문제처럼 전체의 10% 안팎이라면 그 자체로 편차를 의심해야 합니다. 둘째, 측정자가 1명인지 복수인지입니다. 한 사람의 테스트는 재현되지 않으면 참고용일 뿐이고, 여러 사람이 각자 돌려서 비슷한 값이 나와야 신뢰할 수 있습니다. 셋째, 독립 트래커 등재 여부입니다. OpenRouter의 공식 모델 목록이나 Artificial Analysis처럼 제3자가 관리하는 트래커에 올라 있는지 확인하면, 커뮤니티 집계와 검증된 벤치마크를 가려낼 수 있습니다.
다만 성능이 검증됐다고 해서 바로 도입해도 되는 건 아닙니다. Ox Alpha처럼 정체가 불명확한 무료 프리뷰 모델은 데이터가 어디에 남는지, 무료 기간이 끝나면 어떻게 되는지도 함께 봐야 합니다. 이 부분은 이전에 정리해 드린 안전한 테스트 기준과 함께 보시면 성능 검증과 데이터 리스크 판단을 한 번에 마칠 수 있습니다.
그래서 Ox Alpha 성능은 실제로 어느 정도인가
정리하면 Ox Alpha는 소문만큼 압도적인 1위는 아니지만, Claude Opus 4.8과 나란히 설 정도의 준수한 코딩 성능을 가진 모델입니다. 무료로 이 정도 성능을 쓸 수 있다는 점은 여전히 매력적이지만, "1등 모델"이라는 프레임으로 접근하면 실제 업무에서 기대와 다른 결과에 실망하기 쉽습니다. Opus 4.8을 포함한 최신 모델들이 업무별로 어떻게 다른지 궁금하시다면 업무별 승자를 정리한 비교글도 함께 보시길 권합니다.
오늘 바로 해볼 일은 간단합니다. 다음에 팀 채팅방이나 커뮤니티에서 어떤 AI 모델의 벤치마크 수치가 화제가 되면, 위 세 가지 확인법을 그대로 적용해 보세요. 표본 크기와 측정자 수, 등재 여부만 확인해도 화제성과 실제 성능을 구분하는 눈이 생깁니다.
자주 묻는 질문(FAQ)
HuggingNews 등에 보도된 독립 재현 결과에 따르면 113문제를 모두 완주했을 때 58.4%(66/113)이며, 다른 소스는 63%대로도 보고합니다. 처음 화제였던 80%는 10문제 표본 결과이므로 구분해서 봐야 합니다.
공식적으로 발표된 채점 방법론이 없는 커뮤니티 자체 집계 벤치마크입니다. Ox Alpha는 87.5%로 GLM-5.3(91.25%)에 이어 2위로 보고됐지만, OpenRouter 모델 페이지나 Artificial Analysis 같은 독립 트래커에는 등재돼 있지 않습니다.
권장하지 않습니다. 표본 크기, 측정자가 1명인지 복수인지, 독립 트래커 등재 여부를 함께 확인하고, 가능하면 실제 업무와 비슷한 작업으로 직접 검증하는 편이 안전합니다.
'📰 수월한 트렌드 > 소식 & 업데이트' 카테고리의 다른 글
| 비싸서 포기했던 클로드 페이블, 5.1은 지금 쓸 만할까 (0) | 2026.09.03 |
|---|---|
| Ox Alpha 정체 공개, GLM-5.3-Flash가 남긴 세 가지 신호 (0) | 2026.08.28 |
| Ox Alpha, 무료 100만 토큰이라도 업무에 바로 쓰면 안 되는 이유 (1) | 2026.08.23 |
| 클로드 워터마크 도입, 흔적 남기는 원리와 우회법 정리 (1) | 2026.08.18 |
| 제미나이 3.7 플래시 출시, 기존 3.6 요금까지 반값 된 이유와 전환 체크리스트 (0) | 2026.08.14 |