그록 4.5는 코딩 벤치마크 SWE-Bench Pro에서 64.7%를 기록해 GPT-5.5(58.6%)는 넘었지만, 앤트로픽 클로드 오퍼스 4.8(69.2%)에도 못 미쳤고, 진짜 최신 플래그십인 클로드 페이블 5(80.4%)와는 15.7%포인트나 벌어졌습니다(xAI·Snorkel AI 발표 종합, 2026). "오퍼스급"이라는 마케팅 문구, 숫자로 다시 뜯어보겠습니다.
✔ 3줄 요약
- SpaceX·xAI 합병으로 탄생한 '스페이스XAI'가 커서와 함께 2026-07-08 그록 4.5를 출시했습니다. 가격은 백만 토큰당 입력 $2·출력 $6, 속도는 초당 80토큰으로 저렴하고 빠르다는 점이 강점입니다.
- 머스크는 "오퍼스급"이라 홍보했지만, 실제로는 클로드 오퍼스 4.8에도 못 미치고 앤트로픽 진짜 최신 모델 클로드 페이블 5와는 SWE-Bench Pro 기준 64.7% 대 80.4%로 큰 격차가 납니다.
- xAI는 자체적으로 "2배 효율"을 주장하지만, 독립 벤치마크(Snorkel AI)는 특정 과제에서 약 4배 토큰 차이를 측정해 두 수치를 함께 봐야 합니다.
"그록 4.5, 오퍼스랑 비슷한 급이라던데?" 이번 주 이 문장을 여러 곳에서 봤습니다. 일부 뉴스레터도 검증 없이 그대로 옮겼습니다. 그런데 실제 벤치마크를 뜯어보면 이야기가 조금 다릅니다. 비교 대상 자체가 앤트로픽의 두 번째 등급 모델이었기 때문입니다. 그 전말을 정리했습니다.
이 글의 순서
- 스페이스XAI와 커서, 그록 4.5는 어떻게 나왔나
- 정말 클로드 오퍼스급일까: 벤치마크로 따져보니
- 가격은 정말 저렴한가: 세 모델 비용 비교
- 효율 논쟁: '2배'냐 '4배'냐
- 그래서 지금 뭘 써야 하나
스페이스XAI와 커서, 그록 4.5는 어떻게 나왔나
스페이스X와 xAI는 2026년 2월 3일 전액 주식 교환 방식으로 합병했습니다(xAI 주식 1주당 스페이스X 주식 0.1433주, CNBC, 2026). 합쳐진 회사 가치는 약 1조 2,500억 달러로 평가됐고, 목표는 xAI의 연산 인프라 확충과 '궤도 데이터센터' 구축이었습니다. 이후 스페이스X는 2026년 6월 IPO로 약 750억 달러를 조달했고, 몇 달 뒤 로고와 사명을 '스페이스XAI'로 정식 교체했습니다.
같은 흐름에서 스페이스X는 2026년 6월 16일 AI 코딩 스타트업 커서(Cursor)를 60억 달러가 아니라 600억 달러 규모 전액 주식 거래로 인수한다고 발표했습니다(TechCrunch, 2026). 다만 이 인수는 아직 마무리되지 않았고, 3분기 중 종료가 예상됩니다. 그록 4.5는 이 인수가 끝나기 전, 4월부터 이어진 파트너십 단계에서 커서와 공동 훈련된 모델입니다.
엔비디아 GB300 GPU 수만 대를 멤피스 데이터센터에서 돌려 훈련한 그록 4.5는 '그록 빌드'의 기본 모델이 됐고, 커서의 데스크톱·웹·iOS·CLI·SDK 전 플랫폼에 배포됐습니다. 출시 첫 주(약 2026-07-15까지) 커서 사용량은 두 배로 늘었습니다. 다만 EU에서는 규제 검토 때문에 출시가 미뤄져 정확한 시점이 아직 안 잡혔습니다. 같은 시기 코딩 에이전트 시장에는 중국 Z.ai가 무료 코딩 에이전트 'ZCode'를 내놓으며 저가 경쟁이 한층 치열해지고 있습니다.
정말 클로드 오퍼스급일까: 벤치마크로 따져보니
결론부터 말하면 부분적으로만 맞습니다. 그록 4.5는 SWE-Bench Pro에서 GPT-5.5를 앞섰지만 클로드 오퍼스 4.8에는 밀렸고, DeepSWE 1.1에서는 GPT-5.5에도 뒤처졌습니다. 앤트로픽은 오퍼스 4.8 이후 2026년 6월 9일 클로드 페이블 5를 공개했습니다(Anthropic, 2026). 지금 진짜 최신 플래그십은 이 모델이고, 여기에 비교하면 격차는 훨씬 커집니다.
| 벤치마크 | 클로드 페이블 5 | 클로드 오퍼스 4.8 | 그록 4.5 | GPT-5.5 |
|---|---|---|---|---|
| SWE-Bench Pro | 80.4% | 69.2% | 64.7% | 58.6% |
| DeepSWE 1.1 | 70% | 59% | 53% | 67% |
| Terminal-Bench 2.1 | 두 모델 모두 격차 5.4%p 이내로 비슷한 범위 | 83.3% | 83.4% | |
표를 보면 그록 4.5가 진짜 강한 구간은 Terminal-Bench 2.1뿐입니다. GPT-5.5와 사실상 동률이고, 다른 두 모델과도 큰 차이가 없습니다. 반면 SWE-Bench Pro와 DeepSWE 1.1에서는 오퍼스 4.8, 페이블 5 모두에게 밀립니다. '오퍼스급'이라는 표현은 정확히는 오퍼스 4.8 근처, 페이블 5와는 거리가 먼 급이라고 다시 써야 합니다.
가격은 정말 저렴한가: 세 모델 비용 비교
가격만 놓고 보면 그록 4.5의 우위는 뚜렷합니다. 백만 토큰당 입력 $2·출력 $6으로, 클로드 오퍼스 4.8($5/$25)의 4분의 1 수준, 클로드 페이블 5($10/$50)와 비교하면 5분의 1 수준입니다. 속도도 초당 80토큰으로 빠른 편에 속합니다. 성능은 2등급이어도 가격·속도 조합은 실무에서 매력적일 수 있습니다.
| 모델 | 입력 비용 | 출력 비용 | 속도 |
|---|---|---|---|
| 그록 4.5 | $2 | $6 | 초당 80토큰 |
| 클로드 오퍼스 4.8 | $5 | $25 | 공식 미공개 |
| 클로드 페이블 5 | $10 | $50 | 공식 미공개 |
이 블로그가 그동안 다뤄온 클로드 소넷 5 대 오퍼스 4.8 비교에서도 강조했듯, 모델 선택은 성능만으로 결정되지 않습니다. 반복 작업이 많고 예산이 빠듯하다면 저렴한 모델이 합리적이고, 복잡한 리팩터링처럼 정확도가 중요한 작업엔 상위 모델이 여전히 유리합니다.
효율 논쟁: '2배'냐 '4배'냐
xAI는 그록 4.5가 "최신 선도 모델 대비 2배의 토큰 효율"을 낸다고 자체 발표했습니다(x.ai, 2026). 반면 독립 벤치마크 기관 Snorkel AI는 SWE-Bench Pro 과제 하나를 기준으로, 그록 4.5가 약 15,954개, 클로드 오퍼스 4.8이 약 67,020개의 출력 토큰을 썼다고 측정했습니다. 단순 계산하면 약 4.2배 차이입니다.
두 수치는 서로 다른 출처, 다른 기준에서 나온 값입니다. xAI의 '2배'는 자체 마케팅 수치이고, Snorkel AI의 '4배'는 특정 과제 하나에 한정된 독립 측정치입니다. 어느 쪽이 맞는지 단정하기보다, 두 숫자를 함께 놓고 "효율 차이가 있다는 방향성은 맞지만 정확한 배율은 출처마다 다르다"고 읽는 게 안전합니다. 메타의 벤치마크 없는 GPT-5.5 추격 주장 사례처럼, AI 업계에서 검증되지 않은 효율·성능 수치를 그대로 믿는 건 늘 위험합니다.
그래서 지금 뭘 써야 하나
실무 기준으로 보면 비용 민감한 반복 코딩 작업엔 그록 4.5, 정확도가 중요한 작업엔 클로드 페이블 5나 오퍼스 4.8이 여전히 합리적입니다. 커서 사용자라면 두 배 늘어난 무료 사용량이 끝나는 7월 15일 전에 직접 비교해보는 것도 방법입니다.
다만 OpenAI는 그록 4.5 출시 직후인 2026년 7월 8~9일 무렵 GPT-5.6(루나·테라·솔 세 등급)을 공개했습니다. 이 글의 GPT-5.5 비교 수치는 이미 한 세대 전 모델 기준이라는 뜻입니다. 벤치마크 비교는 항상 발표 시점을 함께 확인해야 의미가 있습니다.
자주 묻는 질문 (FAQ)
Q. 그록 4.5는 클로드 오퍼스 4.8보다 나은가요?
벤치마크에 따라 다릅니다. Terminal-Bench 2.1에서는 비슷하지만, SWE-Bench Pro(64.7% 대 69.2%)와 DeepSWE 1.1(53% 대 59%)에서는 클로드 오퍼스 4.8이 앞섭니다. '전반적으로 우위'라고 보기는 어렵습니다.
Q. 클로드 페이블 5는 뭔가요, 오퍼스와 다른가요?
클로드 페이블 5는 앤트로픽이 2026년 6월 9일 공개한 진짜 최신 플래그십 모델입니다. SWE-Bench Pro 80.4%, DeepSWE 1.1 70%로 오퍼스 4.8과 그록 4.5를 모두 크게 앞섭니다. 가격은 백만 토큰당 $10/$50입니다.
Q. 커서의 스페이스X 인수는 이미 끝났나요?
아직입니다. 2026년 6월 16일 발표된 600억 달러 규모 전액 주식 인수는 3분기 중 종결이 예상됩니다. 그록 4.5는 인수 완료 전, 4월부터 이어진 파트너십 단계에서 공동 훈련된 모델입니다.
Q. 그록 4.5의 '2배 효율' 주장은 사실인가요?
xAI 자체 발표는 2배라고 하지만, 독립 기관 Snorkel AI는 SWE-Bench Pro 과제 기준으로 약 4.2배 토큰 차이를 측정했습니다. 두 수치는 출처와 측정 기준이 달라 함께 참고하는 게 안전합니다.
출처
- x.ai, 그록 4.5 공식 발표 (2026-07-08)
- Cursor, 그록 4.5 커서 통합 공지 (2026-07-08)
- TechCrunch, 스페이스X의 커서 600억 달러 인수 발표 (2026-06-16)
- Anthropic, 클로드 오퍼스 4.8 공식 발표 (2026-05-28)
- Anthropic, 클로드 페이블 5 공식 발표 (2026-06-09)
- CNBC, 스페이스X-xAI 합병 보도 (2026-02-03)
글쓴이 · 벤자민 요한슨 주니어
국내외 AI 뉴스를 매일 모니터링하며, 소비자와 투자자 모두에게 실질적인 시사점을 주도록 재구성해 전달합니다. 더 많은 AI 소식은 BenPaperB 홈에서 확인하세요.
※ 본문의 구체 수치는 여러 출처를 전제로 한 정리이며, 확정 값이 아닌 항목은 "보도에 따르면"으로 표기했습니다. 최신 가격·정책은 각 사 공식 발표에서 확인하시기 바랍니다.
댓글
댓글 남기기