작성자: 디지털생명 카즈크
정신이 혼미해진다. 며칠 전만 해도 다들 모델 속도를 늦춘다고 외치지 않았나. 그런데 이 모델들이 공짜인 것처럼 쏟아져 나오는 건 뭐지. 어제 Grok 4.7과 MiMo v2.6의 대결은 오늘 이 두 거물을 위한 전초전이었나 보다. 오늘 새벽, OpenAI의 GPT-6 Sol과 GPT-6 Luna, 그리고 Anthropic의 Claude Opus 5.5가 모두 정식 공개됐다.
정말 묻고 싶다. 매일매일 속도를 늦춘다고 말하는데, 대체 어디가 늦춰졌다는 건지. 전부 바람둥이들이다. 게다가 이 전개가 왠지 낯익어서 예전 글을 뒤져봤다.
지난번에는 GPT-5.3 Codex가 Claude Opus 4.6과 맞붙었는데, 오늘은 그대로 역사가 반복됐다... 다만 Claude Opus 4.6이 Claude Opus 5.5로 바뀌었을 뿐.
GPT-5.3 Codex는 GPT-6 Sol로 바뀌었다.
두 회사는 여전히 그 두 회사고, 여전히 지면 안 된다는 그 철천지 원수다.
하나씩 살펴보자.
1. Claude Opus 5.5
먼저 Claude부터.
솔직히 말해서, 내가 Anthropic을 아무리 싫어하고, 이 회사가 아무리 멍청하다고 생각하고, 그들이 아무리 내 계정을 차단해도, 객관적으로 Claude는 여전히 내 마음속 최고이자 가장 전방위적인 모델이다.
나는 지금도 Claude Fable 5를 쓰면서 받았던 충격을 기억한다.
이번 Claude Opus 5.5는 Anthropic의 새로운 Claude 5.5 시리즈의 첫 번째 모델인데, 내 기억으로는 Claude가 한 번에 이렇게 많은 버전 번호를 건너뛴 경우가 드물었다.
그리고 직접 잠깐 써본 결과(왜 차단당했는데도 쓸 수 있냐고 묻지 마라. 그냥 일회용 계정을 샀는데, 2시간 쓰면 차단되는 그런 거다...), Opus 5.5는 전반적인 소통에서 Opus 4.6으로 돌아간 듯한 느낌을 줬다. 사람 냄새가 아주 강하다.
이 녀석의 포지셔닝이 사실 Claude 시리즈의 가성비 모델이긴 하지만, 확실히 그 시절의 첫사랑이 떠오르는 느낌이 있다.
기본 정보를 정리하면 대략 이렇다:
| 모델명 | claude-opus-5-5 |
|---|---|
| 컨텍스트 | 1M Token |
| 최대 출력 | 128K Token |
| 신뢰 가능 지식 기준일 | 2026년 6월 |
| 사고 | Adaptive Thinking, 항상 켜짐 |
| 기본 노력 등급 | medium |
| 입력 가격 | 4달러 / 백만 Token |
| 출력 가격 | 20달러 / 백만 Token |
| 캐시 읽기 | 0.2달러 / 백만 Token |
| 5분 캐시 쓰기 | 5달러 / 백만 Token |
| 1시간 캐시 쓰기 | 8달러 / 백만 Token |
이전 세대 Opus 5 대비 전체 작업 비용이 바로 40% 줄어든다.
동시에 출력 속도도 Opus 5보다 30% 이상 빨라졌다.
현재 일부 대형이 아닌 작업에서는 Opus 5.5가 이미 Fable 5.1 수준의 성능을 낼 수 있고, 대형 고난도 작업은 여전히 Fable급 모델이 투입되어야 한다.
Coding 작업에서는 사실상 현 시점의 SOTA다.
예를 들어 Terminal-Bench 4.0처럼 실제 터미널 환경에서 복잡하고 다단계 작업을 완수하는 능력을 반영하는 벤치마크에서 Opus 5.5는 최고점 66.4%를 경신했다.
Coding이 들어가기만 하면 거의 다 SOTA다. 처음 Opus 5가 나왔을 때 Coding 실행에서 Fable 5를 전면적으로 뛰어넘었던 것과 아주 비슷하다.
다만 두 가지는 좀 다르다. Terminal-Bench-Science는 과학 연구 쪽 작업인데 Opus 5.5가 58.7%이고, 여기서는 Astra가 오히려 64.6%로 더 높다.
AutomationBench도 마찬가지다. 이 작업은 사실 소프트웨어 간 협업인데, Opus 5.5는 40.0%, GPT-6 Astra는 41.4%다.
그리고 그 Computer Use는 GPT-6 Astra 점수가 없긴 하지만, 이게 못할 리 없다는 건 모두가 안다. 절대적인 SOTA다.
이런 부분에서 Anthropic과 OpenAI 두 회사가 경쟁하며 차별화해 온 방향도 보인다. Anthropic은 Coding 능력에 더 치우쳐 있고, 동시에 미적 감각이 극도로 뛰어나며, Coding이야말로 AGI로 가는 길의 초석이라고 믿는다. 반면 OpenAI는 추론, 소프트웨어 조작, 과학 연구 등을 아우르는 전방위적인 Agent 능력에 더 집중한다.
하지만 솔직히 말해서, 특정 차원의 평가 세트만 보는 것으로는 모델의 진짜 품질을 평가할 수 없다고 생각한다.
알다시피 제품 개발에서도 가장 핵심적인 것이 따로 있다. 바로 맨 앞단의 기획과 아키텍처 설계 능력인데, 이건 Fable이 신적인 이유다. 큰 파라미터, 세계 지식, 지능의 창발에 의존한다.
Opus 5.5가 특정 실행에서는 확실히 Fable을 넘어설 수 있다고 해도, 전체적으로 Opus 5.5가 Fable보다 강하다고? 그럼 차라리 내가 진시황이라고 믿는 게 낫겠다.
전체적으로 Claude Opus 5.5는 사실상 Fable 5.1의 자체 공식 증류(distillation) 모델이다.
많은 수직적 시나리오에서는 더 강할 수 있고, 파라미터 수가 더 적고, 속도가 더 빠르고, 더 저렴하다. 하지만 동시에 Token 낭비를 불러오기도 한다. 여기에 사실 함정이 있다. 고난도 작업에서 일부 비플래그십 모델은 오히려 계속해서 미친 듯이 생각하고, 미친 듯이 시도하지만 빠져나오지 못해 문제를 해결하지 못해, 플래그십 모델보다 돈을 더 태우는 경우가 생긴다.
Opus 5.5가 확실히 강하긴 하지만, 작업당 출력 Token 수가 그냥 폭발해 버렸다. 그래서 사실 그 지능의 상당 부분은 초장문 추론으로 맞바꾼 것이다. 이게 단점인 이유는, 한번 막다른 길에 빠지면 그 자리에서 폭발해 버린다는 점이다.
그래서 Anthropic도 이렇게 안내한다.
결과가 정말 중요할 때는 반드시 최고급 모델을 써야 한다.
그다음 X에서 고수들이 돌려본 Claude Opus 5.5 케이스를 보면 꽤 놀랍다. 특히 미적 감각과 디테일이 대폭 강화됐다.
@notjazii가 GPT-6 Astra와 Claude Opus 5.5를 비교한 테스트인데, 일부 시나리오에서는 GPT-6 Astra보다 오히려 더 정교하다:
하지만 그 대가는 GPT-6 Astra보다 더 느리고 더 비싸다는 점이다.
다만 Opus 5.5 입장에서는 GPT-6 Astra와 비교된다는 것 자체가 이미 찬사다.
Opus 5.5는 이번에 소통 능력도 강화했다.
Anthropic은 Opus 5에 대해 가장 많이 받은 피드백 중 하나가, 가끔 글을 돌려 쓰고, 용어가 많고, 표현이 직설적이지 않다는 것이었다고 한다.
5.5는 가장 중요한 정보를 앞에 배치하고, 이상한 표현과 불필요한 설명을 줄인다.
동시에 창작 면에서도 Claude 4.6의 느낌이 돌아왔다.
그래서 정리하면, Claude Opus 5.5는 내가 보기에 아주 훌륭한 모델이다.
Anthropic은 과거 플래그십 모델만 할 수 있던 일들을, 드디어 상시 사용 가능한 가격대로 내려보냈다. 아마 그동안 OpenAI가 준 압박이 너무 컸기 때문일 것이다.
그들의 자체 비용 가이드는 이렇게 직접 권한다:
평소에 붙잡고 하는 Feature, Debug, Code Review는 Opus 5.5를 써라.
결과가 Token 가격보다 정말 중요하거나, 장시간 무인 감독이 필요하거나, Opus 5.5가 연속으로 실패하면 그때 Fable 5.1로 전환해라.
Fable은 점점 전문가급 컨설턴트에 가까워지고 있다.
Opus 5.5는 주력 직원에 더 가깝다.
이것이 Claude의 오늘 신모델이다.
2. GPT-6 Sol과 Luna
드디어 내가 정상적으로 쓸 수 있는 것까지 왔다.
GPT-6 Sol과 Luna.
Claude가 아무리 좋아도 나한테는 일회용일 뿐이고, 상시로 쓸 수 있는 게 아니니 소용없다.
그래서 어쩔 수 없이 주력은 여전히 GPT-6다.
특히 공교롭게도, 며칠 전 GPT-6 Pro+MCP 글을 쓸 때 이런 문장을 따로 적어뒀다:
"GPT-6 Sol이 곧 나올 가능성이 높고, 나오면 실행 쪽은 무지성으로 GPT-6 Sol로 갈아탈 것 같다. 고난도 작업만 GPT-6 Astra로 전환할 것이다."
그리고 드디어 나왔다.
현재 Codex에 이미 출시되어 바로 사용할 수 있다.
과거 GPT-6 Astra가 가장 많이 까였던 점은 너무 비싸서 할당량이 전혀 부족하다는 것이었다.
이번에 GPT-6 Sol과 Luna는 그냥 바로 비용 절감을 노리고 나왔다.
Astra는 여전히 OpenAI의 최강 모델이다.
가장 어렵고, 가장 중요하고, 어떤 타협도 하고 싶지 않은 작업은 계속 Astra를 쓴다.
하지만 현실 세계의 작업에는 다양한 규모, 리듬, 예산이 있다.
그래서 GPT-6 Sol과 Luna가 존재하는 의미는 Fable 5.1과 Claude Opus 5.5의 관계와 같다:
Astra 세대의 훈련 방식이 가져온 능력을 더 빠르고 더 저렴한 모델로 내려보내는 것.
Claude와 거의 같은 날, 같은 이야기를 하고 있다.
누가 더 적은 돈으로 더 많은 지능을 살 수 있는가.
이것이 파레토 프런티어다.
가격은 신세대가 다음과 같이 책정됐다.
Sol과 Luna는 GPT-5.6의 동급 모델보다 50% 더 저렴하다.
가장 말도 안 되는 건 이 Luna다. 입력과 출력 가격만 보면 사실 이미 Deepseek보다도 저렴하다.
물론 우리 모두 알다시피 진짜 큰 비중은 캐시다. 음, 보면 이 캐시 가격은 여전히 Deepseek보다 3배 정도 높다.
다만 Luna가 가장 잘 맞는 시나리오는, 내 생각에는 각종 애플리케이션 뒤에서 돌아가는 자동화 작업이다. 내 AIHOT 뒤에 붙어 있는 대형 모델이 필요한 정보 처리 작업 십여 개처럼, 매일 요청이 수만 건씩 들어오는 경우다.
이런 시나리오에서는 사실 캐시 적중률이 그렇게 높지 않을 때가 있다. 종합해도 30%면 다행인 수준이다. 그렇다면 내가 보기에 Luna의 장점이 꽤 뚜렷해진다.
다른 기본 정보는 다음과 같다.
이 지식 기준일이 전부 다르다니.
Luna가 가장 최신으로, 5월 18일까지다.
그다음 모두가 가장 궁금해하는 GPT-6 Sol이다. 솔직히 말해서 능력은 내 예상보다 좀 떨어지지만, 비용 절감 폭은 내 예상보다 좀 더 좋다.
보면 AA에서 GPT-5.6 Sol보다 조금 나은 수준인데, Opus 5.5는 그냥 벼랑 끝 수준으로 1위를 차지했다.
AA 벤치마크가 지금은 세부적으로 그렇게 정확하지 않다고 까이기도 하지만, 큰 방향성은 크게 다르지 않다.
그래서 GPT-6 Sol은 새 모델, 새 아키텍처를 기반으로 GPT-5.6 Sol보다 조금 나은 수준을 최대한 유지하면서 비용을 대폭 낮춘 것이다.
예를 들어 이 AutomationBench는 위에서 Claude를 말할 때 Claude 쪽보다 강했던 그 벤치마크다. 이 벤치마크는 Agent가 47가지 도구를 넘나들며 영업, 마케팅, 운영, 고객 서비스, 재무, HR 같은 실제 업무 프로세스를 수행하는 것을 측정한다.
GPT-6 Sol xhigh:
33.2%.
작업당 평균 비용:
0.27달러.
GPT-6 Astra low는 30.3%지만, 작업 비용은 Sol의 3.9배다.
Fable 5.1에 Opus 5 fallback을 더하면 31.4%이고, 비용은 최소 Sol의 8.9배다.
여기서 비교 대상이 여전히 Claude Opus 5인 점에 주목하자. Opus 5.5가 GPT-6 Sol과 거의 동시에 공개됐기 때문에 OpenAI의 차트에 넣을 시간이 없었던 것이다. 넣어도 사실 별로 보기 좋지 않고, OpenAI 입장에서는 그다지 유리하지 않다.
하지만 이 차트는 Sol의 포지셔닝을 아주 명확하게 설명해 준다.
다만 GPT의 강점은 Token 효율이 정말 말도 안 된다는 점이다. 돈을 아낀다고 하면 진짜로 아낄 수 있다.
게다가 이번에는 이전보다 내가 보기에 아주 좋은 업데이트 포인트가 하나 있다. 바로 사실 오류율이다. 나는 계속 GPT가 거의 내 사실 확인기(fact checker)가 되어가고 있다고 말해 왔다. 정말 환각이 거의 없다. 이 점에서는 여전히 너무 강하다. 과거에는 5.6도 꽤 괜찮다고 생각했는데, 이번에 또 대폭 최적화해서 거의 GPT-6 Astra 수준에 도달했다. 여기서 추론 등급도 볼 수 있는데, 가벼움이나 중간으로 켜면 많은 경우 사실 오류를 범한다. 그래서 내가 일상에서 높음으로 켜라고 계속 추천하는 이유다. 심지어 Luna라면 최고로 켜야 한다.
그리고 나도 직접 테스트해 봤는데, 미적 감각과 일부 디테일에서는 확실히 다운그레이드됐다.
예를 들어 Blender를 조작해 오토바이를 만드는 것인데, 디테일의 완성도가 아주 크게 차이 난다는 걸 알 수 있다.
이것이 GPT-6 Astra의 천단(天壇)이다.
그리고 이것이 GPT-6 Sol의 천단이다. 디테일 곳곳에 문제가 있고, 문은 그냥 바로 버그가 났다.
하지만 비용은 대략 70% 줄었으니, 전체적으로 받아들일 만하다.
내가 글을 쓰는 시점에 GPT-6 Sol과 GPT-6 Luna는 이미 ChatGPT Work와 Codex에 푸시되기 시작했다.
그런데 좀 난감한 건, OpenAI가 이 모델들이 아직 Chat에서는 제공되지 않는다고 말했다는 점이다. 즉, 채팅 모드에서는 여전히 GPT-5.6 Sol을 제공한다는 것이다.
이 부분은 좀 이해가 안 간다. 비용을 이미 대폭 낮췄는데, 왜 채팅에서도 더 저렴한 모델로 바꿔주지 않는 걸까?
마치며
알고 있다. 여기까지 읽은 사람이라면 결국 한 가지 질문을 할 것이다.
그래서 도대체 뭘 골라야 하냐고.
지금 모델이 정말 너무너무너무너무 많다. 매일 새 모델이 나오니 정말 피곤하다.
나는 그저 가능한 한 내 선택을 설명해 줄 수밖에 없다.
1. Claude를 구독할 수 있고 차단당하지 않는다면.
정서적으로 나는 Anthropic이라는 XX 회사가 정말 싫다. 하지만 사용자 경험 측면에서, Claude를 구독할 수 있고 차단당하지 않으며 오래 쓸 수 있다면, 나는 여전히 Claude 구독을 추천한다.
복잡한 기획과 계획은 Claude Fable 5.1로 하고, 작업 실행은 Opus 5.5로 하는 것이 아마 현재로선 확실히 최고의 조합일 것이다.
2. Claude에 차단당했지만 해외 모델을 구독할 수 있다면.
그럼 무지성으로 ChatGPT를 구독해라. GPT는 모델 차원에서 솔직히 말하면 Claude보다 아주 조금 뒤처진다. 창작이든, 인지적 통찰이든, 코딩이든.
하지만 거의 최고의 C단(소비자) 경험을 갖고 있고, 무제한 할당량의 채팅 모드가 있고, 가장 쓰기 좋은 클라이언트 Codex가 있다. 게다가 GPT-6은 이 세상에서 여전히 T0급으로 강하다.
복잡한 기획과 계획은 GPT-6 Astra나 사악한 수련법 GPT-6 Pro로 하고, 실행은 GPT-6 Astra high나 GPT-6 Sol xhigh로 하며, GPT-6 luna는 대규모 배치 자동화 작업을 돌리는 데 쓰면 아주 좋다.
3. 국산 모델만 구독할 수 있다면.
솔직히 말해서 Qwen, Kimi, GLM, MiMo, DeepSeek 이 몇 곳은 세대 차이라고 할 만한 격차가 없다. 손에 익는 곳을 쓰면 된다. 유일하게 아쉬운 건 모델 라인업이 그 두 곳만큼 강하지 않다는 점이다. Kimi K3와 Qwen 3.8 Max는 기획과 방안 수립에 더 적합하고, GLM-5.3과 Mimo v2.6 Pro, DeepSeek V4.1 Flash는 실행에 더 적합하다.
다만 명심해라. 항상 1개월만 구독하면 된다. 너무 길게 하지 말고, 최대 분기권까지만 사고, 절대 연간권은 사지 마라.
OpenAI와 Anthropic은 여전히 너무 성숙하다. 지금 환경은 예전과는 좀 다르다.
예전에는 이 두 곳이 최전선의 지능 출시를 담당했다. 다시 말해 하이엔드를 담당했다.
그리고 국산 모델이 미드레인지와 가성비를 담당했다.
하지만 지금은 상대방의 공급망이 더 성숙해진 것 같다. 애플처럼 전 영역을 휩쓸기 시작했다. 너의 미드레인지, 심지어 너의 초저가까지, 전부 다 가져가겠다는 것이다.
다만 모든 사용자에게는 이것도 좋은 일일 것이다.
이제 지능이 드디어 점점 저렴해지는 것 같으니까.
과거에 동등한 AI 성능의 비용은 거의 분기마다 47%씩 하락했다. 지능은 앞으로 몇 달에서 반년이 지나면 정말 수도·전기처럼 누구나 감당할 수 있는 자산이 될지도 모른다.
그때가 되면 아마 진정한 대번영의 시대일 것이다.



