저자: 율동(律动)
10월 8일, Anthropic이 Haiku 5.5를 출시했다. 10만 토큰을 넘지 않는 짧은 요청의 경우, 백만 토큰당 입력 0.1달러, 출력 0.5달러를 받는데, 이는 전 세대 Haiku 4.5의 10분의 1에 불과하다.
그날 오전, Dragonfly 매니징 파트너 Haseeb Qureshi가 X에 Artificial Analysis의 산점도 두 장을 올리고 한 줄을 덧붙였다.
「If you want the cheapest LLMs, you should now buy American.」
(가장 저렴한 대형 모델을 원한다면, 이제 미국산을 사야 한다.)
산점도의 가로축은 벤치마크 작업 한 번을 완료하는 데 드는 비용이고, 세로축은 점수다. 모든 최적해를 잇는 저 점선은 미시경제학에서 파레토 프런티어라고 부르는데, 선 위의 모든 점은 동일한 비용에서 더 똑똑한 모델을 찾을 수 없다는 뜻이다.
6월의 그래프에서 점선의 가장 저렴한 끝부분에는 샤오미 MiMo, DeepSeek V4 Pro, MiniMax-M3, 즈푸 GLM-5.2가 있었는데, 거의 전부 중국 대형 모델의 이름이었다.
10월 8일이 되자, 선 전체가 Anthropic과 OpenAI에게 넘어갔다. 중국 모델은 MiMo 하나만이 간신히 가장자리에 매달려 있을 뿐, 즈푸 GLM-5.3-Flash와 DeepSeek V4.1 Flash는 Haiku 5.5의 오른쪽 아래로 밀려났다. 즉, 그에 비해 더 많은 비용을 쓰고 더 낮은 점수를 받는다는 뜻이다.
그날 홍콩 증시가 개장하자 대형 모델 관련주가 일제히 하락했다. 오전 10시 26분, MiniMax의 낙폭은 10%로 확대됐고, 즈푸는 5.6% 하락했다. 장중 항셍테크지수는 1.93% 하락했는데, 대형 모델 신흥 강자 두 곳은 시장보다 약 5배 더 크게 하회했다.
지난 2년간 중국의 오픈소스 및 고가성비 모델은 글로벌 대형 모델 시장에 킬 라인을 단단히 박아두었다. 가격을 바닥까지 눌러버리기만 하면, 해외의 대량 판매형 클로즈드소스 모델은 버티기 어려웠다. 실리콘밸리의 스타 기업들은 줄을 서서 하부 파이프라인을 중국 오픈소스 대형 모델로 교체했다.
이제, 판이 뒤집혔다.
킬 라인이, 킬 당했다.
킬 라인의 형성
2023년 3월 GPT-4가 막 출시됐을 때, 8K 컨텍스트 버전의 공식 가격은 백만 입력당 30달러, 출력 60달러였다.
지능이 극도로 희소했고, 공급은 극소수 실리콘밸리 과점 기업이 독점했으며, 가격은 완전한 판매자 시장이었다. '지능은 따로 프리미엄을 받을 수 있다'고 믿던 밀월기였다.
이 신화를 깨뜨린 것은 중국의 퀀트 헤지펀드가 키워낸 기술 팀이었다. 2024년 5월 6일, DeepSeek이 V2를 출시했다. 총 파라미터 2360억 개, 토큰당 활성화되는 파라미터는 210억 개에 불과했다. MLA 아키텍처와 극한의 엔지니어링 다이어트를 통해 팀은 KV cache를 93.3% 줄였고, 처리량은 5.76배로 끌어올렸다. 절약한 연산 자원은 곧바로 상업 가격으로 환산되어, 백만 입력당 1위안, 출력 2위안이 됐다.
중국 대형 IT 기업들은 거의 강제로 끌려가듯 가격 전쟁에 뛰어들었다.
5월 15일, 바이트댄스 화산엔진이 더우바오를 출시하며 주력 모델에 0.0008위안/천 토큰의 기업가를 제시하고, 업계 평균보다 99.3% 저렴하다고 선전했다. 5월 21일, 알리바바 클라우드는 통이첸원 시리즈의 낭떠러지식 가격 인하를 발표하며 Qwen-Long 입력단을 백만 토큰당 0.5위안으로 낮췄고, 몇 시간 뒤 바이두 원신의 주력 모델 두 종은 곧바로 무료화를 선언했다.
8월이 되자 DeepSeek은 한발 더 나아가 하드디스크 캐시 기술을 도입해, 캐시 적중 입력 토큰을 백만 개당 0.1위안만 받았다.
당시 태평양 건너편에서는 거물들이 전면적으로 따라붙지 않았다. 2024년 7월 OpenAI가 GPT-4o mini를 출시하며 입력·출력을 0.15달러와 0.6달러로 낮췄지만, 4개월 뒤 Anthropic이 내놓은 Claude 3.5 Haiku의 가격은 오히려 전 세대의 4배였다. 당시 Dario Amodei의 논리는, 모델이 더 똑똑해졌으니 가격에 지능의 진보가 반영되어야 한다는 것이었다.
실리콘밸리가 뼛속까지 서늘함을 느낀 것은 2025년 1월이었다.
DeepSeek-R1이 혜성처럼 등장해 추론 성능이 OpenAI o1에 육박했는데, 출력 백만 토큰당 2.19달러에 불과했다. 당시 o1의 가격은 60달러였다.
1월 27일, 엔비디아는 하루 만에 시가총액 약 5890억 달러가 증발하며 미국 증시 역사상 최대 기록을 세웠다. Marc Andreessen은 이를 AI 분야의 스푸트니크 모멘트라고 불렀고, 마이크로소프트 CEO Satya Nadella는 소셜 미디어에서 제번스의 역설이 또 들어맞았다고 감탄했다.
킬 라인은 이렇게 형성됐다.
오픈 웨이트는 이 칼날을 더욱 날카롭게 만들었다. 클로즈드소스 모델 앞에서 고객은 몇 장의 독점 가격표 사이에서 셈을 할 수밖에 없었다. 그러나 웨이트가 공개되면, 개발자는 자신의 클러스터에서 사적으로 배포할 수도 있고, 어떤 서드파티 추론 클라우드에서든 같은 모델을 돌릴 수 있게 된다. 같은 모델에 여러 공급자가 생기고, 고객에게는 자체 배포라는 선택지가 더해지면서, 모델 제공자가 높은 프리미엄을 유지할 여지는 줄어들었다.
미국 현지 기업들이 먼저 강을 건넜다.
2025년 10월, 에어비앤비 CEO Brian Chesky는 공개적으로 회사의 지능형 고객 서비스 에이전트가 알리바바 첸원에 극도로 의존하고 있다고 밝혔다. 전체 시스템이 13개의 모델을 운용하는데, OpenAI의 최신 플래그십도 연결해두었지만 생산 파이프라인에서는 거의 호출되지 않는다고 했다. 더 나은 가성비의 대체재가 있기 때문이다.
같은 달, Cognition은 SWE-1.5를 출시하며 '업계를 선도하는 어떤 오픈소스 기반' 위에 구축됐다고 밝혔고, 즈푸는 곧이어 그 기반이 바로 GLM-4.6이라고 확인해주었다.
이어서 a16z 파트너 Martin Casado가 《이코노미스트》에 밝힌 바에 따르면, 오픈소스 모델 아키텍처를 들고 로드쇼에 나선 미국 AI 스타트업 중 약 80%가 중국 기반 모델을 쓰고 있었다.
올해 3월, 코드 에디터 Cursor가 Composer 2를 출시하며 백만 입력당 0.5달러, 출력 2.5달러로 가격을 책정했는데, 팀은 결국 기반 모델이 문즈안먼(Moonshot AI)의 Kimi K2.5를 파인튜닝한 것임을 인정했다.
개발자는 코드와 예산으로 투표하고 있다. Mozilla가 발표한 보고서에 따르면, OpenRouter에서 중국 오픈 웨이트 모델의 토큰 점유율은 2024년 말 2% 미만에서 2026년 4월 45% 이상으로 상승했다.
대량 판매와 구조화 호출의 생태적 지위에서, 거만한 클로즈드소스 모델은 한때 반격할 힘이 전혀 없었다.
대가
상대를 베어낸다고 해서 자신이 반드시 품위 있게 사는 것은 아니다.
Mozilla의 같은 보고서에는 또 다른 대조 데이터가 있다. 2025년 5월부터 9월까지, 오픈 모델은 OpenRouter 플랫폼 모델 사용량의 약 20%를 차지했지만, 모델 계층 수익은 약 4%만 가져갔다. 이는 특정 시기의 플랫폼 표본이라 글로벌 시장을 대표할 수는 없지만, 사용 점유율과 수익 점유율 사이의 괴리는 이미 뚜렷하다.
가치를 창조하는 것과 가치를 포획하는 것은 결코 같은 일이 아니다.
올해 1월, 즈푸와 MiniMax가 잇달아 상장의 종을 울렸다. 이후 공개된 중간 실적은 외부에 수익 성장 뒤에 숨은 비용과 손실을 들여다보게 했다.
즈푸의 상반기 매출은 9.54억 위안이었고, 그중 오픈 플랫폼 및 API 사업 매출이 8.25억 위안으로 86.5%를 차지했다. 이 사업의 매출총이익률은 마이너스에서 플러스로 돌아서 24.6%까지 올랐지만, 회사 전체로는 여전히 약 20.72억 위안의 순손실을 기록하며 전년 동기 대비 12.1% 축소됐다. 더 많은 토큰을 팔아 매출총이익이 나기 시작했지만, 회사의 전체 지출을 감당하기까지는 아직 거리가 있다.
MiniMax의 상반기 매출은 약 1.17억 달러로 전년 동기 대비 283.1% 증가했고, 순손실은 약 3.58억 달러로 전년 동기 대비 11% 축소됐다. 주식 기반 보상, 금융부채 공정가치 변동 및 상장 비용을 제외한 조정 순손실은 약 2.93억 달러로 전년 동기 대비 111.2% 확대됐다.
상장 이후, 저가가 가져온 성장은 또 다른 검증을 받아야 한다. 호출 한 번마다 과연 얼마의 매출총이익이 남는지, 그 매출총이익이 얼마나 많은 연구개발 및 운영 지출을 감당할 수 있는지 말이다. 매출은 빠르게 늘지만, 회사 전체의 흑자까지는 여전히 멀다.
올해 늦봄, 에이전트 열풍이 연산 소비를 임계점까지 밀어붙였다.
오픈소스 프로젝트 OpenClaw가 전 세계 개발자 커뮤니티를 휩쓸며, 3월 초 OpenRouter에서의 누적 토큰 소비가 8.52조 개를 돌파해 1위에 올랐다. 3월 중순의 한 주 동안, 중국 모델은 단일 주간 7.36조 토큰을 소화하며 전주 대비 56.9% 급증했다.
2월 12일 출시된 GLM-5는 한때 호출 순위 1위에 올랐고, 폭발적인 수요가 순식간에 인프라 할당량을 뚫어버렸다. 해외와 중국 개발자들은 GLM Coding Plan에서 초 단위 지연과 잦은 속도 제한이 발생한다고 집중적으로 불만을 쏟아냈는데, 이는 중국 선두 AI 팀이 처음으로 공개적으로 연산 자원 부족을 호소한 사례였다.
2월 23일, 즈푸의 주가는 하루 만에 약 23% 폭락하며 하루에 700억 홍콩달러가 넘는 시가총액이 증발했다.
이어서 찾아온 것은 방어적 가격 인상이었다.
즈푸는 GLM-5 출시 때 요금을 올렸고, 3월의 GLM-5-Turbo는 가격을 다시 20% 올려 전 세대 사양 대비 평균 83% 비싸졌다.
DeepSeek이 4월 24일 출시한 V4-Pro는 총 파라미터 1.6조 개로, 출시 즉시 75%의 최대 할인을 적용했다. 이 불길은 먼저 동종 업계로 번져, MiniMax는 이틀 연속 약 9%와 10% 하락했다.
하지만 8월 중순이 되자 DeepSeek 역시 시간대별 요금제로 전환해, V4-Pro의 피크 시간대 출력이 백만 토큰당 3.96달러까지 치솟았고, 캐시 적중 비용은 12배 이상 올랐다.
7월, 문즈안먼이 Kimi K3를 출시하며 API 가격을 백만 입력당 3달러, 출력 15달러로 올렸는데, K2.6보다 무려 3배 이상 비쌌다.
다만 놀랍게도, 가격 인상이 극심한 고객 이탈을 불러오지는 않았다.
즈푸 CEO 장펑은 공개적으로 1분기 가격을 83% 올린 뒤 API 호출 규모가 오히려 400% 급증했다고 밝혔다. 8월 말까지 즈푸 MaaS 플랫폼의 연환산 매출은 16억 달러까지 치솟았고, API 사업 매출총이익률은 기적적으로 24.6%로 플러스 전환했다.
연산 자원이 수요를 따라가지 못한 몇 달간의 시간 창구에서, 중국 모델 팀은 처음으로 얻기 힘든 가격 결정권을 손에 쥐었다.
그러나 한때 해외 거물들을 잠 못 이루게 했던 그 킬 라인도, 어느새 그들 스스로 밀어 올리고 있었다.
전격전
태평양 건너편은 여름에 전략적 방향 전환을 마쳤다.
6월 말, Anthropic이 Sonnet 5를 출시하며 백만 입력당 2달러, 출력 10달러의 출시 프로모션 가격을 내걸었고, 원래는 9월에 3달러와 15달러로 복귀한다고 명시했었다.
그런데 7월이 되자 OpenAI가 GPT-5.6 시리즈를 출시하고, 3주 뒤 갑자기 전격전을 개시해 Luna 가격을 80% 낮추며 입력단을 0.2달러, 출력단을 1.2달러로 떨어뜨렸다.
OpenAI는 이번 가격 인하를 순수한 하부 엔지니어링 재구성 덕분이라고 설명했다. 다시 작성한 GPU kernel이 엔드투엔드 서비스 비용을 약 20% 낮췄고, 재학습한 투기적 디코딩 초안 모델이 생성 처리량을 15% 이상 끌어올렸다는 것이다.
8월 10일, Anthropic은 가격 인상 공지를 철회하고 Sonnet 5의 저가를 영구 고정한다고 발표했다.
9월 22일, Anthropic은 Opus 5.5를 꺼내 들며 종합 사용 비용을 40% 낮췄고, 같은 날 OpenAI는 GPT-6 Sol과 Luna를 출시하며 Luna의 입문 가격을 입력 0.1달러, 출력 0.5달러로 고정했다. 그 뒤를 이어 등장한 것이 바로 Haiku 5.5였다.
2년 전 '지능은 반드시 별도의 프리미엄을 누려야 한다'고 믿었던 Anthropic이, 스스로 자신의 라벨을 찢어버린 것이다.
이제 대형 모델 출시 때의 화법도 달라졌다. 더 이상 MMLU의 근소한 우위를 단순히 나열하지 않고, 달러당 산출량, 지연 시간, 추론 단계마다 소모되는 엔지니어링 효율을 반복해서 강조하기 시작했다.
게다가 Haiku 5.5 공개와 동시에, Anthropic은 구독 사용자에게 전면적으로 API 크레딧을 배분한다고 발표했다. Max 등급은 매달 100~200달러를 지급하고, 기업 Team 사용자는 최대 500달러의 차감 혜택을 받을 수 있다.
이 수는 정곡을 찔렀다. 가격표의 할인은 단일 호출 결정에만 영향을 주지만, 일단 고객의 코드 엔지니어링과 에이전트 오케스트레이션이 적응을 마치면, 이전을 가로막는 장벽은 성벽처럼 높아진다.
미국 거물들이 감히 이 가격 전쟁을 벌일 수 있는 것은, 헤아릴 수 없이 깊은 자금 풀과 공급망 특권 덕분이다.
Anthropic의 연환산 영업 수익은 2025년 말 약 90억 달러에서 올해 7월 말 650억 달러 이상으로 폭증했다. 5월에 완료된 650억 달러 규모의 자금 조달은 그 가치를 곧바로 9650억 달러로 끌어올렸다.
연산 자원 측면에서 Anthropic은 4월에 Google, 브로드컴과의 협력 확대를 발표하며, 멀티 기가와트급 차세대 TPU 연산 용량을 확보했고, 2027년부터 순차적으로 가동될 예정이다.
이에 비해 즈푸는 연내 유상증자 및 전환사채를 통해 700여억 홍콩달러를 어렵게 조달했는데, 달러로 환산하면 Anthropic 단일 라운드 탄약의 7분의 1에도 미치지 못한다.
돈을 낼 수 있는 곳은 여전히 슈퍼 거물뿐이다.
2차 시장의 청산은 본래 냉정하다.
즈푸는 1월 8일 홍콩 증시에 상장했고, 공모가는 116.2홍콩달러였다. 봄의 연산 자원 부족도 강세론자들의 광기를 막지 못해, 6월 22일 주가는 2980홍콩달러까지 치솟았고 시가총액은 한때 1.33조 홍콩달러라는 천장에 닿았다.
그 뒤로는 긴 하락이었다.
7월 보호예수 물량이 해제되고, 두 차례의 유상증자가 증자 가격을 1588홍콩달러에서 714홍콩달러까지 끌어내렸다. 7월 16일 Kimi K3 등장 다음 날, 즈푸는 하루 28.48% 급락했다. 9월 22일 Opus 5.5와 GPT-6가 함께 출격하자, 즈푸의 낙폭은 다시 10%를 넘었다.
9월 25일, 즈푸는 장중 610.5홍콩달러까지 바닥을 찍었고, 총 시가총액은 3000억 홍콩달러 부근으로 쪼그라들며 사상 최고점 대비 약 80% 후퇴했다.
MiniMax의 궤적도 참혹했다. 1330홍콩달러의 정점에서 추락해, 보호예수 해제 당일 17.98% 급락했고, 7월 중순 216홍콩달러에 마감했다. 상반기 매출의 약 60%가 해외 고객에 의존하는데, 해외야말로 미국 거물들의 가격 인하 폭풍이 가장 먼저 덮친 전장이었다.
밸류에이션 기준도 조이기 시작했다. 언론 보도에 따르면, 제프리스는 9월 보고서에서 즈푸 클라우드 사업에 적용되는 2026년 예상 연환산 매출 밸류에이션 배수를 50배에서 30배로 낮췄는데, 하락폭은 40%였다.
중국 모델은 한때 극한의 가성비로 거물들의 입에서 먹이를 빼앗아 왔지만, 이제 그 길은 태평양 건너편에서도 통하게 됐다. 개발자는 싸서 몰려왔기에, 당연히 더 싼 곳으로 떠날 것이다.
0.1달러의 유령
2006년 8월 25일, Jeff Barr는 멕시코 카보산루카스의 후텁지근한 해변가에서 Amazon EC2 베타 버전을 소개하는 글을 써 내려갔다.
기술 설명의 끝에서 그는 상업사에 길이 남을 숫자를 적었다. 개발자가 가상 컴퓨팅 인스턴스 한 대를 임대하는 데 시간당 0.1달러라는 것이다.
그 뒤의 이야기는 모두가 안다. AWS는 이후 10여 년간 100회가 넘게 가격을 자발적으로 인하했고, 2014년에는 S3 스토리지 요금만 51% 반토막 냈다.
클라우드 컴퓨팅은 같은 연산 자원을 점점 더 비싸게 팔아서 패권을 이룬 적이 없다. 규모, 자체 개발 칩, 극한의 운영이 짜낸 한계 이익 한 푼 한 푼을 끊임없이 최종 시장에 되돌려주고, 그로써 더 많은 개발자를 끌어들였다. 지속적으로 가격을 낮춘 AWS는 결국 연매출 약 1300억 달러, 영업이익률 35.4%에 달하는 현금 창출원으로 성장했다.
가격 전쟁은 규모 독점자의 마지막 포위 섬멸 전술이다.
오늘날 모델 가격을 10분의 1로 낮추고 출시 즉시 전 세계 3대 퍼블릭 클라우드 진열대에 깔아버릴 수 있는 사람은, 토큰을 팔 뿐만 아니라 토큰을 소화하기도 한다. Anthropic은 API 가격을 피로 물들이면서도, 막대한 추론 연산 자원으로 Claude Code, Cowork, 그리고 자사의 엔드투엔드 에이전트 제품을 뒷받침한다.
중국 대형 모델 팀은 여전히 무기를 내려놓지 않았다. 9월 DeepSeek은 Flash 시리즈 요금을 다시 인하했고, 샤오미는 MiMo-Flash를 백만 토큰당 1위안의 한계까지 밀어붙였으며, 즈푸도 GLM-5.3-Flash 가격을 박리다매 구간에 고정했다. 하지만 판 위의 칩 규칙은 이미 다시 쓰였다.
저가 그 자체는 더 이상 배타성을 지닌 해자 카드가 아니다.
Artificial Analysis가 실시간으로 갱신하는 그 산점도 위에, 중국 기업의 이름은 하나도 빠지지 않았다. GLM, DeepSeek, Kimi, 첸원, MiniMax가 여전히 모두 있다.
다만, 그들은 이제 더 이상 그 킬 라인을 그어낼 수 없다.



