지난밤, 실리콘밸리는 AI 신들의 전쟁을 겪었다

Gemini 3.8 Flash와 Meta Muse Spark 1.3이 같은 날 출시되어 추론 비용이 수 배로 감소했고, 스타트업 Mostik의 획기적인 실험으로 모델 통신 비용이 1/20로 낮아지면서 AI 경제학은 '백만 토큰당'에서 '작업당 비용'으로의 패러다임 전환을 맞이하고 있다.

저자: Max, 01 Founder

편집: Max

어젯밤 실리콘밸리에서는 세 가지 큰 사건이 있었다.

Google은 Gemini 3.8 Flash를, Meta는 Muse Spark 1.3을 발표했고, 그동안 아무도 주목하지 않던 스타트업 Mostik은 권위 있는 매체 WIRED의 인터뷰에 올랐다.

앞의 두 가지만 보면, 평범한 AI 벤치마크 경쟁의 밤처럼 보인다.

Google이 Gemini를 DeepSWE 1위에 올려놓은 지 몇 시간 만에 Meta가 더 높은 점수를 공개했고, 세계 1위 타이틀은 고작 몇 시간밖에 유지되지 못했다.

2026년이 된 지금, 이런 일에는 사람들이 거의 무감각해졌다.

모델 출시, 벤치마크 경신, X에서 몇 시간 동안 축하, 그리고 다음 회사가 다시 기록을 갈아치우기를 기다리는 것.

하지만 어젯밤의 세 가지 사건을 함께 놓고 보면, 정말 주목해야 할 것은 그 순위표에 전혀 없다고 생각한다.

AI 경제학에 돌연변이가 일어나고 있다.

지난 몇 년간 우리는 AI 비용을 논할 때 백만 토큰당 얼마인지를 가장 자주 봤다.

하지만 Agent가 등장한 이후, 이 측정 방식은 점점 한계를 드러내고 있다.

앞으로 진짜 중요한 질문은 “백만 토큰에 얼마인가”가 아니라, 버그 하나를 고치는 데 얼마인지, 리서치 하나를 완성하는 데 얼마인지, Agent 하나를 세 시간 연속으로 돌리는 데 도대체 얼마인지가 될 것이다.

그리고 어젯밤, 추론 비용은 완전히 다른 여러 방향에서 동시에 내려가고 있었다.

Google은 프런티어급 성능을 점점 더 저렴한 모델에 밀어 넣고 있고, Meta는 Agent가 같은 작업을 더 적은 토큰과 도구 호출로 완료하게 만들고 있다. Mostik은 한 걸음 더 나아가 다음과 같은 질문을 던지기 시작했다.

통신하는 양쪽이 모두 AI라면, 모델끼리 굳이 인간을 위해 설계된 언어로 대화할 필요가 있을까?

PART.01. Gemini가 돌아왔다

먼저 Google부터 보자.

Google은 새로운 플래그십 모델 Gemini 3.8 Flash를 공개했으며, 공식적으로 이를 지금까지 가장 강력한 추론 및 코드 모델이라고 밝혔다.

Image

이는 Google이 6주 동안 Flash 시리즈에 대해 세 번째로 진행한 업데이트이기도 하다. 3.6에서 3.7, 그리고 지금의 3.8까지.

과거 Flash에 대한 인식은 항상 단순했다. 더 빠르고 더 저렴하지만, 최상위 모델보다는 성능이 조금 떨어진다는 것.

Google은 이제 그 정의를 조금씩 바꿔가고 있다.

이번 3.8 Flash의 핵심 개선은 long-horizon coding과 agentic workflow에 집중되어 있다.

AI의 장기 소프트웨어 엔지니어링 능력을 측정하는 DeepSWE v1.1에서 약 74%의 점수를 기록했다.

DeepSWE와 기존 코드 벤치마크의 가장 큰 차이는, 모델에 알고리즘 문제 하나를 던지는 것이 아니라 실제로 Agent를 코드 저장소에 투입한다는 점이다.

모델은 문제를 이해하고, 코드를 검색하고, 파일을 수정하고, 도구를 호출하고, 테스트를 실행하며, 실패하면 계속 원인을 찾아야 한다.

하나의 완전한 작업은 수십, 심지어 수백 단계까지 이어질 수 있다.

이런 테스트에서 Gemini 3.8 Flash는 한때 세계 1위에 올랐다.

Image

Claude Opus 5 역시 약 74%, GPT-5.6 Sol은 약 73%, 이전에 선두였던 Fable 5는 약 70%다.

능력만 보면, 이들 최상위 모델 사이에는 더 이상 특별히 큰 격차가 없다.

정말 무서운 것은 다른 숫자다. 바로 돈이다.

Gemini 3.8 Flash의 API 출시 가격은 여전히 입력 0.75달러/1M 토큰, 출력 3.75달러/1M 토큰으로 유지된다.

DeepSWE에서 완전한 작업 하나를 완료하는 평균 비용은 고작 2.36달러에 불과하다.

이에 비해 비슷하게 약 74%를 기록한 Claude Opus 5는 작업당 평균 비용이 11.84달러에 달하고, 약 73%인 GPT-5.6 Sol도 평균 비용이 6.46달러다.

Image

즉, 같은 수준의 소프트웨어 엔지니어링 능력이라도 실행 비용은 이미 몇 배까지 차이 날 수 있다.

이는 Agent 시대에 매우 중요해질 것이다.

챗봇 시대에는 답변 한 번이 몇 푼 비싸거나 싸도 일반 사용자는 거의 체감하지 못한다.

하지만 Agent는 완전히 다르다. 코딩 Agent는 100단계를 연속으로 실행할 수 있고, 리서치 Agent는 수십 개의 웹페이지를 검색하고 수백 페이지의 자료를 읽을 수 있으며, 미래에는 기업의 Agent가 몇 시간씩 연속으로 일할 수도 있다.

Google 공식 측은 심지어 3.8 Flash가 복잡한 작업을 만나면 능동적으로 더 열심히 일하며, 더 많은 추론과 도구 호출을 수행한다고 언급했다.

Google은 비용을 아끼기 위해 모델이 “덜 생각하게” 만든 것이 아니라, 토큰이 이미 충분히 저렴해졌기 때문에 더 긴 루프를 돌도록 허용한 것이다.

그래서 내 생각에 3.8 Flash에서 진짜 중요한 점은 또 한 번 세계 1위를 차지했다는 것이 아니다.

과거에는 가장 비싼 프런티어 모델만 제공할 수 있던 능력을 Flash 가격대에 억지로 밀어 넣고 있다는 점이다.

PART.02. 세 시간 반 만에 Meta가 반격했다

Google 사람들이 Gemini 3.8 Flash 출시를 축하하고 있을 때, Meta가 갑자기 반격에 나섰다.

Meta는 갑자기 Muse Spark 1.3 모델을 공개했다.

Meta가 발표한 평가에 따르면, Muse Spark 1.3은 DeepSWE v1.1에서 75.4%를 기록했다.

이 수치는 Gemini 3.8 Flash, Claude Opus 5, GPT-5.6 Sol을 모두 넘어선 것이다.

Image

더 놀라운 것은, Muse Spark 1.2의 이 테스트 성적이 약 55%에 불과했다는 점이다.

1.2에서 1.3으로, 마이너 버전 업데이트 한 번에 약 20%포인트가 뛰어오른 셈이다.

하지만 이번 Meta 발표에서 진짜 볼 만한 것 역시 75.4%가 아니라고 본다.

또 다른 두 숫자가 있다. 도구 호출 약 20% 감소, 토큰 소비 약 25% 감소.

Image

이 부분은 쉽게 간과되지만, 사실 Agent가 본격적으로 상업화된 이후 가장 중요한 문제에 매우 가깝다.

Agent가 돈을 가장 많이 낭비하는 경우는 정상적인 사고가 아니라, 길을 잘못 드는 경우가 많다.

예를 들어 코딩 Agent가 20번째 단계에서 요구사항을 잘못 이해하면, 파일 다섯 개를 계속 수정하고 테스트를 세 차례 돌리고 코드를 대량으로 검색한 뒤에야 경로가 틀렸다는 것을 깨닫고 전부 처음부터 다시 할 수 있다.

수십 번의 도구 호출과 수만 토큰이 그렇게 낭비된다.

따라서 모델이 작업의 모호성을 더 일찍 발견하고, 자신이 해낼 수 없다는 것을 더 일찍 알고, 사용자에게 더 일찍 질문할 수 있다면, 그것은 곧 직접적인 비용 절감이다.

Muse Spark 1.3이 이번에 강화한 능력 중 상당수가 이런 부류에 속한다. 긴 스레드에서 여러 워크플로를 동시에 유지할 수 있고, 모호한 작업을 만나면 능동적으로 질문하며, 해결할 수 없는 문제는 능동적으로 도움을 요청하고, 되돌릴 수 없는 작업은 먼저 확인하며, 긴 작업을 여러 차례 수행한 뒤에도 처음의 제약 조건을 더 잘 잊지 않는다.

Meta는 심지어 모델이 자신의 능력 경계를 인식하는 것을 강조하기 시작했다. 자신이 무엇을 할 수 있는지 알고, 무엇을 할 수 없는지도 안다는 것이다.

Image

이런 능력은 챗봇 시대에는 벤치마크 20점 상승만큼 매력적으로 보이지 않을 수 있지만, Agent 시대에는 모두 곧바로 돈으로 환산될 수 있다.

Agent가 실수를 한 번 덜 하는 것 자체가 곧 추론 최적화다.

따라서 Google과 Meta를 함께 놓고 보면, 대형 모델 경쟁의 측정 단위가 조용히 바뀌고 있다.

앞으로 사람들은 “백만 토큰에 얼마인가”에는 점점 덜 신경 쓰고, 대신 다른 숫자에 더 주목하게 될 것이다.

실제 작업 하나를 처음부터 끝까지 실행하는 데, 도대체 얼마가 드는가.

PART.03. Mostik, 파괴적인 돌파구

Google과 Meta가 더 저렴하고 더 적은 토큰으로 작업을 완료하는 방법을 여전히 연구하고 있다면, Mostik은 더 근본적인 문제를 다루기 시작했습니다:

이 토큰들은 왜 반드시 존재해야 하는가?

Mostik은 러시아어로 ‘다리’를 뜻한다.

Image

CEO Sasha Malysheva가 이 방법론의 주요 개발자이며, 수석 과학자는 제네바대학교 교수이자 2010년 필즈상 수상자인 Stanislav Smirnov이다.

이들은 듣기에는 아주 단순하지만 실제로는 극도로 어려운 일을 시도하고 있다. 두 AI 모델이 더 이상 자연어로 소통하지 않게 만드는 것이다.

오늘날 대부분의 멀티 에이전트 시스템은 이렇게 작동한다.

모델 A는 어떤 정보를 얻은 뒤 먼저 수백에서 수천 개의 토큰을 생성해 자신의 결론을 자연어로 말한다. 모델 B는 그 텍스트를 전부 읽어 들여 다시 이해하고 자신만의 내부 표상을 구축한 다음 추론을 이어간다.

하지만 문제는, 대형 모델 내부에서 실제로 계산이 이뤄지는 대상이 애초에 중국어나 영어가 아니라 다음과 같은 것이라는 점이다.

고차원의 연속적인 수학적 표상.

이는 마치 두 대의 컴퓨터가 직접 데이터를 주고받을 수 있는데도, 컴퓨터 A가 파일을 수백 장의 종이로 인쇄한 뒤 컴퓨터 B가 카메라로 한 장씩 OCR로 다시 읽어 들이는 것과 같다.

그동안 사람들은 인쇄 비용을 낮추는 방법을 계속 연구해 왔지만, Mostik은 아예 프린터를 버리자고 한다.

이들은 서로 다른 모델의 내부 표상 사이에 ‘다리(Bridge)’를 구축해, 모델이 자연어를 먼저 생성하는 대신 잠재 표상(latent representation)을 직접 교환하게 하려고 한다.

실리콘밸리의 권위 있는 매체 WIRED가 공개한 한 실험은 매우 흥미롭다.

Mostik은 풀 버전 GLM-5.2 753B와, 모바일 기기에서 실행 가능한 4B 크기의 Qwen 3.5를 브리지로 연결했다.

그 결과 얻은 하이브리드 시스템의 성능은 두 모델의 중간 수준이었지만, 추론 비용은 풀 버전 GLM-5.2의 1/20에 불과했다.

물론 지금 당장 Mostik이 모델 간 통신 문제를 해결했다고 말하기는 확실히 이르다.

잠재 통신(latent communication) 자체도 어제 처음 등장한 개념은 아니다. 지난 몇 년간 임베딩, 히든 스테이트, KV 캐시 등 내부 표상을 교환하려는 연구가 이미 여럿 있었다.

정말 어려운 문제는, 서로 다른 모델의 아키텍처·파라미터·학습 데이터·내부 좌표계가 모두 다르다는 점이다. 두 모델이 서로의 잠재 공간을 진짜로 이해하게 만드는 것 자체가 매우 어려운 문제다.

Smirnov 자신도 현재로서는 서로 다른 모델 간의 공통 표상을 기술할 성숙한 수학적 언어조차 아직 부족하다고 인정했다.

그럼에도 1/20이라는 숫자는 나를 크게 흥분하게 만들었다.

완전히 다른 미래 AI 아키텍처를 진지하게 생각해 보게 만들었기 때문이다.

PART.04. 미래에는 0.xB짜리 모델 하나면 충분할 수 있다

지난 2년간 온디바이스 AI를 논할 때 우리는 더 큰 모델을 휴대폰에 집어넣는 방법을 계속 연구해 왔다. 7B, 4B, 3B, 1B로 계속 증류·양자화·압축해 온 것이다.

하지만 Mostik의 이 노선이 끝내 실제로 통한다면, 미래의 휴대폰에는 ‘뭐든 다 하는’ 대형 모델이 애초에 필요 없을 수도 있다고 나는 생각한다.

기기에는 0.xB 또는 몇 B 수준의 소형 모델 하나만 실행되면 될 수 있다.

그 모델은 매우 저렴해서 상시 실행할 수 있고, 사용자가 지금 어떤 앱에 있는지, 방금 무엇을 했는지, 기기가 어떤 상태인지를 이해하며, 단순하고 빈도 높은 작업 대부분을 처리한다.

정말 어려운 문제에 부딪혔을 때만 잠재 공간 통신을 통해 원격의 대형 모델을 호출한다.

하지만 핵심적인 차이는, 오늘날처럼 10만 토큰짜리 컨텍스트를 전부 클라우드로 다시 보내 원격 모델이 처음부터 다시 읽게 할 필요가 없다는 점이다.

고도로 압축된 잠재 상태(latent state) 한 조각만 전송하면 될 수 있다.

Image

원격의 대형 모델이 복잡한 추론을 마친 뒤에도, 로컬 모델에게 수천 토큰짜리 자연어 설명을 다시 생성해 줄 필요가 없을 수 있다. 새로운 내부 표상을 직접 돌려보내면 된다.

이렇게 되면 로컬의 소형 모델은 고빈도·저비용·상시 실행을 담당하고, 클라우드의 프런티어 모델은 빈도는 낮지만 정말 어려운 추론만 담당하며, 그 사이는 어떤 브리지로 효율적으로 통신하게 된다.

미래에 정말 이것이 가능해진다면, 추론 비용 하락 폭은 오늘날 모델 API 가격이 30%나 50% 내리는 수준을 훨씬 넘어설 것이다.

AI 컴퓨팅을 조직하는 방식 자체가 바뀔 수 있다.

PART.05. 맺음말

그래서 어젯밤을 돌아보면, 표면적으로는 완전히 다른 세 가지 뉴스였다.

Google은 Gemini 3.8 Flash를 출시해 프런티어급 성능을 Flash 가격대에 밀어 넣었다.

Meta는 Muse Spark 1.3을 출시해 에이전트가 더 적은 토큰과 툴 호출로 더 많은 일을 하게 만들었다.

Mostik은 한발 더 나아가, 모델 간 토큰 일부를 애초에 생성하지 않도록 시도하기 시작했다.

이들은 사실 모두 같은 변화를 가리킨다.

지능이 매우 과장될 정도로 빠르게 저렴해지고 있다는 것.

게다가 이제 이런 가격 하락은 단순한 API 단가 인하에 그치지 않는다.

모델 가격이 내려가고, 작업을 완수하는 데 필요한 연산량이 줄어들고 있으며, 이제는 모델 간 정보 교환 방식마저 새로 설계되기 시작했다.

이 일이 마지막에 가져올 영향은 벤치마크 점수가 몇 퍼센트포인트 오르는 것보다 훨씬 클 수 있다.

많은 기술이 진짜로 폭발하는 순간은 ‘처음으로 사용 가능해진 때’가 아니라 ‘마침내 아무렇게나 써도 될 만큼 저렴해진 때’이기 때문이다.

오늘날 에이전트 하나가 평범한 사람의 작은 작업 하나를 처리하는 데 수십 달러가 든다면, 아마 전혀 수지가 맞지 않을 것이다.

미래에 몇 푼밖에 들지 않게 된다면, 지금은 아무도 고려하지 않을 많은 애플리케이션이 갑자기 성립하게 된다.

오늘날 우리는 수십 개의 에이전트가 한 사람을 중심으로 24시간 계속 돌아가게 할 수 없다. 추론 비용이 한두 자릿수 더 내려간다면, 그것이 기본 상태가 될 수도 있다.

지금은 아침 7시다. 원래 몇 시간 전에 잤어야 했다.

그런데 Gemini가 발표되고, 몇 시간 뒤 Meta가 다시 따라붙었고, 그러다 Mostik의 1/20 실험을 보게 됐다.

침대에 누운 뒤에도 머릿속에서 계속 이 생각들이 맴돌았다. 휴대폰 속 0.xB 모델, 클라우드의 대형 모델, 그리고 그들이 더는 자연어로 서로 대화할 필요가 없을지도 모른다는 생각.

생각하면 할수록 잠이 오지 않아 결국 다시 일어나 이 글을 끝까지 써 내려갔다.

Gemini의 74%, Muse의 75.4%는 며칠 뒤면 새로운 숫자가 나와 덮어 버릴지도 모른다.

하지만 지금 이 흥분을 가라앉히기는 정말 어렵다.

누가 또 세계 1위를 차지했는가보다, 나는 점점 더 다른 문제가 궁금해지고 있기 때문이다.

이렇게 똑똑한 AI는 과연 끝내 어디까지 저렴해질 수 있을까?

강력한 지능이 정말로 마음껏 호출해도 될 만큼 저렴해지는 순간, 오늘날에는 아직 매우 터무니없어 보이는 많은 AI 제품이 이제 막 시작될지도 모른다고 나는 생각한다.

공유하기:

작성자: 01Founder

이 글은 PANews 입주 칼럼니스트의 관점으로, PANews의 입장을 대표하지 않으며 법적 책임을 지지 않습니다.

글 및 관점은 투자 조언을 구성하지 않습니다

이미지 출처: 01Founder. 권리 침해가 있을 경우 저자에게 삭제를 요청해 주세요.

PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
PANews APP
미시간주 법원, Kalshi에 예비 금지 명령 내려…위반 시 일일 50만 달러 벌금
PANews 속보