2026년 9월 15일, TypeSafe AI라는 회사가 스텔스 모드를 종료한다고 발표하면서 Jev라는 모델을 공개했다. 이후 24시간 동안 Vercel 유료 팀의 약 13%가 이 모델을 사용하기 시작했다. Vercel 측은 이번 출시를 자사 역사상 가장 빠르게 채택된 출시 중 하나라고 공식적으로 밝혔다. Cloudflare, LangChain, Langfuse도 며칠 안에 잇달아 네이티브 지원을 제공했다.
어떤 모델이 인프라 플랫폼에 빠르게 연동된다는 것은, 대개 그 모델이 충분히 구체적이고 충분히 아픈 문제를 해결한다는 뜻이다. 하지만 Jev라는 것은 언뜻 보기에 사람들이 익숙한 AI와 닮지 않았다. 시를 쓰지도 않고, 문서를 요약하지도 않으며, 완전한 자연어 답변조차 생성하지 않는다. 그 출력은 숫자 한 묶음이다. 확률, 점수, 신뢰도.
여기서 한 가지 질문이 생긴다. '말을 하지 않는' 모델이 왜 개발자들을 이렇게 흥분시키는가?
이 질문에 답하려면 먼저 Jev가 무엇인지 정확히 파악한 뒤, 그것이 실제로 무엇을 하는지, 주류 모델과 무엇이 다른지, 그리고 그 한계가 어디인지 살펴봐야 한다.
텍스트 생성을 하지 않는 모델
Jev의 공식 정의는 '시스템 1 모델'(System One Model)이다. 이 용어는 심리학자 대니얼 카너먼이 《생각에 관한 생각》에서 제시한 이중 처리 이론에서 나온 것이다. 시스템 1은 빠른 사고, 즉 직관적이고 생각 없이 판단을 내리는 방식이고, 시스템 2는 느린 사고로 추론과 계산이 필요하다. TypeSafe가 이 용어로 이름을 붙인 것은 경계를 명확히 긋기 위해서다. Jev는 시스템 1의 일만 하고, 시스템 2의 일은 하지 않는다.
더 정확히 말하면, Jev는 전통적인 의미의 대규모 언어 모델(LLM)이 아니다. 대규모 언어 모델의 작동 방식은 자기회귀 생성, 즉 토큰을 하나씩 이어 붙여 텍스트를 뱉어내는 것이다. Jev는 이런 일을 하지 않는다. 개발자가 state, 즉 현재 상태나 컨텍스트를 입력하고, 여기에 유형화된 질문 묶음을 주면, Jev는 구조화된 확률과 신뢰도 점수를 병렬로 출력한다. 이 질문의 유형은 세 가지뿐이다. Noul(예/아니오 판단), Choice(객관식), Score(평점). 출력은 사전 정의된 형식을 엄격히 따르며, 자유 텍스트도 없고 '잠깐 생각해 볼게요'도 없고 숫자만 있다.
이런 설계는 아주 구체적인 시나리오에 대응한다. 소프트웨어가 프로그램적으로 대량의 빠른 판단을 내려야 하는 경우다. 예를 들어 어떤 이메일이 스팸인지 판단하거나, 사용자 입력이 위반 콘텐츠에 해당하는지 판단하거나, 어떤 요청이 어느 경로로 라우팅되어야 하는지 판단하는 경우다. 기존 방식은 대규모 언어 모델을 호출해 텍스트 답변을 생성하게 한 뒤, 그 텍스트를 파싱해서 원하는 결론을 추출하는 것이다. 여기에는 지연이 있고, 파싱 실패 위험이 있으며, 결국 버려질지도 모르는 설명 텍스트를 생성하는 데 막대한 토큰이 소모된다. Jev의 방식은 생성을 건너뛰고 곧바로 판단을 내놓는 것이다.
이 회사를 만든 사람은 충분히 무게가 있는 인물이다. TypeSafe AI의 창업자 Diogo Almeida는 전 OpenAI 연구원이자 InstructGPT와 RLHF(인간 피드백 기반 강화학습)의 핵심 공동 발명자다. 이 두 기술은 ChatGPT와 GPT-4가 인간의 지시를 따를 수 있게 된 기반이다. Almeida는 2024년 OpenAI를 떠나 공동 창업자 Erik Gafni, Sasha Sheng과 함께 TypeSafe AI를 설립했고, 2년간의 스텔스 개발을 거쳐 2026년 9월 15일 제품 출시와 4000만 달러 규모의 시드 라운드를 동시에 발표했다. 리드 투자자는 DCVC다.
Jev라는 이름에도 유래가 있다. 19세기 경제학자 윌리엄 스탠리 제번스가 제시한 '제번스의 역설'에서 따온 것이다. 어떤 자원의 사용 비용이 낮아지면, 그 총 소비량은 줄어들기는커녕 오히려 늘어난다는 역설이다. 19세기에 증기기관의 효율이 높아져 석탄 소비 강도가 낮아지자, 결과적으로 석탄 총수요가 폭발적으로 증가했다. TypeSafe가 이 이름을 붙인 것은 자사의 사업적 기대를 설명하기 위해서다. AI 판단의 비용이 어느 수준까지 낮아지면, 소프트웨어에 내장되는 AI 판단의 총수요가 오늘날의 소수 고부가가치 시나리오에 머물지 않고 크게 늘어날 것이라는 기대다.
이런 배경을 이해하고 나면 Jev의 포지셔닝이 분명해진다. 이것은 더 나은 챗봇이 아니라, 오직 판단을 하기 위해 만들어진 컴포넌트다.
얼마나 빠르고, 얼마나 싼가
Jev가 주목받는 핵심 이유는 직접적이다. 잘하는 작업에서 확연히 빠르고, 확연히 싸다.
먼저 공식 수치부터 보자. TypeSafe는 Jev가 분류 같은 시스템 1 작업에서 동급 대규모 언어 모델보다 40200배 빠르고, 엔드투엔드 지연은 70500밀리초이며, 비용은 40~400배 낮다고 주장한다. 과금 방식도 특별하다. 입력 토큰은 백만 토큰당 0.042달러로 과금하고, 출력 토큰은 무료다. 일반적인 대규모 언어 모델은 보통 입력과 출력 모두 과금하며, 출력 단가가 입력보다 높은 경우가 많다.
공식 수치는 할인해서 봐야 한다. 하지만 서드파티 테스트가 내놓은 데이터의 방향은 일치한다.
Vercel 소프트웨어 엔지니어 Pranit Sharma는 직접 비교 실험을 했다. OpenAI 모델을 Jev로 교체해 보안 명령 분류기를 돌린 결과, 속도는 518배 빨라졌고 정확도는 오히려 더 높았다. Bryo AI의 CTO Nikhil Mudholkar는 Jev와 Gemini로 비즈니스 이메일을 분류했는데, 결과는 Gemini의 정확도가 약간 더 높았지만 비용은 1020배 더 들었고, Jev는 보정된(calibrated) 확률 점수를 반환해 자동화 워크플로의 후속 판단에 더 적합했다.
더 구체적인 숫자는 개발자 Tyler Folkman에게서 나온다. 그는 실험을 하나 했다. AI 에이전트 60개를 돌려 마을을 시뮬레이션하고, 하루 종일 의사결정을 하게 해 총 13200개의 결정을 만들어냈다. Jev에서는 이 하루를 돌리는 실제 비용이 0.35달러였다. 프런티어 모델의 과금 방식으로 같은 결정량을 시뮬레이션하면 비용은 37.64달러다. 환산하면 Jev의 결정당 비용은 약 0.0000265달러, 프런티어 모델은 0.00285달러로, 약 107배 차이다.
107배라는 구체적인 숫자는 주목할 만하다. 공식적으로 주장한 40~400배 구간 안에 들어가기 때문이다. 모든 시나리오가 107배 저렴해진다는 뜻은 아니다. 차이는 작업, 모델, 과금 방식에 따라 달라진다. 하지만 이 데이터 포인트는 특정 자동화 의사결정 시나리오에서 비용이 한 자릿수 이상 차이 나는 것이 마케팅 수사가 아니라 실제로 존재한다는 것을 보여준다.
속도 차이의 메커니즘도 짚어볼 필요가 있다. 전통적인 대규모 언어 모델이 분류 작업을 처리할 때는 긴 토큰 묶음을 생성해야 한다. 최종적으로 유효한 판단이 '안전' 또는 '불안전' 두 단어뿐이라 해도 말이다. 생성 과정은 자기회귀적이라 토큰이 하나씩 나오고, 지연은 출력 길이에 따라 선형적으로 늘어난다. '이것이 안전하다고 생각하는 이유는…' 같은 설명 텍스트까지 생성해야 한다면 비용은 더 커진다. Jev는 생성 과정 전체를 잘라내고 각 옵션의 확률을 병렬로 계산해 한 번에 끝낸다. 즉 지연은 주로 입력 길이에 의해 결정되고 출력과는 무관하다. 출력 토큰이 무료라는 가격 정책은 본질적으로 이런 사실을 인정하는 것이다. 그 추론 비용 구조에서 출력 측 부담이 무료로 해도 될 만큼 극히 작다는 사실을.
속도와 비용 외에 자주 간과되지만 그만큼 중요한 것이 하나 더 있다. 출력의 결정성(determinism)이다. 대규모 언어 모델은 자유 텍스트를 생성하므로 항상 파싱 실패 위험이 있다. 모델이 '안전!'이라고 출력할 수도 있고, 'This is safe.'라고 출력할 수도 있으며, JSON 바깥에 주석을 달 수도 있고, 갑자기 장황한 설명을 시작할 수도 있다. 개발자는 보통 이런 불확실성을 처리하기 위해 추가적인 파싱 및 오류 허용 코드가 필요하다. Jev의 출력은 엄격한 스키마를 따르므로 형식상 예상 밖의 일이 없다. TypeSafe는 이 점을 '타입 안전성'으로 요약했고, 여기서 회사 이름도 따왔다.
하지만 '타입 안전성'과 '무환각' 사이에는 반드시 명확히 구분해야 할 중요한 경계가 있다.
대체재가 아니라 보완 컴포넌트
Jev는 홍보에서 '환각이 불가능하다'고 묘사된다. 이 표현은 정확히 이해할 필요가 있다.
이 문구에 대한 공식 설명은 이렇다. Jev의 출력은 사전 정의된 JSON 스키마나 옵션을 엄격히 따르므로, 형식상 파싱할 수 없는 내용을 생성하지 않는다. 따라서 '환각 불가능'이 의미하는 것은 판단이 항상 옳다는 것이 아니라, 출력 형식이 항상 확정적이라는 것이다. 판단 자체는 틀릴 수 있다. 예를 들어 스팸이 아닌 이메일을 스팸으로 표시할 수 있다. 하지만 출력 형식에서 예상 밖의 일은 일어나지 않으며, JSON 안에 자유 텍스트 한 조각이 끼어들어 파서를 망가뜨리는 일도 없다.
이 구분은 Jev의 업계 내 위치를 이해하는 데 중요하다. 이것은 대규모 언어 모델을 대체할 수 있는 물건이 아니다. 공식 측도 Jev가 LLM의 드롭인 대체재(drop-in replacement)가 아니라고 거듭 강조한다. 이것으로 채팅을 할 수도, 글을 쓸 수도, '이 오퍼를 받아들여야 할까요?'라고 물을 수도 없다. 그것이 하는 일은 단 하나다. 명확한 작업에서 보정된 확률을 내놓는 것. 겉으로 드러나는 형태는 함수 호출, 즉 '프런티어 지능 함수 호출'(frontier-intelligence function call)에 더 가깝다. 소프트웨어 워크플로에 내장되어, 빠른 판단이 필요한 지점에서 호출된다.
이는 주류 대규모 언어 모델의 기술 노선과 대비를 이룬다. 현재 주류 모델은 RLHF나 RLVR로 학습되어 인간의 선호나 검증 가능한 보상에 대한 일치를 최적화하며, 출력은 자기회귀적으로 생성된 자연어다. 이 메커니즘은 개방형 작업에서 강력하지만, 고빈도·저지연·저비용이 필요한 판단 작업에서는 두 가지 대가가 따른다. 하나는 느리다는 것, 또 하나는 비싸다는 것. 그리고 부수적인 문제로 신뢰도가 흔히 과잉 확신에 빠진다는 점이 있다. 모델이 '95% 확신한다'고 말할 때 실제 정확도는 보통 95%에 미치지 못한다.
Jev는 다른 길을 택했다. TypeSafe는 자사가 채택한 학습 방법을 '보정된 의사결정 강화학습'(RLCD, Reinforcement Learning for Calibrated Decisions)이라고 부른다. 핵심 최적화 목표는 '출력 텍스트를 더 인간답게 만드는 것'이 아니라 '출력 신뢰도가 정확도와 엄격히 대응하게 만드는 것'이다. 높은 신뢰도는 반드시 높은 정확도와 대응해야 한다. '95% 확신'이라고 말하면서 정확도가 70%에 그쳐서는 안 된다. 이 점은 자동화 워크플로에서 특히 중요하다. 하위 코드가 확률 점수에 따라 행동 여부를 결정하기 때문이다. 점수가 신뢰할 수 없으면 자동화는 한낱 종이 조각에 불과하다. Bryo AI 테스트에서 언급된 '실제 보정 확률'이 바로 이 특성을 가리킨다.
학습 데이터 측면에서 TypeSafe는 전적으로 합성 데이터를 사용하며, 자체 개발한 병렬 샘플러를 결합해 문자열 생성을 포기했다고 밝혔다. 이로 인해 Jev는 아키텍처상 주류 LLM과 실질적인 차이를 갖는다. 하지만 구체적으로 어떤 아키텍처인지는 TypeSafe가 공개하지 않았다.
기반 아키텍처에 대한 이런 침묵은 온라인에서 논쟁과 의심을 불러일으켰다. Reddit의 한 개발자는 유사한 비자기회귀 확률 예측 아키텍처가 오픈소스 커뮤니티에서 1년 전에 이미 구현된 바 있다고 지적했다. 어떤 이는 Jev가 특정 오픈소스 가중치의 대규모 언어 모델을 기반으로 구축되고, 그 위에 전용 분류 레이어를 얹었을 것이라고 추측한다. 출시 직후 커뮤니티에는 OpenJev 같은 오픈소스 프로젝트가 등장했는데, Qwen3.5-4B 같은 모델을 기반으로 logits를 읽어 Jev의 동작을 근사적으로 재현하는 방식이다.
이런 논의는 현재 공식적으로 확인된 바 없다. TypeSafe는 Jev가 어떤 오픈소스 모델을 파인튜닝했는지, 병렬 샘플러의 구체적 구현도 공개하지 않았다. 확인할 수 있는 것은 Jev의 학습 방법인 RLCD와 합성 데이터가 TypeSafe 자신의 주장이라는 점이며, 기반 세부 사항은 여전히 블랙박스다.
잘하지 못하는 일들
TypeSafe는 공식 문서에 'Jaggedness'라는 제목의 목록을 실어, Jev 1.13 버전의 알려진 실패 모드를 나열했다. 이 목록의 솔직함은 AI 업체에서는 흔치 않은 수준이다.
수사 없이 말하자면, 이 모델은 많은 일을 잘하지 못한다. 수학 계산을 못 하고, 개수를 세지 못하며, 날짜는 비교적 자주 틀린다. 16진수 색상 값 같은 간접 비교를 처리하지 못한다. Score 평점의 수치 보정은 등급 간에 약해진다. 한 문장에 이중 부정이나 다중 홉 간접 참조가 들어가면 정확도가 떨어진다. 더 중요한 것은, 설명 가능성이 전혀 없다는 점이다. 확률 숫자 하나만 반환할 뿐 어떤 자연어 설명도 제공하지 않으며, '왜 85%인지'를 알려주지 않는다.
이것들은 우연한 버그가 아니라 이 기술 노선의 내재적 한계다. 자연어 생성을 포기한다는 것은 언어로 추론 과정을 표현하는 능력도 포기한다는 뜻이다. 시스템 1식 직관 판단은 원래 다단계 추론이 필요한 작업에 약하다. 이것이 Jev가 완전한 에이전트가 아니라 컴포넌트로 포지셔닝된 이유이기도 하다. 더 큰 소프트웨어 시스템 안에 놓여, 코드를 쓰는 사람이 언제 호출할지, 그 출력을 어떻게 해석할지, 실패 시 어떻게 대비할지를 결정해야 한다.
이 한계 목록을 이해하고 나서 공식 성능 주장을 다시 읽으면, 사실에 가까운 그림이 형성된다. Jev는 분류, 라우팅, 가드레일 같은 경계가 명확한 판단 작업에서 전통적인 LLM보다 한 자릿수 빠르고, 한 자릿수 저렴하며, 형식이 확정적인 출력을 확실히 제공할 수 있다. 하지만 작업이 복잡해져 계산이 필요하고, 추론이 필요하고, 설명이 필요해지면 그 신뢰성은 눈에 띄게 떨어지며, 게다가 언제 틀릴지 스스로 알지 못한다.
현재 공개된 서드파티 테스트를 보면, 모든 데이터는 특정 작업의 단기 비교에서 나온 것이며, Jev가 복잡한 장기 체인 기업용 워크플로에서 수개월 연속 운영된 안정성 데이터는 보이지 않는다. Vercel의 연동 데이터는 빠르게 시도되었다는 것을 보여주지만, 장기 리텐션과 실제 장애율을 도출할 수는 없다. 출력 토큰 무료라는 비즈니스 모델이 얼마나 지속될 수 있을지에 대해서도 TypeSafe는 설명을 내놓지 않았다.
왜 지금인가
처음의 질문으로 돌아가자. 말을 하지 않고 판단만 하는 모델이 왜 출시 24시간 만에 대량의 개발자에게 연동되었는가?
직접적인 이유 하나는, 그것이 해결하는 고통 지점이 매우 구체적이라는 점이다. 소프트웨어 자동화 워크플로에는 대량의 구조화된 판단이 필요하며, 이것이 바로 Vercel 같은 플랫폼과 그 사용자들이 가장 자주 마주하는 시나리오다. Vercel 팀이 보안 명령 분류에서의 성능을 테스트한 뒤 연동했다는 것은, 이것이 충분히 실용적이라는 뜻이다. Cloudflare는 엣지 추론을 하고, LangChain은 에이전트 프레임워크를 만든다. 이들 각각은 저지연·저비용·타입 안전한 판단 능력에서 이득을 얻을 수 있다.
더 깊은 이유는, AI 업계가 한 지점에 도달했다는 것이다. 대규모 언어 모델의 범용 생성 능력은 이미 매우 강력하지만, 그것을 소프트웨어 워크플로에 집어넣을 때 속도, 비용, 형식 불확실성이라는 세 가지가 병목이 되었다. Jev는 이 병목에 대한 하나의 해법이다. 그것은 어떤 파괴적인 지능 도약을 의미하지 않으며, 범위를 좁힌 대가로 얻은 비용 구조와 출력 신뢰성에 더 가깝다.
이것이 그 이름을 설명하기도 한다. 단일 결정의 비용이 낮아질수록 소프트웨어에 AI 결정이 내장되는 지점은 점점 늘어나고, 그 지점 하나하나가 호출 포인트가 된다. 예전에는 너무 비싸서 AI를 쓸 수 없었던 곳에 이제 새로운 옵션이 생긴 것이다.
다만 Jev의 실제 장기 성과는 아직 결론과 거리가 멀다. 기반 아키텍처는 비공개이고, 장기 운영의 장애율 데이터는 없으며, 비즈니스 모델의 지속 가능성은 불확실하고, 커뮤니티의 재현 프로젝트도 빠르게 따라붙고 있다. 하지만 이런 불확실성 자체가 한 가지 사실을 말해준다. 이 방향이 진지하게 다뤄지기 시작했다는 것이다. 텍스트 생성을 하지 않고 구조화된 판단만 하는 모델이 2026년 9월에 이런 논의와 연동 속도를 이끌어냈다는 것은, AI 모델이 '만능 생성'에서 '특정 용도로의 분화'로 실질적인 한 걸음을 내디뎠다는 뜻이다. Jev는 종착점이 아니지만, 그 분화 경로 위에서 눈여겨볼 만한 하나의 좌표다.



