Jev 갑자기 화제 폭발: 대화도, 코드도 안 쓰고 판단만 한다

AI 모델 Jev가 개발자들 사이에서 주목받고 있습니다. 채팅이나 코드 작성 대신 판단만 수행하는 이 모델은 40초에 724개 광고를 분석하고, Claude Code에 연결해 불필요한 컨텍스트를 정리하며, AI 에이전트의 작업 완료 여부를 평가하는 등 에이전트 시대에 필수적인 대량의 빠르고 저렴한 판단에 특화되었습니다. TypeSafe 테스트 결과 Jev는 최대 약 193.6배 빠르고 비용은 444.6배 낮아지며, 입력 100만 토큰당 0.042달러, 출력은 무료입니다.

Jev의 창시자 Diogo Almeida는 OpenAI 출신으로 RLHF(인간 피드백 기반 강화 학습) 개발에 참여했지만, 이제 RLHF가 AI 자동화에 부적합하다고 주장합니다. RLHF는 AI가 인간의 선호에 맞춰 답변하도록 훈련시켜 "과잉 약속" 을 특징으로 하지만, 이는 고객 서비스 같은 실제 업무 자동화에는 방해가 됩니다. 자동화는 인간이 없는 상황에서 AI가 스스로 판단하고 실행해야 하며, 정확한 확률이 중요합니다.

Jev는 이런 문제를 해결하기 위해 설계되었습니다:

  • 기능: Yes/No(이진 판단), Choice(선택), Score(점수)만 제공하며 판단과 확률을 반환합니다.
  • 속도와 비용: 종단 간 지연 시간 70-500ms로 기존 모델보다 20-200배 빠르고 40-400배 저렴합니다.
  • RLCD(보정 결정 강화 학습): AI가 제공하는 확률을 신뢰할 수 있도록 훈련합니다. 예를 들어 80% 확률로 판단한 일이 실제로 80% 발생하도록 보정합니다.

Jev는 에이전트가 수백만 번의 소규모 판단을 내릴 때 저렴하고 빠른 시스템 1 역할을 하고, 복잡한 추론은 대형 모델(시스템 2)에 맡기는 구조를 지향합니다. 이는 "더 오래 생각하고 더 많이 말하는" 기존 AI 패러다임에 대한 근본적인 재질문이며, 인간이 개입하지 않는 완전한 자동화의 가능성을 탐구합니다.

요약

글: 주쉐잉(朱雪莹)

최근 이틀 사이, 다소 이례적인 AI 모델이 갑자기 화제를 휩쓸었다.

바로 Jev다.

대화도 못 하고, 코드도 안 쓰고, 심지어 ChatGPT처럼 긴 답변을 생성하지도 않는다. 오직 한 가지 일만 한다: 판단.

하지만 이렇게 보기에 “능력이 절반 이상 잘려나간” 모델이 개발자 커뮤니티에서 갑자기 인기를 끌었다.

누군가는 이를 이용해 40초 만에 실시간 광고 724개를 분석해 총 8,724번의 판단을 내렸고, 누군가는 이를 Claude Code에 연결해 쓸모없는 컨텍스트를 정리하는 데 썼다. 또 누군가는 AI 에이전트의 “심판” 역할을 맡겨 작업이 정말 완료됐는지 검사하게 했다. LangChain 역시 Jev를 에이전트 평가자로 테스트하기 시작했다.

더 놀라운 것은 속도와 가격이다.

TypeSafe가 공개한 테스트에서 Jev는 최대 약 193.6배 빨라졌고, 비용은 최대 444.6배 낮아졌다. 입력은 백만 토큰당 0.042달러에 불과하고, 출력 토큰은 아예 무료다.

능력이 더 적어 보이는 AI가 왜 오히려 인기를 끌었을까?

에이전트 시대에 AI가 진짜로 필요로 하는 것은 단지 “깊은 사고”만이 아니라, 대량의 빠르고 저렴한 판단이기 때문이다. 다음에 무엇을 할지, 어떤 도구를 호출할지, 작업이 끝났는지 아닌지. 더 중요한 것은, 이런 판단은 앞으로 AI가 백그라운드에서 스스로 완료해야 하며, 더 이상 사람이 화면 앞에 앉아 계속 지켜볼 필요가 없다는 점이다. Jev가 노리는 것은 바로 하루에 수백만 번씩 일어날 수 있는 이런 작은 결정들이다.

더 흥미로운 것은, Jev 모델의 창업자 디오구 알메이다(Diogo Almeida)가 바로 RLHF에 참여했던 인물이라는 점이다. 그런 그가 이제 RLHF를 반성하기 시작했다. ChatGPT를 유용하게 만든 이 훈련 방식이, AI가 진정으로 자동화로 나아가는 데는 적합하지 않을 수 있다는 것이다.

한 달여 전, 알메이다는 한 차례 강연을 했다. 지금 돌아보면, 그 강연은 거의 Jev의 “사상 설명서”나 다름없다.

图片

图片

AI가 고등수학도 푸는데, 왜 고객센터는 아직도 못 맡을까?

디오구 알메이다의 이력은 매우 특별하다.

그는 OpenAI에서 일한 적이 있으며, GPT-4, ChatGPT 그리고 InstructGPT/RLHF 관련 작업에 참여했다. 즉, 오늘날 대형 모델의 가장 중요한 포스트트레이닝 패러다임을 직접 구축하는 데 참여한 인물이다.

하지만 그 강연에서 그는 시작부터 자신을, OpenAI 내부에서 공개적으로 ChatGPT를 “까는” 몇 안 되는 사람 중 하나라고 자조했다.

그의 강연 주제는 더욱 직접적이었다: What's Next After RLHF?

디오구는 먼저 매우 모순적으로 보이는 질문을 던졌다.

오늘날 대형 모델은 이미 매우 어려운 수학 문제에 도전할 수 있고, 코드, 추론, 각종 벤치마크가 계속 상승하고 있다.

그런데 많은 기업이 정말 자동화하고 싶어 하는 업무에서는 사람을 빼지 못하고 있다.

예를 들어 고객센터.

AI에게 자료를 찾게 하고, 문서를 요약하게 하고, 답변 초안을 작성하게 하는 것은 문제없다.

하지만 AI가 스스로 결정하게 한다면 어떨까: 이 돈을 환불할까 말까? 이 사용자에게 보상해야 할까?

기업은 곧바로 신중해진다.

이런 일들은 분명 고등수학보다 훨씬 단순해 보이는데, 왜 오히려 AI에게 맡기지 못할까?

디오구가 내놓은 답은 간단하다: Today's AI is incredible at assistance, not automation.

오늘날의 AI는 일을 돕는 데는 뛰어나지만, 스스로 일을 끝내지는 못한다.

이 둘은 겉보기엔 조금만 달라 보이지만, 실제로는 완전히 다르다.

Claude Code가 아무리 강력해도, 당신은 보통 여전히 컴퓨터 앞에 앉아 있다. 그것이 코드를 쓰면 당신이 보고, 파일을 수정하면 당신이 검사하고, 틀리면 다시 고치라고 시킨다.

그래서 디오구가 보기에 Claude Code는 여전히 ChatGPT가 연 “보조 시대”에 속한다.

진정한 자동화란 무엇인가?

사람이 아예 현장에 없는 것이다.

AI가 백그라운드에서 스스로 판단하고 스스로 실행하며, 하루에 수십만 번, 심지어 수백만 번 실행될 수 있다. 당신은 그것이 무엇을 했는지 영영 보지 못할 수도 있다.

그렇다면 문제가 생긴다: 오늘날의 AI가 이렇게 똑똑한데, 왜 유독 사람을 떠나지 못할까?

디오구는 화살을 자신이 아주 잘 아는 것, 바로 RLHF로 돌렸다.

图片

우리는 AI를 훈련시킬 때, 사람을 루프 안에 집어넣었다

이 일은 다소 아이러니하다.

RLHF는 바로 디오구가 그해 추진에 참여했던 기술 노선 중 하나이기 때문이다.

RLHF의 기본 논리는 사실 복잡하지 않다. 사람의 선호를 수집한 다음, 모델이 점점 사람의 선호에 부합하도록 만드는 것이다.

그래서 디오구는 강연에서 아주 직설적인 설명을 내놓았다: 오늘날 대형 모델에 왜 항상 사람이 루프 안에 있어야 할까?

왜냐하면 그것을 훈련시킬 때, 우리는 말 그대로 사람을 그 루프 안에 집어넣었기 때문이다.

모델은 처음부터 배우고 있다: 어떤 답변을 사람이 더 좋아할까?

이것은 대형 모델의, 우리에게 이미 아주 익숙한 특징도 설명해 준다. 모르는 내용이라도, 그것은 자주 아주 그럴듯하게 말할 수 있다는 점이다.

디오구는 현장에서 아주 짓궂은 예를 들었다.

누군가 ChatGPT에게 방귀 소리 녹음을 보내며, 이것이 자신이 창작한 음악이라고 말하고 “진심으로, 솔직하게” 평가해 달라고 했다.

그러자 ChatGPT는 진지하게 칭찬하기 시작했다. 음산하고 기괴한 분위기의 앰비언트 음악이라고.

디오구는 심지어 한 문장으로 정리했다: “Overpromising is a feature.”

과잉 약속은 버그가 아니라 기능(feature)이다.

채팅 제품에게는 이것이 치명적이지 않을 수 있다. 사용자는 여전히 화면 앞에 있고, 틀리면 바로잡을 수 있다.

하지만 진정한 자동화 시스템은 완전히 다르다.

기계는 당신의 답변이 듣기 좋은지 신경 쓰지 않는다. 기계는 두 가지만 알면 된다: 도대체 어떻게 해야 하는가, 그리고 당신이 도대체 얼마나 확신하는가?

이것이 바로 한 달여 뒤 공개된 Jev가 그토록 이례적으로 보이는 이유를 설명해 준다.

图片

그래서 Jev는 아예 AI가 “말”을 못 하게 했다

일반 대형 모델은 최종적으로 “A인가 B인가”만 답하면 되는 경우에도, 보통 토큰을 생성하는 과정을 거쳐야 한다.

Jev는 이 부분을 아예 잘라냈다.

현재 주로 세 가지 일을 한다:

  • Noul, Yes인지 No인지 답한다;
  • Choice, 여러 옵션 중 하나를 고른다;
  • Score, 기준에 따라 점수를 매긴다.

그런 다음 판단과 확률을 바로 반환한다.

작문도 해 주지 않고, 대화도 나누지 않는다.

공식 발표에 따르면 엔드투엔드 지연 시간은 70500밀리초로 낮아, 최전선 모델보다 20200배 빠르고 가격은 40~400배 낮다.

하지만 진짜 핵심은 사실 “빠르다”가 아니라, 뒤에 붙는 그 확률이다.

이를 위해 TypeSafe는 새로운 훈련 방법을 내놓았다: RLCD, Reinforcement Learning for Calibrated Decisions, 즉 보정된 결정을 위한 강화학습이다.

이것이 해결하려는 문제는 매우 현실적이다: AI가 어떤 일이 80% 확률로 일어난다고 말한다면, 이 80%를 과연 믿을 수 있을까?

이상적으로는, 모델이 80% 확률이라고 판단한 일들의 묶음은 결국 약 80%가 실제로 일어나야 한다.

이것은 자동화 시스템에서 매우 중요하다.

99%의 확신이라면 바로 실행할 수 있다.

51%의 확신이라면 더 강하고 더 비싼 대형 모델에 넘기거나, 심지어 사람에게 넘길 수 있다.

진짜 골칫거리는 AI가 모른다는 것이 아니라, AI가 자기가 모른다는 것을 모른다는 것이다.

그래서 Jev가 진짜 바꾸려는 것은 AI 출력의 대상이다.

과거 ChatGPT가 생성한 답변은 주로 사람이 보기 위한 것이었다. Jev가 내놓는 판단과 확률은 곧바로 소프트웨어가 쓰도록 준비된 것이다.

图片

에이전트 시대에 필요한 것은 더 큰 두뇌가 아닐 수 있다

이것은 Jev가 왜 하필 지금 인기를 끄는지도 설명해 준다.

에이전트가 실제로 가동되면, 엄청난 양의 작은 판단이 생겨나기 때문이다.

다음에 어떤 도구를 호출할까? 이 웹페이지에서 어떤 버튼을 눌러야 할까? 이 정보는 아직 쓸모가 있을까? 작업은 도대체 끝났을까? 결과를 다시 확인해야 할까?

이런 문제들은 하나하나 보면 어렵지 않지만, 에이전트 하나가 하루에 수십만 번, 수백만 번 판단해야 할 수 있다.

매번 가장 강한 대형 모델을 불러 몇 초씩 “깊이 생각”하게 하고, 다시 긴 토큰을 쏟아내게 한다면, 비용과 지연 시간은 금세 치솟는다.

Jev가 노리는 것이 바로 이 층위다.

대량의 고빈도 작은 결정은 Jev에게 맡기고, 정말 복잡한 추론이 필요한 작업은 대형 모델에 맡긴다.

이것이 TypeSafe가 Jev를 System One Model이라고 부르는 이유이기도 하다.

이 개념은 대니얼 카너먼의 “시스템 1”과 “시스템 2”에서 왔다. 하나는 빠르고 직관적인 판단을 담당하고, 다른 하나는 느리고 복잡한 사고를 담당한다.

Jev라는 이름조차 “제번스의 역설”에서 왔다.

어떤 자원이 점점 저렴해지면, 사람들은 반드시 덜 쓰는 것이 아니라 오히려 더 많이 쓸 수 있다는 것이다.

AI를 한 번 호출하는 것이 비싸다면, 당신은 가장 중요한 곳에만 그것을 쓸 것이다.

하지만 AI 판단 한 번이 거의 무시할 수 있을 만큼 저렴해진다면 어떨까?

이메일 한 통, 로그 한 줄, 도구 호출 한 번, 웹페이지 버튼 하나, 에이전트가 실행하는 모든 단계에 AI 판단이 한 번씩 더해질 수 있다.

물론, 지금 당장 Jev가 차세대 AI를 대표한다고 말하기는 아직 이르다.

이른바 “제로 환각”은 정해진 답변 유형 밖으로 벗어나 함부로 지어내지 않는다는 의미에 가깝지, 틀리게 고르지 않는다는 뜻은 아니다. 193.6배, 444.6배 같은 극단적인 수치도 주로 TypeSafe 자체 테스트에서 나온 것이다.

하지만 이번 Jev의 화제에서 진짜 주목할 만한 것은, 그것이 GPT나 Claude에 도전할 수 있느냐가 아닐 것이다.

ChatGPT를 만드는 데 참여했던 한 사람이, 더 근본적인 질문을 다시 던지고 있다는 점이다.

지난 몇 년간 업계 전체가 고민해 온 것은, 어떻게 AI가 더 오래 생각하고 더 많이 말하게 할 것인가였다.

하지만 미래에 진짜 필요한 것이 수십억 번의 기계 간 판단이라면, AI가 왜 매번 먼저 “한마디 말”을 해야 할까?

ChatGPT는 기계에게 사람과 대화하는 법을 가르쳤다.

그리고 Jev가 걸고 있는 다음 단계는 이것이다: 사람이 더 이상 화면 앞에 앉아 있지 않을 때, 기계가 스스로 결정을 내릴 수 있을까?

공유하기:

작성자: 华尔街见闻

이 글은 PANews 입주 칼럼니스트의 관점으로, PANews의 입장을 대표하지 않으며 법적 책임을 지지 않습니다.

글 및 관점은 투자 조언을 구성하지 않습니다

이미지 출처: 华尔街见闻. 권리 침해가 있을 경우 저자에게 삭제를 요청해 주세요.

PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
PANews APP
한 고래가 8,600만 달러 상당의 BTC를 ETH로 교체하고 전액 스테이킹
PANews 속보