제브(Jev)는 오픈AI 출신 디오고 알메이다의 타입세이프 AI가 9월 15일 공개한 판단 전용 AI다. 문장 없이 선택지·확률·신뢰도만 70~500ms에 반환하며 입력 100만 토큰당 0.042달러다. 원리와 속도·가격의 단서, 사용법을 정리했다.

타입세이프 AI(TypeSafe AI)가 9월 15일(현지시간) 스텔스 모드를 벗고 첫 모델 제브(Jev)를 얼리 액세스로 공개했다. 제브는 텍스트를 한 글자도 생성하지 않는다. 상태 데이터와 미리 정의한 질문을 넣으면 선택지, 확률 분포, 신뢰도 점수만 70~500밀리초 안에 돌려주는 판단 전용 AI다. 공개 직후 해커뉴스 최상단에 올랐고 창업자 디오고 알메이다의 소개 글은 X에서 3,700만 회 넘게 조회됐다. 요금은 입력 100만 토큰당 0.042달러, 출력 토큰은 무료다.
제브란? 시스템 원 모델이라는 새 분류와 이름의 유래
제브를 만든 디오고 알메이다는 오픈AI에서 언어모델이 사람의 지시를 따르고 대화하게 만드는 방법, 즉 인간 피드백 기반 강화학습(RLHF)을 개발한 연구자로 이 작업이 챗GPT의 기반이 됐다. 그는 "모델이 수년째 초인적으로 대화하는데 자동화는 왜 오지 않느냐"는 질문을 안고 2년간 비공개로 새 모델을 개발했고, 그 결과가 타입세이프 AI의 시스템 원 모델(System One Model)이자 첫 공개 모델인 제브다.
시스템 원이라는 이름은 대니얼 카너먼의 '생각에 관한 생각'에서 왔다. 빠르고 직관적인 시스템 1 사고와 느리고 숙고하는 시스템 2 사고 가운데, 제브는 소프트웨어 안에서 순식간에 내리는 분류·라우팅·점수 매기기 같은 시스템 1 판단만 맡는다. 제브라는 모델명은 경제학자 윌리엄 스탠리 제번스에서 따왔다. 증기기관의 효율이 좋아지자 석탄 소비가 오히려 늘었다는 제번스 역설처럼, 지능의 가격이 한 자릿수씩 떨어질 때마다 쓰임새가 자릿수 단위로 늘어날 것이라는 회사의 전망이 이름에 담겨 있다.
제브는 어떻게 다른가 — 토큰 생성을 버리고 병렬 판단으로
기존 대형언어모델은 문장을 토큰 하나씩 앞 토큰에 조건을 걸어 순차적으로 생성한다. "이 티켓은 결제팀인가 기술팀인가"를 묻기 위해서도 문장이 다 나올 때까지 기다린 뒤 JSON을 파싱·검증해야 했고, 형식을 벗어나거나 없는 도구 이름을 지어내는 환각이 서버 오류로 이어졌다. 제브는 이 생성 단계를 통째로 없앴다. 구조화되지 않은 상태를 입력으로 받아 여러 질문에 대한 확률을 한 번의 패스로 병렬 계산하고, 소프트웨어가 바로 분기할 수 있는 확률적 결정을 출력한다.
질문의 형식은 세 가지다. 초이스(Choice)는 목록에서 하나를 고르고, 스코어(Score)는 정해진 단계로 등급을 매기며, 노울(Noul)은 어떤 진술이 참인지 0과 1 사이 확률로 답한다. 초이스는 선택지를 255개까지 둘 수 있고, 여러 질문은 같은 상태에 대해 서로 독립적으로 병렬 처리되므로 질문을 늘려도 응답 시간이 거의 늘지 않는다. 출력이 미리 정의한 타입 안에서만 나오기 때문에 타입 오류는 수학적으로 불가능하다는 것이 타입세이프라는 회사 이름의 뜻이다.
학습 방법도 다르다. 제브는 RLHF나 검증 가능한 보상 강화학습(RLVR) 대신 회사가 '보정된 의사결정 강화학습(RLCD)'이라 부르는 기법으로 훈련됐다. 정답 데이터와 브라이어 점수 같은 적정 점수 규칙으로 보상을 계산해, 모델이 85%의 신뢰도를 보고하면 실제로 85%쯤 맞도록 확률을 통계적으로 맞춘다. 기존 모델은 95%를 맞히는 작업조차 나머지 5%가 언제인지 말해 주지 못해 자동화할 수 없었다는 것이 회사의 문제의식이다. 아키텍처와 파라미터 수는 비공개이며 가중치를 배포하지 않는 클로즈드 API다.
기존 LLM
RLHF·RLVR로 학습, 문자열을 순차 생성, 파싱·검증 필요, 응답 3~329초, 입력 100만 토큰당 0.2~10달러에 출력은 약 5배 비쌈
시스템 원 모델 제브
RLCD로 학습, 타입이 정해진 결정을 병렬 출력, 확률·신뢰도 동봉, 응답 70~500ms, 입력 100만 토큰당 0.042달러에 출력 무료
제브 속도와 가격 — 193.6배 빠르고 444.6배 싸다는 주장의 단서
회사가 공개한 나란히 비교 데모에서 제브는 고객 상담 상태를 읽고 여러 판단을 0.114초, 비용 0.000081달러에 끝냈고, 같은 작업을 GPT-5.6 테라는 8.566초, 0.01388달러에 처리했다. 홈페이지의 대표 수치인 193.6배 빠르고 444.6배 저렴하다는 주장은 회사가 만든 워크플로 평가에서 나왔다. 모든 모델에 같은 코드 워크플로를 주고 GPT-6 아스트라와 페이블 5.1의 예측 확률 평균을 기준 답으로 삼았더니 제브가 속도·비용 두 자릿수 영역에서 파레토 최적 경계를 차지했다는 것이다.
단서도 회사가 직접 달았다. 이 수치는 실제 환경에서 얻을 수 있는 이득의 상단에 가깝고, 워크플로는 자사 역량팀이 만들었으므로 편향이 있을 수 있으며, 기준 답이 오픈AI와 앤트로픽 모델 쪽으로 기울어 있고, 가격이 보조금 없이 지속 가능한지는 장기적으로 증명해야 한다는 것이다. '환각 0%'라는 표현도 스키마와 일치하는 출력이 보장된다는 뜻이지 판단이 항상 옳다는 뜻은 아니어서, 회사 스스로 이 0%는 실측값이 아니라고 적었다. 개발자 커뮤니티에서도 타입 안전성과 판단의 정확성은 별개라는 지적이 나왔다.
제브 사용법 — API 하나, SDK 두 개, 신뢰도 임계값 세 단계
제브 사용법은 단순하다. 엔드포인트는 api.typesafe.ai의 v1/systemone 하나이고, 요청 본문에 상태(state), 모델, 질문 목록(questions)을 담아 보낸다. 파이썬 SDK는 pip install typesafe-sdk로 설치하고 자바스크립트 SDK와 클로드 코드용 스킬도 있다. 고객 문의 텍스트를 상태로 넣고 "어느 팀이 처리할 것인가"라는 초이스와 "긴급한가"라는 노울을 함께 던지면 부서와 긴급 여부 확률이 한 번에 돌아온다.
핵심은 신뢰도 활용이다. 문서의 예시에서 결제팀이 0.84의 확률로 뽑혀도 기술팀이 0.159를 갖고 있으면 신뢰도는 0.596으로 내려간다. 타입세이프는 신뢰도가 높으면 자동 실행, 중간이면 검토, 낮으면 사람에게 넘기는 세 갈래 설계를 권하며 임계값은 잘못된 행동의 비용에 비례해 높이라고 안내한다. 접근은 대기열을 거치는 얼리 액세스이고 서비스가 미국 서부에 있어 한국에서는 네트워크 왕복만큼 더 걸린다.
개발자 반응 — 48시간 만에 클론 6개, 둠·스타크래프트·브라우저 에이전트
반응은 폭발적이었다. 엔지니어들은 정규표현식으로는 부족하고 LLM은 느리고 비싼 백엔드 조건 판단을 대체할 '스마트한 if문'이 나왔다고 평했고, 공개 48시간 만에 원리를 본뜬 오픈소스 클론이 6개 넘게 등장했다. 회사 데모에서는 게임 둠의 상태를 넣어 1초에 10번씩 움직임을 결정했는데 시간당 비용이 약 7달러였고, 위키피디아 링크만 따라 목표 문서에 도달하는 위키레이싱에서는 매 단계 수백~수천 개 링크 중 하나를 환각 없이 골랐다. 한 개발자는 제브를 스타크래프트에 연결해 첫 전투 미션을 깼다.
실무 사례도 쌓였다. 브라우저 유즈는 제브를 판단 엔진으로 붙여 취리히-런던 항공권 검색을 7.1초에 끝냈고, 드로이드런은 실제 안드로이드 폰에서 우버 앱을 9번의 동작, 약 21초 만에 조작했다. 버셀의 기예르모 라우치 CEO는 명령어 안전성 판단에서 제브가 기존 모델보다 최대 18배 빨랐다고 보고했고, 이메일 분류를 시험한 한 스타트업 CTO는 제미나이가 조금 더 정확했지만 비용이 10~20배 비쌌다고 전했다. 에이전트의 도구 호출을 거부·확인·허용으로 등급 매기는 가드레일 같은 파생 프로젝트도 나왔다.
제브가 바꾸는 것 — 시스템 1과 시스템 2의 분업
전문가들은 제브의 등장으로 AI 아키텍처가 두 층으로 갈라지기 시작했다고 본다. 실시간 라우팅, 모니터링, 가드레일처럼 밀리초 단위로 반복되는 판단은 제브 같은 시스템 1 모델이 맡고, 창작과 복잡한 추론이 필요할 때만 챗GPT나 클로드 같은 시스템 2 모델을 부르는 구조다. 에이전트 개발자들은 수백 개의 중간 결정을 제브로 바꿨더니 응답이 수 초에서 수백 밀리초로 줄고 비용이 수백분의 일이 됐다는 후기를 올렸고, 회사도 제브를 LLM의 대체재가 아니라 소프트웨어가 의존할 수 있는 AI 인터페이스로 키우겠다고 밝혔다.
개인적으로 제브 발표 글에서 가장 눈에 들어온 문장은 "문자열을 포기하니 초능력이 생겼다"는 대목이었다. 에이전트를 만들며 가장 지겨웠던 일이 모델이 내놓은 JSON이 깨졌는지 검사하는 코드를 쌓는 것이었는데, 출력 타입을 아예 고정한다는 발상은 문제를 푸는 게 아니라 없애는 쪽에 가깝다고 느꼈다. 다만 자체 제작 벤치마크와 가격의 지속성이라는 단서는 열광과 별개로 기억해 두려 한다.
정리하면 제브는 더 똑똑한 언어모델이 아니라 언어모델이 하지 않아야 할 일을 떼어낸 모델이다. 문장 생성을 버린 대가로 밀리초 응답, 무료 출력, 타입 안전을 얻었고, 보정된 신뢰도로 사람의 개입 지점을 코드로 정할 수 있게 했다. 자체 벤치마크와 가격의 지속성이라는 물음표는 남지만, 지능을 함수처럼 호출한다는 방향은 AI를 제품에 넣어야 하는 개발자라면 한 번은 들여다볼 만한 변화다.
함께 읽으면 좋은 글
AI 에이전트란? 작동 원리와 2026 핵심 트렌드 5가지 에이전틱 AI란? 뜻과 AI 에이전트 차이 3가지 총정리 앤트로픽 클로드 코드 프로젝트 출시 — 공유 메모리·병렬 스레드, 사용법 총정리 AI 에이전트 보안 위협 총정리 — 삼성SDS·LG CNS 월권 통제 나섰다 트랜지스터란? 원리와 구조, 종류와 증폭 원리 정리참고 자료
TypeSafe AI — Introducing System One Models & Jev (2026-09-15 공식 발표 글) TypeSafe AI Docs — System One API, 초이스·스코어·노울, 신뢰도 활용 가이드 TypeSafe AI Workflow Evals — 193.6배·444.6배 수치의 출처와 워크플로 전체 공개 MarkTechPost — TypeSafe AI Releases Jev, API 구조·가격·개발자 프로젝트 정리 AI타임스 — "환각·타입 오류 없다"...오픈AI 출신, 의사결정 특화 AI '제브' 선보여 AI타임스 — "문장 생성 버렸다"…판단 전용 AI '제브'에 개발자 반응 폭발