Jev(제브) AI 완벽 가이드 | 사용법, 가격, Codex 활용까지

Jev(제브)는 TypeSafe AI가 공개한 판단 전용 AI 모델이에요. 문장이나 코드를 생성하는 대신, 미리 정한 선택지와 점수, 확률을 돌려줘요.

Jev(제브) AI 완벽 가이드 | 사용법, 가격, Codex 활용까지

“글을 안 쓰는데, AI 에이전트를 더 빠르게 만든다고?”

Jev(제브)는 TypeSafe AI가 공개한 판단 전용 AI 모델이에요. 문장이나 코드를 생성하는 대신, 미리 정한 선택지와 점수, 확률을 돌려줘요.

9월 18일 Sac의 X 게시물은 Jev를 활용하면 Codex 작업을 크게 가속할 수 있다고 소개했어요. 캐럿 에디터가 9월 23일 확인한 조회 수는 약 59만 회예요. 다만 ‘10배’는 게시자의 주장으로, 모든 Codex 작업에서 재현되는 성능을 뜻하지 않아요.

기존 생성형 모델에 분류부터 설명까지 맡겼다면, Jev는 반복되는 판단을 따로 떼어내는 접근이에요. 이 글에서는 Jev 사용법, 가격, Codex와 연결하는 방식, 한국어 활용 시 확인할 한계까지 정리했어요.

9월 23일 확인 기준으로 TypeSafe 공식 계정은 신규 가입 일시 중단을 공지했어요. 기존 가입자의 서비스는 유지한다고 밝혔어요. 초기 게시물의 빠른 승인 안내와 현재 접근 상태를 구분해서 봐야 해요. Jev의 사용 경로는 TypeSafe 공식 콘솔과 API예요. 이 페이지의 캐럿 만들기 버튼은 캐럿 일반 화면으로 연결되며, Jev 이용 버튼은 아니에요.

▲ Jev를 활용하는 기본 흐름. 상황을 보내고 판단을 받은 뒤, 실행 여부는 코드에서 정해요.
▲ Jev를 활용하는 기본 흐름. 상황을 보내고 판단을 받은 뒤, 실행 여부는 코드에서 정해요.

🧠 Jev란 무엇인지 먼저 정리해요

Jev는 미국 AI 기업 TypeSafe AI의 첫 공개 System One 모델이에요. 공식 소개 문서는 소프트웨어가 바로 사용할 수 있는 구조화된 판단을 핵심으로 설명해요. 이미지나 영상을 만드는 모델과는 용도가 달라요.

9월 15일 공식 발표는 창업자 Diogo Almeida 명의로 나왔어요. 학습 방식의 이름은 RLCD, Reinforcement Learning for Calibrated Decisions예요. 답을 고르는 일과 불확실성을 표현하는 일에 초점을 맞춘다는 설명이에요.

예를 들어 고객 문의를 읽고 ‘배송’, ‘결제’, ‘기술 지원’ 중 어디로 보낼지 고를 수 있어요. Jev가 고객에게 보낼 사과문까지 쓰는 것은 아니에요. 선택 결과를 받은 프로그램이 담당 부서로 넘기고, 답변 작성이 필요하면 별도의 생성형 모델을 호출하는 구조예요.

⚙️ System One과 일반 LLM의 차이

공식 System One 문서는 빠르고 범위가 좁은 판단에 맞춘 설계를 설명해요. ‘이 문의가 긴급한가’처럼 답의 형태를 미리 정할 수 있는 질문이 출발점이에요. 복잡한 요구를 한꺼번에 던지기보다 작은 질문으로 나누는 편이 맞아요.

일반 LLM은 설명, 대화, 글쓰기, 코드 작성처럼 열린 답을 만드는 데 강점이 있어요. Jev는 결과를 정해진 형식으로 받아 프로그램의 다음 동작을 정할 때 유용해요. 어느 쪽이 모든 업무에서 더 뛰어나다는 비교보다는, 생성과 판단을 나눠 맡길 수 있는지가 중요해요.

🔢 Choice, Score, Noul은 이렇게 달라요

Jev에 보내는 기본 재료는 statequestions예요. state는 판단할 텍스트나 구조화된 상황이고, questions는 그 상황에 관해 물을 질문이에요. 질문마다 원하는 답의 종류를 정해요.

▲ 공식 문서의 세 가지 질문 유형. Noul에는 Choice와 같은 별도 confidence 필드가 없다는 점도 구분해요.
▲ 공식 문서의 세 가지 질문 유형. Noul에는 Choice와 같은 별도 confidence 필드가 없다는 점도 구분해요.

🗂️ Choice: 정해진 보기에서 선택해요

Choice 문서에 따르면, 선택한 값과 보기별 확률, confidence를 받아요. 예를 들어 ‘환불 요청’, ‘사용법 질문’, ‘기타’ 중 하나를 고르게 할 수 있어요. 후보마다 어떤 경우에 해당하는지 설명을 붙이는 방식이에요.

선택지에는 서로 겹치는 표현을 줄이는 편이 좋아요. ‘고객 문제’와 ‘결제 문제’를 나란히 두면 결제 문의가 양쪽에 걸릴 수 있어요. ‘결제 오류’, ‘사용법 문의’, ‘판단 불가’처럼 분류 목적에 맞춰 경계를 정하면 결과를 검토하기 쉬워요. 이 예시는 질문 설계를 설명하기 위한 것이며 실제 API 실행 결과는 아니에요.

📏 Score: 기준에 맞춰 평가해요

Score 문서는 순서가 있는 평가 기준을 정해 점수를 받는 방식을 안내해요. 단순히 ‘좋은 글인지 평가’라고 묻기보다, 각 단계가 무엇을 뜻하는지 적어주는 구조예요. 점수와 단계별 확률, confidence를 함께 볼 수 있어요.

예를 들어 문서가 질문에 얼마나 직접 답하는지 평가할 때 쓸 수 있어요. ‘무관함’, ‘일부 단서 포함’, ‘직접적인 근거 포함’처럼 기준을 나누는 식이에요. 이 점수는 설명한 평가 기준에 대한 판단이에요. 글자 수나 정확한 금액을 계산하는 도구로 쓰면 안 돼요.

✅ Noul: 참일 확률을 받아요

Noul 문서는 참·거짓 질문에 대해 0~1 범위의 값을 반환한다고 설명해요. ‘이 문의에 결제 실패가 언급됐는가’처럼 명확한 조건을 평가할 수 있어요. 값이 높을수록 참이라는 쪽에 무게가 실려요.

확률을 바로 실행 허가로 바꾸지는 않아요. 예를 들어 분류 기준과 실행 기준을 따로 두고, 애매한 요청을 사람이 확인하도록 만들 수 있어요. 허용할 오류의 수준은 서비스마다 달라요. 다른 프로젝트가 사용한 기준값을 그대로 가져오기보다 실제 문의로 확인해야 해요.

💻 Codex와 Jev를 함께 쓰는 방법

X에서 화제가 된 활용은 코딩 모델의 교체보다 판단 단계의 분리에 가까워요. TypeSafe의 코딩 에이전트 안내는 Jev가 대화나 코드 자동완성을 맡는 LLM의 대체재가 아니라고 명시해요. 모델 이름을 바꾸는 설정만으로 Codex가 Jev 기반 코딩 에이전트로 바뀌지는 않아요.

▲ Codex와 Jev API의 역할 구분. Codex로 연동 코드를 만들고, 애플리케이션 안에서 Jev의 판단을 활용하는 구조예요.
▲ Codex와 Jev API의 역할 구분. Codex로 연동 코드를 만들고, 애플리케이션 안에서 Jev의 판단을 활용하는 구조예요.

🛠️ 공식 스킬로 API 연동을 준비해요

공식 Agent skill 문서는 Codex 등에서 API 형식과 질문 유형을 참고하도록 스킬을 제공해요. 다른 에이전트용 설치 명령은 아래와 같아요. 설치 과정에서 사용할 에이전트를 선택하고, 기본 설치 범위는 현재 프로젝트예요.

npx skills add typesafe-ai/skills --skill typesafe-ai

스킬은 코딩 에이전트가 TypeSafe 연동 코드를 작성할 때 참고하는 지침이에요. 설치 자체가 API 사용 권한이나 무료 이용을 보장하지는 않아요. 계정 접근과 API 키 준비는 별도로 확인해야 해요.

연동을 요청할 때는 목표를 좁혀 적는 편이 좋아요. 예를 들어 ‘고객 문의를 배송, 결제, 기술 지원으로 나누고, 애매한 문의는 검토 대기 상태로 남기는 기능’처럼 입력과 선택지, 예외 처리를 정해요. 모델의 답을 어디에 쓸지까지 알려줘야 코드의 동작을 검토할 수 있어요.

🌐 브라우저 조작의 다음 행동을 골라요

Gregor Zunic의 원문은 Browser Use와 Jev를 결합한 항공편 검색 데모를 소개해요. 게시자는 약 7초, 약 0.0039달러라고 보고했어요. 캐럿 에디터가 같은 조건으로 재측정한 수치가 아니며, 여행 예약 전체의 비용이나 속도를 뜻하지 않아요.

이 데모는 DOM 상태와 매 단계의 행동 후보를 사용하고, 입력이 필요하면 작은 LLM에 넘긴다고 설명해요. Jev가 화면 이미지를 직접 보고 모든 마우스·키보드 조작을 혼자 처리한다고 읽으면 오해예요. 구조화된 상태에서 행동을 고르는 부분과 실제 조작을 맡는 프로그램을 구분해야 해요.

🧹 맥락 압축에서 남길 정보를 골라요

tamara의 원문은 도구 호출 기록을 평가하고 관련 없는 내용을 제거하는 활용을 소개해요. 핵심은 긴 요약문을 새로 쓰는 과정이 아니라, 어떤 기록을 남길지 고르는 과정이에요. ‘Jev가 요약을 잘 쓴다’는 의미로 옮기면 기능을 잘못 설명하게 돼요.

공식 RAG 문서 분류 예제도 생성 모델에 전달하기 전 근거의 관련성과 충돌 여부를 판단하는 구조예요. 검색된 자료를 그대로 모두 넣는 대신, 자료별 성격을 구분해 다음 단계에 넘겨요. 최종 답변 작성은 별도 모델이 맡아요.

🔀 요청을 다른 모델이나 코드로 보내요

공식 Intent routing 예제는 요청의 종류와 복잡도를 보고 처리 경로를 나눠요. 단순 조회는 일반 코드, 설명이 필요한 질문은 LLM, 확신이 낮은 요청은 사람에게 보내는 식이에요. 모든 요청을 가장 큰 모델에 보내기 전에 분류하는 자리를 만들 수 있어요.

절감 폭은 업무 구성에 따라 달라져요. 대부분의 요청이 어려워서 다시 큰 모델로 넘어간다면 Jev 호출이 추가 단계가 될 수도 있어요. 분류 비용만 볼 게 아니라, 재처리와 검토까지 포함한 전체 흐름을 비교해야 해요. ‘작은 모델을 앞에 둔다’는 설계가 자동으로 비용 절감을 보장하지는 않아요.

🧪 자동 검토의 판정 근거로 활용해요

공식 가드레일 예제는 메시지를 평가한 뒤 통과, 검토, 차단 같은 후속 처리로 연결해요. 판단 결과를 애플리케이션의 규칙에 넣는 방식이에요. 원문에서 언급한 자동 검토도 이런 활용 가능성으로 이해할 수 있어요.

다만 이 글은 Jev가 Codex의 기본 승인 시스템에 탑재됐거나, 기존 검토 모델보다 더 정확하다는 뜻으로 소개하지 않아요. 별도 연동의 효과는 해당 구현과 평가 조건을 확인해야 해요. 중요한 동작을 실행할 권한과 최종 승인 규칙은 모델의 판단 점수와 분리해 설계하는 편이 좋아요.

🚀 Jev 사용법: Playground에서 작은 질문부터 시작해요

코드 없이 확인할 때는 공식 Playground가 출발점이에요. Quick start는 로그인 후 텍스트를 넣고 질문을 추가하는 순서를 안내해요. 다만 신규 계정은 현재 가입 일시 중단 공지의 영향을 받을 수 있어요.

  1. TypeSafe 공식 콘솔에서 접근 가능 상태를 확인해요. 이미 권한이 있는 계정과 처음 가입하는 계정의 조건이 같다고 가정하지 않아요.

  2. state에 판단할 문장을 넣어요. 처음에는 짧은 가상 문의 하나를 쓰면 어떤 정보가 결과에 영향을 주는지 확인하기 쉬워요.

  3. 질문과 기준을 적어요. 첫 실습은 ‘이 문장에 결제 실패가 명시되어 있는가’처럼 확인 대상이 분명한 Noul 질문으로 시작할 수 있어요.

  4. 표현을 바꿔서 결과를 비교해요. 명확한 사례, 부정 표현, 정보가 빠진 사례를 함께 넣으면 질문의 경계가 드러나요.

API를 사용할 때는 공식 문서의 POST https://api.typesafe.ai/v1/systemone으로 state, model, questions를 보내요. 아래는 반환 결과가 아니라 요청 본문을 설명하는 예시예요. 실제 인증 키는 코드에 적어 배포하지 않고 실행 환경에서 관리해요.

{"model":"jev-latest","state":"The payment failed twice. Please help.","questions":{"payment_failure":{"type":"noul","instructions":"Does the message explicitly state that a payment failed?"}}}

응답을 확인한 뒤에는 잘 맞은 사례만 남기지 않는 편이 좋아요. 예를 들어 ‘결제가 실패한 것은 아니다’처럼 부정이 들어간 문장도 함께 보관해요. 운영 중 문제가 생겼을 때 입력, 질문, 모델 버전을 대조할 수 있어야 질문을 고칠지 처리 규칙을 고칠지 판단하기 쉬워요.

💰 Jev 가격과 무료 이용을 구분해요

공식 Models 문서의 입력 요금은 100만 토큰당 약 0.042달러이고, 출력 토큰은 무료예요. API 입력 비용이 없는 서비스라는 뜻은 아니에요. 계정별 프로모션이나 제3자 플랫폼의 청구 조건은 별도로 확인해야 해요.

예를 들어 유료 청구 대상 입력이 총 1,000만 토큰이라면, 공시 단가로 계산한 입력 비용은 약 0.42달러예요. 이는 단순 단가 계산이며 실제 결제액을 보장하지 않아요. 함께 쓰는 생성 모델, 서버, 검색 도구의 비용은 포함하지 않은 값이에요.

‘무료’라는 검색어로 찾아왔다면 출력 요금, 체험 혜택, 가입 가능 여부를 나눠 보면 돼요. 출력 무료라는 공식 사양만으로 신규 계정이 지금 즉시 무제한 사용 가능하다고 판단하면 안 돼요. 9월 22일 공식 공지는 수요 증가 때문에 신규 가입을 잠시 멈추고 기존 사용자의 품질을 유지한다고 설명했어요.

⏱️ 빠르다는 수치를 읽을 때 확인할 조건

공식 출시 발표는 응답 시간을 약 70~500ms 수준으로 소개해요. 홈페이지의 약 193.6배 속도와 약 444.6배 비용 차이는 자체 워크플로 평가에서 나온 값이에요. 회사도 실사용 개선 폭의 높은 쪽에 해당할 수 있다고 설명해요.

이 숫자를 한국에서 수행하는 모든 API 호출이나 코딩 세션 전체에 그대로 적용할 수는 없어요. 입력 길이, 질문 구성, 네트워크, 비교 모델의 설정이 달라지면 결과도 달라져요. 공식 발표는 평가를 주로 미국 서부에서 수행했다는 조건도 밝혀요.

캐럿 에디터는 이번 글에서 유료 API 벤치마크를 실행하지 않았어요. 기사에 들어간 성능 수치는 공식 발표나 사례 작성자의 보고로 구분했어요. X의 ‘10배’를 재현된 사실처럼 제목에 쓰지 않은 이유도 여기에 있어요.

🔍 confidence와 확률을 같은 숫자로 보면 안 돼요

공식 Confidence 문서는 선택지의 확률과 confidence를 구분해요. 확률은 후보별 판단을 읽는 값이고, confidence는 그 판단을 얼마나 확실하게 다룰지 검토하는 별도의 신호예요. 가장 높은 확률 하나만 보고 나머지 정보를 버리면 애매한 사례를 놓칠 수 있어요.

예를 들어 두 부서가 모두 관련된 문의라면 어느 부서가 더 적절한지와, 자동으로 보내도 될 만큼 판단이 분명한지는 다른 질문이에요. 결과가 선택지 안에 들어왔다는 사실은 형식이 맞다는 뜻이에요. 실제로 적절한 부서를 골랐는지는 별도의 검증 대상이에요.

Confidence routing 문서는 확신이 부족할 때 재검토나 다른 처리 경로로 넘기는 구성을 설명해요. 기준을 높이면 자동 처리되는 양이 줄 수 있고, 낮추면 잘못 분류한 사례가 늘 수 있어요. 성능을 비교할 때는 자동 처리 비율과 오류를 함께 봐야 해요.

🇰🇷 한국어와 실제 운영에서 확인할 한계

한국어 문의에도 사용할 수 있는지 궁금할 수 있어요. 공식 Models 문서는 영어가 주요 학습 언어이며 현재 가장 높은 정확도를 보인다고 설명해요. CJK 문자권도 처리하지만 같은 수준의 성능을 보장하지 않아, 실제 한국어 자료로 확인할 필요가 있어요.

▲ Jev 사용 전 확인할 범위. 접근 정책과 모델 사양은 바뀔 수 있어 공식 안내를 함께 확인해요.
▲ Jev 사용 전 확인할 범위. 접근 정책과 모델 사양은 바뀔 수 있어 공식 안내를 함께 확인해요.

공식 Jev 1.13 한계 문서는 정밀한 계산, 날짜 비교, 여러 단계를 거치는 판단, 무관한 정보가 많은 입력에서의 약점을 설명해요. 계산할 수 있는 부분은 코드로 처리하고, 의미 판단이 필요한 부분만 질문으로 남기는 편이 맞아요.

같은 문서는 입력 속 악의적인 지시가 판단에 영향을 줄 수 있다고 밝혀요. ‘환각이 없다’는 표현을 ‘항상 정답이고 공격에도 안전하다’로 읽으면 안 돼요. 정해진 형식의 답을 반환하는 성질과 의미상 오답을 내지 않는 성질은 달라요.

현재 공식 입력 사양은 텍스트예요. 문자열이나 JSON처럼 텍스트로 표현된 상황을 다루고, 이미지·오디오·영상 입력은 지원하지 않아요. 화면이나 영상이 출발점인 업무라면 다른 도구가 필요한 정보를 텍스트로 바꾸는 과정까지 고려해야 해요.

운영용 질문은 실제로 헷갈리는 한국어 표현을 포함해 검토하는 편이 좋아요. ‘환불이 안 된다는 말인가요’처럼 질문과 요구가 섞인 표현, 줄임말, 오타, 앞뒤 맥락이 빠진 문의를 따로 모아요. 영어 데모의 결과를 그대로 한국어 서비스의 품질로 바꾸어 말할 수는 없어요.

💬 Jev에 대해 자주 묻는 질문

❓ Jev가 ChatGPT나 Codex를 대체하나요?

현재 용도는 달라요. 공식 문서는 Choice, Score, Noul이라는 세 가지 질문 유형으로 판단을 반환한다고 설명해요. 다만 글쓰기와 코드 작성, 자유로운 대화는 별도 생성형 모델의 역할이에요. 연동 방향은 공식 코딩 에이전트 안내에서 확인할 수 있어요.

❓ Jev를 무료로 바로 시작할 수 있나요?

새 가입자가 지금 바로 사용할 수 있다고 보장할 수는 없어요. 공식 문서의 입력 요금은 100만 토큰당 약 0.042달러이며 출력은 무료예요. 다만 9월 22일 신규 가입 일시 중단 공지가 나왔어요. 이용 전 공식 계정의 최신 공지와 콘솔 상태를 확인해요.

❓ 캐럿에서 Jev를 사용할 수 있나요?

이 글에서는 캐럿의 Jev 제공을 확인하지 않았어요. 소개한 사용 경로는 TypeSafe의 공식 콘솔과 API예요. 다만 코드 작성과 답변 생성을 함께 검토한다면 생성형 모델의 역할도 알아두면 좋아요. GPT-6 Sol·Luna 가이드Claude Opus 5.5 가이드에서 관련 모델을 살펴볼 수 있어요.

Jev를 검토할 때는 ‘어느 모델보다 좋은가’보다 ‘반복해서 고르는 판단이 어디에 있는가’부터 찾는 편이 좋아요. 후보가 정해진 분류, 문서 선별, 처리 경로 선택이 출발점이에요. 글을 만들고 복잡한 문제를 풀어야 하는 부분은 기존 생성형 모델의 강점을 살려요.

새 모델의 속도보다 먼저 확인할 것은 맡길 일의 형태예요. 선택지를 정할 수 있는 판단 하나부터 시험하고, 실제 업무에서 맞는지 확인한 뒤 적용 범위를 넓혀가면 돼요.

3초만에 시작하기