판단 모델 5곳, 입력 100만 토큰값이 5.7배 갈립니다
글쓴이김성진발행일

고객 문의가 하루에 수천 건 들어오는 서비스를 운영한다고 해 봅시다. 문의마다 “어느 팀이 맡아야 하나”, “급한 건가”, “화난 정도는 어느 단계인가”를 먼저 정해야 합니다. 지금까지는 챗봇용 AI에게 이 질문을 글로 던지고, 돌아온 문장을 코드가 다시 읽어서 값을 뽑는 방식이 흔했습니다. 느리고, 가끔 형식이 어긋나고, 글을 쓰는 값까지 함께 냅니다.
2026년 9월 중순부터 이 일만 하는 모델이 줄줄이 나왔습니다. 글을 쓰지 않고, 사람이 정해 준 보기 중에서 고르기만 하는 판단 모델입니다. 결정 모델, 시스템원(System One) 모델이라고도 부릅니다. 9월 15일 타입세이프 AI가 제이브(Jev)를 공개했고, 그 뒤로 클라우드플레어, 퍼플렉시티, 오픈AI, AWS 스트랜즈 팀이 각자의 모델을 내놓았습니다. 이름이 비슷하고 문서가 전부 영어라서, 무엇이 다른지 한눈에 보기 어렵습니다.
이 글은 두 부류를 위해 씁니다. 판단 모델이라는 말을 이번 주에 처음 들은 분, 그리고 서비스에 붙여 볼 후보를 가격과 조건으로 먼저 좁히려는 분입니다. 낯선 말은 글 끝에 따로 풀어 두었습니다.
기준은 이렇습니다. 2026년 10월 7일에 다섯 곳의 공식 문서·블로그·모델 카드·저장소 설명을 직접 열어 읽었습니다. 제이브는 개발자 문서(모델 목록, 시작하기, 상태 설명, 한계 문서)와 출시 글, 클라우드플레어는 출시 블로그와 Workers AI의 모델 페이지·가격 페이지, 오픈AI는 판단 API 문서, 퍼플렉시티는 허깅페이스 모델 카드, 스트랜즈는 출시 블로그와 깃허브 설명입니다. 모델을 직접 실행해 보지는 않았습니다. 그래서 이 글에 나오는 속도와 점수는 전부 만든 곳이 직접 잰 숫자이고, 제가 한 것은 환산과 계산뿐입니다.
판단 모델은 글을 쓰지 않고 고르기만 합니다
일반 AI는 질문을 받으면 글자를 하나씩 이어 붙여 답을 씁니다. 판단 모델은 질문과 보기를 받고, 보기마다 점수를 한 번에 계산합니다. 글을 쓰는 기능을 일부러 뗀 모델입니다. 스트랜즈 팀은 원문에서 기존 언어 모델의 “글을 뱉는 부분”을 떼어 내고 그 자리에 “보기를 채점하는 부분”을 붙였다고 설명합니다. 그래서 코드가 답을 따로 읽어 낼 필요가 없고, 정해 준 보기 밖의 답은 구조상 나오지 않습니다.
질문은 세 가지 모양뿐입니다.
| 질문 종류 | 무엇을 묻나 | 돌려주는 값 | 예 |
|---|---|---|---|
| 예/아니오 | 이 문장이 참인가 | 참일 확률(0~1) | 이 문의는 급한가? |
| 고르기 | 보기 중 어느 것인가 | 고른 보기, 보기별 확률, 확신도 | 어느 팀이 맡나? 결제·기술·영업 |
| 점수 | 순서 있는 단계 중 어디쯤인가 | 단계별 확률을 평균 낸 점수, 확신도 | 화난 정도: 차분·불만·격앙 |
다섯 곳 모두 이 세 가지를 지원합니다. 이름만 다릅니다. 제이브·클레프·스트랜즈는 예/아니오 질문을 noul이라고 부르고, 오픈AI는 predicate라고 부릅니다.
여기서 확률과 확신도는 다른 값입니다. 확률은 보기 하나하나에 붙는 값이고, 확신도는 “이 답을 그대로 믿어도 되는 정도”를 따로 알려 주는 값입니다. 제이브 문서는 둘이 다르다는 점을 따로 한 페이지로 설명합니다. 예를 들어 제이브 문서에 실린 예시 응답에서는 “Stripe 연동이 3일째 실패한다”는 문의에 담당 팀이 기술 0.85, 결제 0.15로 계산됐고 확신도는 0.78이었습니다. 스트랜즈 저장소의 예시에서는 “정산이 3일째 안 들어온다”는 문의에서 결제 팀이 0.890, 확신도 0.835로 나왔습니다. 두 예시는 입력이 서로 다르니 점수끼리 비교하면 안 됩니다. 이 값이 어떤 모양으로 나오는지만 보시면 됩니다.
빠른 이유도 구조에 있습니다. 글자를 순서대로 쓰지 않고 한 번에 계산하기 때문입니다. 질문을 여러 개 붙여도 입력은 한 번만 읽습니다. 제이브 문서는 모든 질문을 서로 독립적으로 병렬 계산한다고 적었고, 스트랜즈 저장소는 글을 한 번 읽고 질문마다 자기 몫의 토큰만 더한다고 적었습니다.
대신 못 하는 일이 분명합니다. 글쓰기, 코딩, 요약처럼 문장을 만들어 내는 일은 못 합니다. 스트랜즈 블로그는 “복잡한 문제는 추론 모델보다 훨씬 약하고, 코딩·챗봇·문서 요약에는 맞지 않는다”고 스스로 적었습니다. 판단 모델은 챗봇을 대신하지 않습니다. 챗봇 앞뒤에서 “이 요청을 어디로 보낼까”, “이 답을 내보내도 될까”를 싸게 정하는 문지기에 가깝습니다. 같은 문지기 역할로 이미 나와 있던 서비스들은 AI 가드레일 5곳 비교에서 정리했습니다.
다섯 모델의 명함: 누가, 어디서, 무엇을 받는지
먼저 문서에 적힌 기본 조건부터 한 표에 놓겠습니다. 문서에 없는 칸은 비워 두지 않고 “문서에 없음”이라고 적었습니다.
| 제이브 1.13 | 클레프 | 오픈AI 판단 API | 퍼플렉시티 27B | 스트랜즈 2B | |
|---|---|---|---|---|---|
| 만든 곳 | 타입세이프 AI | 클라우드플레어 | 오픈AI | 퍼플렉시티 | AWS 스트랜즈 팀 |
| 쓰는 방법 | 호스팅 API | Workers AI API, 가중치도 공개 | 호스팅 API(공개 베타) | 가중치 공개, 퍼플렉시티 API로 측정 | 가중치 공개(내 컴퓨터에서 실행) |
| 크기 | 문서에 없음 | 클레프 27B, 클레프 플래시는 9B 기반 | 문서에 없음 | 27B | 19억 개 |
| 입력 100만 토큰 | 0.042달러 | 0.24달러 / 플래시 0.09달러 | 0.10달러 | 가격 못 찾음 | 직접 돌리면 0(장비·전기 제외) |
| 출력 요금 | 없음(무료) | 가격표에 입력만 있음 | 없음(입력만 과금) | 해당 없음 | 해당 없음 |
| 입력 종류 | 텍스트만 | 텍스트·JSON·이미지·영상 | 텍스트·이미지 | 텍스트·이미지 | 텍스트, 이미지는 옵션 |
| 한 번에 읽는 길이 | 요청당 64k, 상태는 32k까지 | 65,536토큰 | 문서에 없음 | 문서에 없음 | 한도 명시 없음 |
| 라이선스 | 비공개 API | 가중치 Apache 2.0 | 비공개 API | Apache 2.0 | 저장소 Apache 2.0 |
몇 가지는 표만 봐서는 놓치기 쉽습니다.
제이브의 크기 칸이 비어 있는 것은 작다는 뜻이 아니라 문서에 나오지 않는다는 뜻입니다. 제이브 문서에는 “고객 데이터로 미세 조정하지 않고 모든 계정이 같은 가중치를 쓴다”는 문장이 있습니다. 가중치를 내려받을 수 있다는 안내는 제가 읽은 문서에서 찾지 못했습니다.
클레프의 “크기”는 문서에서 기반 모델로 확인되는 값입니다. 클라우드플레어는 큰 모델에 Qwen3.8-27B를, 플래시에 Qwen3.5-9B를 기반으로 쓰고, 기반 모델은 고정한 채 어댑터와 판단용 부분을 함께 학습했다고 적었습니다.
오픈AI는 모델이 하나뿐입니다. 문서가 “현재 쓸 수 있는 모델은 gpt-6-luna 하나”라고 못 박았습니다.
같은 일을 100만 건 시키면 얼마인가
가격이 입력 토큰 기준이라 바로 비교가 안 됩니다. 그래서 가정을 하나 세웠습니다. 요청 하나가 입력 1,000토큰이라고 합시다(문의 글과 질문 서너 개를 합친 길이입니다). 이 요청을 100만 건 보내면 입력 토큰은 10억 개입니다.
| 모델 | 입력 100만 토큰 | 요청 100만 건(입력 10억 토큰) | 제이브 대비 |
|---|---|---|---|
| 제이브 1.13 | 0.042달러 | 42달러 | 1배 |
| 클레프 플래시 | 0.09달러 | 90달러 | 2.1배 |
| 오픈AI 판단 API | 0.10달러 | 100달러 | 2.4배 |
| 클레프 | 0.24달러 | 240달러 | 5.7배 |
제이브와 클레프는 같은 일을 시켜도 값이 5.7배 다릅니다. 이 글의 제목이 이 숫자입니다. 다만 이 표는 그대로 믿고 쓰면 안 되는 이유가 세 가지 있습니다.
첫째, 같은 글이라도 회사마다 토큰으로 자르는 방식이 달라서 토큰 수가 같지 않을 수 있습니다. 제 가정(1,000토큰)을 모두에게 똑같이 적용했을 뿐이고, 실제 청구서의 토큰 수는 각 회사 기준으로 다시 세어야 합니다. 참고로 제이브 문서의 예시 요청은 질문 세 개를 붙여 입력이 392토큰이었습니다.
둘째, 오픈AI는 가격 아래에 조건이 붙어 있습니다. 문서에 “지역별 처리 프리미엄과 긴 입력용 배수가 적용된다”고 적혀 있습니다. 0.10달러는 기본값이고, 미국·유럽에서 데이터를 지역 안에 가두는 옵션을 쓰거나 입력이 아주 길어지면 더 올라갈 수 있습니다. 배수가 몇 배인지는 이 문서에 없었습니다.
셋째, 클레프 가격표에는 입력 요금만 있고 출력 요금 칸이 없습니다. 제이브와 오픈AI는 출력이 무료라고 명시했는데, 클라우드플레어는 그런 문장을 제가 찾지 못했습니다. 출력이 거의 없는 모델이라 의미가 작을 수 있지만, 확인한 사실은 “가격표에 입력만 있다”까지입니다.
직접 돌리는 두 모델(퍼플렉시티 27B, 스트랜즈 2B)은 사용료가 없습니다. 그 대신 장비 값이 듭니다. 스트랜즈 2B는 안전하게 잡아도 노트북에서 돌아가는 크기라서 부담이 작고, 퍼플렉시티 27B는 아래에서 보듯 메모리 문턱이 높습니다. 이 둘의 “0원”은 장비와 전기를 뺀 값이라는 점만 기억해 두세요.
호스팅 가격이 얼마나 빠르게 움직이는지는 AI 모델 API 가격 전쟁 비교에서 이미 한 번 정리했습니다. 판단 모델은 그 표의 글쓰기 모델 값과는 다른 칸입니다. 입력만 세고 출력은 거의 세지 않기 때문입니다.
제이브: 가장 싸고, 영어 말고는 조심하라고 직접 적었습니다
제이브는 이 흐름을 연 모델입니다. 타입세이프 AI의 창업자는 출시 글에서 “챗봇은 이미 사람보다 잘하는데 자동화는 어디 있나”라는 질문에서 출발했다고 밝히고, 제이브를 “프런티어급 지능을 가진 함수 호출”에 빗댔습니다. 정리되지 않은 입력을 넣으면 타입이 정해진 확률 값이 나온다는 뜻입니다.
개발자 문서의 모델 페이지(jev-1.13.0)에는 운영 조건이 표로 있습니다.
- 가격: 입력 토큰 100만 개당 0.042달러(10억 개당 42달러). 출력은 무료입니다.
- 속도 한도: 초당 토큰 10만 개, 초당 요청 80건. 한도를 넘으면 429 오류가 납니다.
- 길이: 요청 하나에 64k토큰, 그중 상태(입력 글)와 가장 긴 질문을 합쳐서 32k토큰까지입니다.
- 입력: 텍스트만. 이미지·음성·영상은 받지 않습니다.
한도 숫자 위에 굵은 경고가 붙어 있습니다. “수요가 아주 많아 한도는 예고 없이 바뀔 수 있다”는 내용입니다. GPU 계약이 들어오면서 더 많은 사용자를 받는 중이라는 설명입니다. 지금 숫자가 계속 유효하다는 보장이 없으니, 큰 트래픽을 붙이기 전에 한도 화면을 다시 확인해야 합니다. 429 오류의 원인을 찾는 순서는 AI API 한도 5곳 비교에 적어 두었습니다.
한국어 사용자에게 가장 중요한 문장은 언어 지원 항목에 있습니다. 문서는 “영어가 주된 학습 언어이고 정확도가 가장 좋다. 한국어·중국어·일본어 같은 다른 언어도 처리하지만 같은 수준은 아니다. 자기 데이터로 먼저 시험하고, 보낼 때는 확신도를 유심히 보라”고 안내합니다. 상태 설명 페이지에도 같은 취지의 주의가 있습니다.
데이터 처리는 이렇습니다. 제이브는 고객의 요청과 응답으로 학습하지 않는다고 밝혔고, 요청을 저장하지 않는 옵션(ZDR)은 기업 고객용입니다.
제이브가 스스로 적은 약점 문서도 있습니다. jev-1.13의 “들쭉날쭉한 점” 페이지(2026년 10월 2일 점검)는 아홉 가지를 꼽습니다. 질문을 글자 그대로 읽는다, 숫자 세기와 계산이 약하다, 날짜 비교가 약하다, 한 다리 건너 가리키는 일에 약하다, 쓸데없는 정보가 많은 긴 입력에 약하다, 속이려는 내용에 흔들릴 수 있다, 지시와 보기가 서로 모순되면 틀린다, 보기 순서에 따라 답이 달라질 수 있다, 글 생성은 못 한다. 해결책은 한결같이 “계산과 비교는 코드에서 하고, 모델에게는 짧고 문자 그대로 읽을 수 있는 질문만 던져라”입니다.
제이브 홈페이지와 출시 글은 큰 숫자도 내놓습니다. 응답 시간 70~500ms, 글쓰기 모델 대비 193.6배 빠르고 444.6배 싸다는 주장입니다. 이 숫자에는 출처 글이 직접 붙인 단서가 있습니다. 시험 문제를 자기 팀이 만들었고, 정답으로 쓴 기준이 오픈AI와 앤트로픽의 최상위 모델 평균이라 두 회사 쪽으로 기울 수 있으며, “현실에서는 이보다 낮은 쪽이 보통일 것”이라는 설명입니다. 속도 숫자도 “자기 노트북에서, 서부 해안에서 쟀다”고 적었습니다. 정직한 단서이지만, 그만큼 이 숫자는 제3자 시험이 아니라는 뜻입니다.
클레프: 이미지를 읽고, 가중치까지 풀었습니다
클라우드플레어는 같은 흐름에 두 모델로 들어왔습니다. 큰 쪽이 클레프(27B 기반), 작고 빠른 쪽이 클레프 플래시(9B 기반)입니다. 둘 다 Workers AI에서 호스팅하고, 가중치는 허깅페이스에 Apache 2.0으로 올렸습니다.
가격은 Workers AI 가격표에 있습니다. 클레프는 입력 100만 토큰당 0.24달러, 플래시는 0.09달러입니다. 모델 페이지는 클레프를 “텍스트·JSON·이미지·영상을 읽는 270억 개짜리 멀티모달 판단 모델”로 소개하고, 읽을 수 있는 길이는 65,536토큰입니다.
클레프가 내세우는 차이는 세 가지입니다. 이미지를 읽는 비전 인코더가 있다는 것, 한 번에 읽는 길이가 길다는 것(블로그는 “제이브의 32k와 비교해 64k”라고 적었습니다. 제이브 문서의 32k는 상태와 가장 긴 질문을 합친 한도이니 같은 기준의 비교입니다), 그리고 제이브와 API 모양이 같다는 것입니다. 블로그는 “제이브 API와 완전히 호환되어 갈아타기가 쉽다”고 적었습니다.
데이터에 관해서는 “요청과 응답을 읽지도, 저장하지도, 학습하지도 않는다”고 약속합니다. 단, 미세 조정 서비스를 쓰는 경우는 예외입니다. 클라우드플레어는 현재 자기네 엔지니어가 직접 붙는 방식으로 미세 조정을 해 주고, 나중에 스스로 학습시키는 서비스를 낼 계획이라고 적었습니다. 지금 당장 내가 클릭해서 미세 조정할 수 있다는 뜻은 아닙니다.
클라우드플레어가 든 사용 사례는 위협 분석팀의 도메인 분류입니다. 사이트를 열어 화면을 그리고 분류까지 끝내는 데 클레프는 2.2초가 걸렸고, 가장 빠른 일반 모델(gpt-oss-120b)은 4.7초에 분류 결과도 두 가지만 돌려줬다고 합니다. 한 회사 안에서 한 번 잰 사례라서 일반화하기는 어렵습니다. 그래도 “분류 결과를 여러 개 한꺼번에 받는다”는 판단 모델의 쓰임새를 잘 보여 줍니다.
오픈AI 판단 API: 베타인데 이미 영수증 조건이 붙어 있습니다
오픈AI는 별도 주소(POST /v1/decisions)를 만들었습니다. 문서는 이 API가 “텍스트, 이미지, 또는 둘 다를 평가해서 응답 API보다 약 10배 빠르게 타입이 정해진 답을 돌려준다”고 소개합니다. 비교 대상이 다른 회사 모델이 아니라 오픈AI 자신의 응답 API라는 점을 기억해 두세요.
공개 베타이고, 문서는 “몇 주 안에 정식 출시를 예상한다”고 적었습니다. 쓸 수 있는 모델은 gpt-6-luna 하나이며, 가격은 입력 100만 토큰당 0.10달러입니다. 캐시를 읽고 쓰는 값이나 출력 토큰 요금은 없고 입력만 과금합니다. 대신 앞서 본 대로 지역 처리 프리미엄과 긴 입력 배수가 붙을 수 있습니다.
질문 종류는 predicate(참일 확률), choice(보기 중 하나, 확률과 확신도), score(순서 있는 단계를 확률로 평균 낸 점수)입니다. 문서가 직접 든 점수 예시가 이해에 도움이 됩니다. 단계가 0·1·2일 때 확률이 0.1·0.7·0.2라면 점수는 1.1이 됩니다. 단계 사이 값이 나올 수 있다는 뜻입니다.
기억할 점이 몇 가지 있습니다.
- 이미지는 인라인 base64 데이터 주소로만 보낼 수 있습니다. 이미지 웹 주소나 파일 아이디는 이 API에서 받지 않습니다.
- 답이
refusal(거절) 모양으로 올 수 있습니다. 문서의 예제 코드가 거절 경우를 따로 처리합니다. - 문서는 “글을 만들어야 하면 구조화 출력 기능을, 도구 호출이 필요하면 함수 호출 기능을 쓰라”고 구분합니다. 판단 API는 그 둘을 대체하지 않는다고 스스로 선을 긋습니다.
- 요청을 저장하지 않는 옵션(ZDR)과 의료 정보 규정(HIPAA)은 조건을 갖춘 고객에게 지원하고, 데이터 거주와 지역 처리는 미국과 유럽(EEA·스위스)에서 지원합니다.
- 예제를 돌리려면 SDK를 문서가 적은 버전(예: 파이썬 3.26.0) 이상으로 올려야 합니다.
문서에 없는 것도 분명합니다. 점수표, 모델 크기, 읽을 수 있는 길이, 한국어 지원 수준이 이 문서에는 없었습니다. 이미 오픈AI 결제 환경에 있고 데이터 거주 요건이 있는 팀에게는 가장 단순한 길이지만, 성능 근거는 직접 만들어야 합니다.
퍼플렉시티 27B: 점수는 높은데 GPU 메모리 49GiB가 문턱입니다
퍼플렉시티의 pplx-decider-v1-27b는 Qwen3.8-27B를 미세 조정한 판단 모델이고, Apache 2.0으로 가중치를 공개했습니다. 모델 카드가 직접 정한 실행 조건은 파이썬 3.12 이상과 CUDA GPU이며, 가중치만 약 49GiB에 작업 메모리가 더 필요합니다. 제 판단으로는 일반 노트북은 물론 흔한 게이밍 그래픽카드 한 장으로도 올리기 어려운 크기입니다.
사용법은 저장소의 추론 예제(inference.py)를 내려받아 Decider.from_pretrained로 불러 predict를 호출하는 식입니다. 예/아니오 질문은 noul, 고르기는 choice로 보내고, 이미지는 images=["screenshot.png"]로 함께 넘깁니다. 응답은 고른 보기와 보정된 확률입니다.
이 카드의 가장 큰 특징은 점수표를 직접 공개했다는 점입니다. 11개 시험의 정확도를 제이브, 기반 모델(Qwen3.8-27B), 퍼플렉시티 모델 세 열로 나란히 놓았습니다. 카드는 “퍼플렉시티 모델의 점수는 퍼플렉시티 API로 쟀다”고 밝힙니다. 퍼플렉시티 API로 쓸 수 있다는 뜻이지만, 가격이나 사용 문서는 제가 찾지 못했습니다. 이 표의 내용은 아래 “점수표를 읽는 법”에서 자세히 보겠습니다.
스트랜즈 2B: 노트북에서 돌고, 약점도 숫자로 적었습니다
AWS 스트랜즈 팀의 strands-decider-2B는 이번 다섯 곳 중 가장 작습니다. 파라미터 19억 개로, 언어 모델 Qwen3.5-2B-Base의 글쓰기 부분을 떼고 약 100만 개짜리 선택 채점 부분을 붙였습니다. 가중치뿐 아니라 학습 데이터와 학습 스크립트까지 풀었고, 저장소 라이선스는 Apache 2.0입니다.
기억할 점은 “내 컴퓨터에서 돌린다”입니다. pip install strands-decider 하고 명령줄에서 질문하면 되고, 서버로 띄우면 제이브와 같은 주소 모양(/v1/systemone)에 state와 questions 구조의 요청을 받습니다. 애플 실리콘 맥에서는 MLX 옵션으로 기본 방식(MPS)보다 1.4~1.6배 빠르고, CPU로도 돕니다. 이미지는 옵션을 켜면 받지만 이미지 학습은 따로 하지 않았다고 저장소가 적었습니다. 파일 크기는 문서에 없지만, 19억 개를 16비트로 저장하면 약 3.8GB입니다(제 계산이라 실제 파일과 다를 수 있습니다).
속도는 RTX 3090(윈도우 리눅스 환경)에서 질문 하나에 중앙값 115ms, 95번째 백분위 299ms입니다. M3 Pro 맥북에서는 300토큰 이하 작업이 중앙값 153ms, 전체 작업이 234ms입니다.
가장 인상적인 것은 약점 공개입니다. 저장소는 JevBench v1 공개 문제 231개에서 지금 대표 버전(v21)이 정확도 0.762(176문제 정답)라고 적었습니다. 그리고 문제를 난이도로 나눈 결과도 함께 보여 줍니다.
| 난이도(저장소 자체 분류) | 정확도 |
|---|---|
| 쉬움 | 100% |
| 보통 | 93.1% |
| 어려움 | 55.0% |
난이도가 올라가면 정답률이 반 정도로 떨어집니다. 저장소는 “쉬운 문제는 전부 맞힌다”고 자랑하는 동시에 이 표를 그대로 실었습니다. 확신도 0.9 이상인 답은 처음 보는 짧은 분류 문제에서 약 95% 맞았고, 그 아래는 확인하거나 사람에게 물으라고 권합니다. 같은 저장소는 “문제가 231개뿐이니 두 번의 단일 실행에서 10문제 안팎의 차이는 아직 결론 내릴 수 없다”는 경고도 적었습니다. 점수를 읽는 방법으로 배울 만한 태도입니다.
점수표를 읽는 법: 시험지는 모두 자기 것입니다
판단 모델 다섯 곳 중 같은 시험지로 같은 날 모두를 잰 곳은 없습니다. 어디서 나온 숫자인지 먼저 정리합니다.
| 출처 | 어떤 시험 | 누가 쟀나 |
|---|---|---|
| 제이브 | 자체 업무 흐름 시험(4가지), 글쓰기 모델 대비 속도·비용 | 타입세이프 AI 팀 |
| 클라우드플레어 | 제이브 판단 지수 10개 시험 + 타입세이프 업무 시험 4가지, 지연 시간 | 클라우드플레어 |
| 퍼플렉시티 | 공개 시험 11개 | 퍼플렉시티 |
| 스트랜즈 | JevBench v1 공개 문제 231개 | 스트랜즈 팀 |
| 오픈AI | 점수 없음, “응답 API보다 약 10배 빠름” | 오픈AI |
제이브가 두 표(클라우드플레어, 퍼플렉시티)에 모두 들어 있어서 다리처럼 보이지만, 두 표에 겹치는 시험 이름은 하나도 없습니다. 그래서 두 표를 이어 붙여 “클레프 대 퍼플렉시티”의 순위를 매길 수 없습니다.
클라우드플레어의 표(클레프 · 클레프 플래시 · 제이브)에서 골라 본 값입니다. 점수가 높을수록 좋습니다.
| 시험 | 클레프 | 클레프 플래시 | 제이브 |
|---|---|---|---|
| BFCL(함수 호출 정확도) | 98.47 | 98.76 | 95.75 |
| API-Bank | 91.93 | 93.11 | 88.19 |
| BANKING77(은행 문의 분류) | 94.20 | 90.93 | 79.74 |
| CLINC150+OOS(의도 분류) | 97.43 | 66.77 | 89.27 |
| PhishNChips(피싱 판별) | 79.60 | 75.05 | 62.55 |
| When2Call | 72.37 | 65.58 | 80.97 |
| BRIGHT | 45.91 | 39.26 | 47.52 |
이 표에서 눈에 띄는 것은 세 가지입니다. 클라우드플레어가 고른 열 개 시험 중 제이브가 클레프를 앞선 것은 두 개(When2Call, BRIGHT)입니다. 클레프 플래시는 값이 싸고 빠른 대신 CLINC150+OOS에서 66.77로 클레프(97.43)와 30점 넘게 벌어집니다. 그리고 이 표는 클라우드플레어가 직접 만든 비교 사이트의 값입니다. 클라우드플레어는 “클레프가 제이브 판단 지수에서 현재 1위”라고 적었는데, 그 순위 역시 자기네 비교입니다.
타입세이프의 업무 흐름 시험 네 가지에서는 차이가 훨씬 작습니다. 송장 처리 64.7·57.1·61.8, 고객 응대 76.3·77·76.0, 보안 사고 62.9·61.7·61.7, 에이전트 기록 관찰 68.5·69.8·71.6(클레프·플래시·제이브 순)입니다. 마지막 하나는 제이브가 가장 높습니다. 클라우드플레어도 “네 영역 중 세 곳에서 제이브를 앞섰다”고 적었으니, 타입세이프가 “실제 업무에 가깝다”고 설명한 이 시험에서는 둘이 비슷하다고 읽는 편이 맞습니다.
퍼플렉시티의 표(퍼플렉시티 27B · 제이브 · 기반 모델)입니다. 정확도(%)입니다.
| 시험 | 퍼플렉시티 27B | 제이브 | Qwen3.8-27B(기반) |
|---|---|---|---|
| 전체 평균(11개) | 85.71 | 84.51 | 74.76 |
| RAGTruth | 88.80 | 77.27 | 61.53 |
| FinancialPhraseBank | 84.18 | 76.98 | 75.68 |
| WinoGrande | 83.30 | 90.70 | 73.10 |
| BBH | 82.80 | 94.27 | 72.80 |
| JevBench public hard | 70.30 | 73.27 | 72.28 |
평균은 퍼플렉시티가 1.2점 앞섭니다. 하지만 그 뒤에는 시험마다 11점 넘게 엇갈리는 항목이 있습니다. RAGTruth는 퍼플렉시티가 11.53점 높고, BBH는 제이브가 11.47점 높습니다. 열한 개 중 제이브가 앞선 시험이 여섯 개, 퍼플렉시티가 앞선 시험이 다섯 개입니다. 퍼플렉시티 자신의 표에서도 JevBench public hard 시험은 제이브가 높습니다. 평균 숫자 하나로 “어느 쪽이 낫다”고 말하기 어려운 이유입니다. 또 하나 눈여겨볼 점은 기반 모델(Qwen3.8-27B)의 평균이 74.76이라는 것입니다. 같은 뼈대에 판단용 훈련을 더한 것만으로 10점 넘게 오른다는 점은, 판단 모델이 단순한 포장이 아니라 훈련의 결과라는 근거입니다.
스트랜즈의 0.762는 위 표들과 이어 붙일 수 없습니다. 같은 JevBench라는 이름이어도 퍼플렉시티가 쓴 “public hard”와 스트랜즈가 쓴 “공개 231문제 전체”가 같은 범위라는 설명은 어디에도 없습니다. 이름이 같다고 같은 시험지라고 믿으면 안 됩니다.
속도: 115밀리초와 524밀리초는 같은 자가 아닙니다
속도 숫자도 재는 사람마다 조건이 다릅니다.
| 출처 | 숫자 | 조건 |
|---|---|---|
| 제이브(자체 주장) | 70~500ms | 서부 해안의 자기 노트북에서 잰 값 |
| 클라우드플레어가 잰 제이브 | 중앙값 524.1ms(95번째 536.0ms) | 클라우드플레어의 43개 시험 |
| 클라우드플레어가 잰 클레프 | 중앙값 209.3ms(238.6ms) | 같은 시험 |
| 클라우드플레어가 잰 클레프 플래시 | 중앙값 38.8ms(122.4ms) | 같은 시험 |
| 스트랜즈 2B | 중앙값 115ms(299ms) | RTX 3090, 내 컴퓨터 |
| 스트랜즈 2B | 중앙값 153ms(300토큰 이하) | M3 Pro 맥북 |
| 오픈AI | “응답 API의 약 10배 빠름” | 오픈AI 자신과의 비교 |
흥미로운 지점은 제이브의 자체 주장 범위(70~500ms)와 클라우드플레어가 잰 중앙값(524.1ms)이 약간 어긋난다는 것입니다. 거짓이라는 뜻은 아닙니다. 재는 위치, 입력 길이, 질문 수, 네트워크 거리가 달라서입니다. 클라우드플레어 표에서 클레프는 제이브의 약 40% 시간(209.3 대 524.1, 2.5배 빠름), 클레프 플래시는 약 13.5배 빠릅니다. 이 숫자는 클라우드플레어의 시험 환경에서 나온 것입니다.
속도에서 중요한 건 평균이 아니라 내 서비스에서 재는 값입니다. 사용자와 서버 사이의 거리, 내가 보내는 입력 길이, 한 번에 붙이는 질문 수가 모두 시간에 영향을 줍니다. 호스팅 API는 네트워크 시간까지 더해지고, 내 컴퓨터에서 돌리는 모델은 그 시간이 없는 대신 내 장비가 느리면 그만큼 느립니다.
한국어로 쓴다면
한국어 서비스를 운영한다면 이 항목이 가격표보다 중요할 수 있습니다. 제가 읽은 범위에서 확인되는 사실은 이렇습니다.
- 제이브는 영어가 가장 좋고 한국어를 포함한 다른 언어는 정확도가 낮다고 문서에 명시했습니다.
- 클레프, 퍼플렉시티 27B, 스트랜즈 2B는 모두 Qwen 계열 모델 위에 만들었다고 밝혔습니다. 하지만 세 곳의 문서에서 한국어 성능을 밝힌 문장은 찾지 못했습니다.
- 오픈AI 판단 API 문서에도 언어별 성능 정보는 없었습니다.
- 점수표의 시험 대부분은 영어 문제입니다. 퍼플렉시티 표의 Belebele(여러 언어 독해)만 다국어 시험인데, 거기서도 제이브 95.00, 퍼플렉시티 94.00, 기반 모델 93.20으로 아주 근접했을 뿐 한국어만 따로 잰 값은 아닙니다.
그래서 한국어로 쓸 때는 어떤 모델이든 점수표를 믿고 고르면 위험합니다. 제 서비스의 실제 문의 글 50개쯤에 정답을 달아 놓고 후보를 돌려 보는 것이 가장 빠르고 확실한 방법입니다. 방법은 아래 “써 보기 전에” 부분에 적었습니다. 질문과 보기를 영어로 쓰고 입력만 한국어로 보내는 방식이 나은지도 이 시험에서 함께 확인해 볼 수 있습니다. 어느 쪽이 낫다는 공식 문서는 없습니다.
갈아타기가 쉬운 조합과 어려운 조합
한 곳에 정착하기 전에 나중에 옮길 수 있는지도 따져 봐야 합니다. 요청 모양을 보면 다섯 곳이 두 무리로 나뉩니다.
제이브, 클레프, 스트랜즈(서버 실행) 세 곳은 같은 모양입니다. 입력은 state, 질문은 이름을 키로 갖는 객체입니다.
{
"state": "정산이 3일째 안 들어옵니다. 급합니다.",
"model": "jev-latest",
"questions": {
"urgent": { "type": "noul", "instructions": "이 문의는 급한가?" }
}
}
클레프는 model에 "clef"나 "clef-flash"를 넣고, 스트랜즈 서버는 같은 주소 모양(/v1/systemone)을 받습니다. 주소와 인증 방식은 각자 다르니, 바뀌는 곳은 주소·키·모델 이름 정도로 줄어듭니다. 클라우드플레어가 “제이브와 완전히 호환”이라고 적은 것이 이 부분입니다.
오픈AI는 모양이 다릅니다. 입력은 input, 질문은 이름을 안에 넣은 배열, 예/아니오 종류의 이름은 predicate입니다.
{
"model": "gpt-6-luna",
"input": "정산이 3일째 안 들어옵니다. 급합니다.",
"questions": [
{ "type": "predicate", "name": "urgent", "instructions": "이 문의는 급한가?" }
]
}
그래서 오픈AI로 시작하면 나중에 다른 곳으로 옮길 때 요청과 응답 처리 코드를 고쳐야 합니다. 반대로 제이브 모양으로 시작해 두면 클레프나 스트랜즈로는 코드를 거의 안 바꾸고 이동할 수 있습니다. 퍼플렉시티 27B는 파이썬 함수(Decider.predict)를 직접 부르는 방식이라 또 다릅니다. 이것이 점수보다 먼저 고를 이유가 되는 서비스도 있을 겁니다. 한 곳에 묶이는 게 부담이면 제이브 모양으로 요청 코드를 한 곳에 모아 두는 쪽을 권합니다. 여러 모델 회사를 한 창구로 묶는 도구는 AI 게이트웨이 5곳 비교에서 다뤘는데, 이 판단 모델 전용 API를 그 게이트웨이가 얼마나 받아 주는지는 이 글에서 확인하지 못했습니다.
다섯 곳 모두에게 해당하는 약점
판단 모델은 만능이 아닙니다. 다섯 곳의 문서에서 겹치는 이야기를 모았습니다.
- 어려운 문제는 약합니다. 스트랜즈는 어려움 단계 정확도가 55.0%로 반 정도입니다. 제이브는 간접적으로 가리키는 문제, 숫자 계산, 날짜 비교를 약점으로 적었습니다.
- 질문이 모호하면 모호하게 답합니다. 제이브 문서는 모델이 질문의 뜻이 아니라 쓴 글자를 읽는다고 적었습니다. 질문 하나에는 판단 하나만 담고, 복합 판단은 쪼개서 코드가 합치라는 것이 공통 권고입니다.
- 긴 입력이 늘 이롭지 않습니다. 제이브는 관련 없는 정보가 많으면 정확도가 떨어진다고 적었습니다. 먼저 거르고 필요한 부분만 보내라는 뜻입니다.
- 오픈AI와 클라우드플레어, 퍼플렉시티 문서에는 약점 목록이 따로 없었습니다. 약점이 없다는 뜻이 아니라, 제가 읽은 문서에 적혀 있지 않다는 뜻입니다.
내 사정에 맞는 후보 고르기
가장 좋은 모델을 고르는 글이 아니라, 문서에 적힌 조건에 맞는 후보를 고르는 방법입니다. 제가 직접 써 본 것이 아니므로 “먼저 시험해 볼 후보”로 읽어 주세요.
| 상황 | 먼저 볼 후보 | 이유(문서 기준) |
|---|---|---|
| 영어 입력이 대부분이고 값이 가장 중요하다 | 제이브 | 입력 100만 토큰 0.042달러, 출력 무료. 한도가 바뀔 수 있다는 경고가 있음 |
| 한국어 입력이 대부분이다 | 어느 곳이든 직접 시험 | 제이브는 한국어 정확도가 낮다고 명시, 나머지는 문서에 없음 |
| 이미지·영상도 판단해야 하고 엣지에서 처리한다 | 클레프 | 이미지·영상 입력, Workers AI 호스팅 |
| 지연이 최우선이고 정확도는 중간이어도 된다 | 클레프 플래시 | 클라우드플레어 시험 중앙값 38.8ms, 입력 0.09달러 |
| 이미 오픈AI를 쓰고 ZDR·지역 처리가 필요하다 | 오픈AI 판단 API | 데이터 거주(미국·유럽) 옵션. 단, 베타이며 점수 근거는 직접 만들어야 함 |
| 내 GPU 서버가 있고 정확도 평균이 중요하다 | 퍼플렉시티 27B | 11개 시험 평균 85.71%, 가중치 약 49GiB가 필요 |
| 내 노트북에서 무료로 실험하고 싶다 | 스트랜즈 2B | 19억 개, Apache 2.0, M3 Pro에서 중앙값 153ms |
한 가지 흔한 설계도 알아 두면 좋습니다. 스트랜즈 팀은 어려운 판단만 글쓰기 모델에게 맡기고, 단순하고 반복적인 판단은 판단 모델에게 맡기는 혼합 구조를 실험 중이라고 적었습니다. 비용과 지연을 함께 줄이려는 구조입니다. 판단 모델이 챗봇을 대체하는 것이 아니라 앞단에서 걸러 주는 쪽으로 쓰인다는 뜻입니다.
써 보기 전에: 정답 50개부터 만드세요
점수표가 제각각이라서, 후보를 고르는 가장 믿을 만한 방법은 내 데이터로 직접 재는 것입니다. 큰 도구가 필요하지 않습니다.
- 실제 입력 50개를 모읍니다. 지난달 문의 글, 분류하려는 문서 같은 진짜 데이터가 좋습니다. 쉬운 것만 모으지 말고 헷갈리는 것을 일부러 섞어 넣으세요.
- 정답을 먼저 사람이 답니다. 담당 팀, 급함 여부 같은 정답을 모델을 돌리기 전에 정해 둡니다. 나중에 모델의 답을 보고 정답을 맞추면 시험이 아니라 합리화가 됩니다.
- 같은 질문을 후보마다 돌립니다. 질문 문구를 후보마다 바꾸지 않습니다. 그리고 보기 순서를 한 번 뒤집어서 답이 바뀌는지도 같이 봅니다. 제이브 문서가 보기 순서에 따라 답이 달라질 수 있다고 적었기 때문입니다.
- 정확도와 함께 확신도를 봅니다. 확신도가 높은 답만 자동으로 처리하고 낮은 답은 사람에게 넘기는 기준선을 정합니다. 스트랜즈는 0.9 이상이 약 95% 맞았다고 적었는데, 그 숫자는 그들의 시험에서 나온 것이니 내 데이터에서 다시 구해야 합니다.
- 정확도가 비슷하면 값이 아니라 갈아타기 쉬운 쪽을 고릅니다. 앞에서 본 요청 모양의 차이가 이때 결정적입니다.
한도와 가격은 둘 다 바뀔 수 있는 값입니다. 제이브는 한도가 예고 없이 바뀔 수 있다고 직접 경고했고, 오픈AI는 아직 베타입니다. 실제로 붙이기 전에 각 사의 가격 페이지를 한 번 더 열어 보세요.
확인하지 못해서 뺀 것
- 퍼플렉시티 API의 가격과 사용 문서. 모델 카드가 “퍼플렉시티 API로 쟀다”고만 적고 있고, 그 API의 가격은 제가 찾지 못했습니다. 그래서 가격 표에서 이 칸은 비워 두었습니다.
- 오픈AI 판단 API의 모델 크기, 읽을 수 있는 길이, 한국어 성능, 점수. 문서에 없었습니다. 긴 입력 배수와 지역 프리미엄의 구체적인 배율도 이 문서에는 없었습니다.
- 클레프 플래시의 입력 종류와 읽을 수 있는 길이. 모델 페이지에서 제가 확인한 것은 큰 클레프 쪽입니다.
- 클라우드플레어 표의 나머지 열. 클라우드플레어의 비교 표에는 제이브 외에도 이름이 더 붙은 모델 몇 개가 있는데, 표의 열 이름이 글로 옮겨지면서 모호해져서 제가 확신하는 세 열(클레프·클레프 플래시·제이브)만 인용했습니다.
- 제이브의 모델 크기와 가중치 공개 여부. 문서에 없었습니다.
- 직접 실행한 결과. 어떤 모델도 제가 실행해 보지 않았습니다. 속도와 정확도는 모두 만든 곳이 쓴 숫자입니다.
- 스트랜즈의 대표 버전. 출시 블로그는 v19, 저장소는 현재 v21이 기준이라고 적고 있습니다. 이 글의 점수는 저장소(v21) 값입니다.
- 한국어 성능. 앞에서 적은 대로 제이브만 영어가 가장 좋다고 밝혔고, 나머지는 문서에 없습니다.
용어 풀이: 판단 모델 편
| 말 | 뜻 |
|---|---|
| 판단 모델(결정 모델, 시스템원 모델) | 글을 쓰지 않고 정해진 보기 중에서 고르거나 점수를 매기는 AI. 답과 함께 확률·확신도를 준다 |
| 토큰 | AI가 글을 읽는 단위. 한글은 글자 수보다 토큰 수가 많이 나올 수 있다 |
| 확률과 확신도 | 확률은 보기마다 붙는 값, 확신도는 그 답을 믿어도 되는 정도를 따로 알려 주는 값 |
| 캘리브레이션(보정) | 모델이 “90% 확신”이라고 할 때 실제로 90% 맞는 정도. 판단 모델이 내세우는 핵심 장점 |
| 가중치 공개(오픈 웨이트) | 모델 파일을 내려받아 내 컴퓨터에서 돌릴 수 있게 공개한 것 |
| Apache 2.0 | 상업적 사용이 가능한 대표적인 오픈소스 라이선스 |
| 멀티모달 | 글뿐 아니라 이미지·영상도 입력으로 받는 모델 |
| 미세 조정 | 이미 만든 모델을 내 데이터로 더 훈련해 특정 일에 맞추는 것 |
| ZDR(제로 데이터 보존) | 요청과 응답을 저장하지 않는 옵션 |
| 지연 시간(레이턴시) | 요청을 보내고 답이 돌아올 때까지 걸리는 시간. 중앙값은 중간 값, 95번째는 느린 쪽 5%의 경계 |
마무리: 다섯 줄로 줄이면
- 제이브는 가장 싸고 흐름을 연 모델이지만, 한국어는 영어보다 약하다고 직접 밝혔고 한도가 바뀔 수 있습니다.
- 클레프는 이미지·영상을 읽고 가중치까지 풀었지만, 제이브보다 입력 값이 최대 5.7배입니다(플래시는 2.1배).
- 오픈AI 판단 API는 가장 단순한 길이지만 베타이고, 값에 조건이 붙고, 점수 근거가 없습니다.
- 퍼플렉시티 27B는 자기가 공개한 표에서 평균이 가장 높지만, 가중치만 49GiB입니다.
- 스트랜즈 2B는 노트북에서 도는 가장 작은 모델이고, 약점을 숫자로 공개한 점이 믿음직합니다.
- 모든 점수는 만든 곳이 직접 쟀고 시험지가 겹치지 않습니다. 후보를 좁힌 뒤에는 내 데이터 50개로 직접 재 보는 것이 가장 정확합니다.
판단 모델은 나온 지 한 달도 안 된 분야라서, 이 글의 숫자는 몇 주 안에 낡을 수 있습니다. 오픈AI는 몇 주 안에 정식 출시를 예상한다고 밝혔고, 제이브는 한도를 조정 중이며, 스트랜즈는 출시 블로그의 v19가 저장소에서는 v21로 바뀌었습니다. 이 글은 2026년 10월 7일 기준입니다.