한 줄 요약
한국어 데이터 100건짜리 분류 과제를 Jev와 비교 대상 생성 모델에 똑같이 시켜 시간·비용·판단 일치율을 직접 재 본 영상으로, 홍보 문구의 배수는 재현되지 않았지만 6~8배 수준의 차이는 확인했다고 정리한다.
핵심 내용
- Jev를 "대화도 코딩도 못 하는 대신, 주어진 선택지에서 고르고 점수를 매기고 맞을 확률을 알려 주는" 모델로 소개한다. 문장을 순서대로 생성하는 부담을 줄이고 여러 판단을 병렬로 처리해 속도와 비용을 개선한다는 설명은 공식 문서와 일치한다.
- 세 질문 타입을 실제 댓글 분류 예제로 하나씩 보여 준다. Noul로 답변이 필요한 댓글을 추려 내고, Choice로 유형을 나누고, Score로 우선순위 점수를 매긴 뒤 전부 병렬로 돌린다 (Jev 프리미티브).
- 한 요청에 여러 질문을 함께 넣을 수 있지만 질문끼리 서로의 답을 참조할 수는 없다는 제약을 정확히 짚는다. 그렇게 하려면 파이프라인을 다시 설계해야 한다고 말한다.
- "확률이 함께 나오는 만큼 100% 올바른 판단을 보장하지는 않는다. 그건 LLM과 똑같다"고 본론에서 직접 못 박는다.
- 결론은 앞단 라우팅이다. 판단만 하면 되는 구간을 Jev로 바꾸고 생성은 원래 쓰던 모델에 맡기면 시간과 비용이 확실히 준다는 것이다. 값싼 모델로 앞에서 라우팅하는 방식 자체는 예전부터 쓰던 패턴이지만 Jev는 처음부터 그 용도에 맞춰진 모델이라는 점이 다르다고 본다.
주요 주장 / 데이터
직접 측정한 값이다. 비교 대상 모델은 자막에 **"GPT 5.6 테라"**로 나오는데 그런 모델명을 확인할 수 없어 자막 표기 그대로 인용하고 **(모델명 불확인)**으로 둔다. 모든 실험에서 지시문과 병렬 처리 개수를 통일했고, 비교 모델에는 Jev와 같은 형태로 응답하도록 설계했다고 밝힌다 (2026-09 기준).
| 과제 (각 100건) | Jev 직접 호출 | 게이트웨이 경유 | 비교 모델 (모델명 불확인) |
|---|---|---|---|
| 한국어 고객 문의 분류 | 2.1초 | 3.7초 | 17.4초 |
| 댓글 피드 분류 | 5.6초 | — | 35.2초 |
| 광고 메일 분류 | 6.3초 | — | 45.2초 |
- 비용: 한국어 문의 100건에 Jev $0.0037, 비교 모델 $0.28 — 약 76배 차이. 공식 단가로 계산한 값이라고 밝힌다.
- 속도 배수는 직접 호출 기준 약 8배로 읽는다.
- 판단 일치: 문의 100건 중 89건에서 분류가 완전히 같았고, 분류가 갈린 11건을 포함해 긴급 여부는 100건 모두 동일하게 판단했다. 광고 메일은 100건 중 99건이 같은 분류였다.
- 앞단만 Jev로 바꾼 파이프라인(댓글 100개에서 상위 5개를 골라 답변 생성): 전체 11초 / $0.026 vs 비교 모델 단독 42초 / $0.36. 분류 단계만 보면 3.9초 vs 34초다.
- 스스로의 결론: "공식 사이트가 주장하는 40배에서 200배까지는 느끼지 못했지만 최소 6~8배 이상 빨랐다."
- 도입부에서 "**환각은 0%**라고 주장하는 AI"라는 표현과 "출시 24시간 만에 Vercel의 역대 모델 도입 기록을 갈아치웠다"는 이야기를 전한다. 둘 다 영상이 직접 측정한 값이 아니라 전언이다.
같은 분류를 했다고 정답을 맞혔다는 뜻은 아니라는 점을 영상 자신이 여러 번 강조한다. 일치율은 정확도가 아니라 "두 모델이 같은 기준으로 판단했다"는 지표로만 읽어야 한다.
외부 검증 (2026-09-22, 웹)
자동 생성 자막의 고유명사 오인식을 공식 문서 표기로 교정한다 52.
| 자막 표기 | 올바른 표기 |
|---|---|
| 제브 · 재브 · 재부 · 잭 · 제프 · 제 | Jev |
| 타입세 · 타이세프 · 타이세이 | TypeSafe AI |
| LRM · LM | LLM(대규모 언어 모델) |
| 놀 · 노일 · "놀이스코어" | Noul — 초이스·스코어·놀 = Choice·Score·Noul |
| 시스템 모델 | System One (시스템 원) |
| 버셀 · "V세 AI 게이트웨이" · "AR 게이트웨이" | Vercel AI Gateway |
- "GPT 5.6 테라" — 비교 대상 모델명이다. 어느 출처에서도 확인하지 못해 자막 표기 그대로 인용하고
(모델명 불확인)으로 표시한다. 추측해서 다른 이름으로 바꾸지 않는다. - 자막에 "17.4초가 4초가", "45.2초 2초", "3,9초" 같은 중복·오기 발화가 섞여 있다. 문맥상 읽히는 값(17.4초·45.2초·3.9초)을 채택했다.
- 파이프라인 비용 차이를 영상은 "14배"라고 말하지만 제시한 값($0.36 vs $0.026)으로 계산하면 약 13.8배다. 수치 자체는 영상이 제시한 대로 옮긴다.
출처 정보
- URL: https://www.youtube.com/watch?v=GeM9URVnPV8
- 채널: 코드팩토리
- 공개일: 2026-09-21
- transcript_lang: ko (자동생성 자막 — 오탈자·오인식 주의)
- 비고: credibility medium — 자체 측정 절차(지시문 통일·병렬 수 통일·응답 형태 정렬)를 밝힌 실측 자료라는 점은 높게 보되, 비교 대상 모델명이 확인되지 않아 배수의 절대적 해석은 유보한다.