판단만 하는 모델,
Jev
Jev는 글을 쓰지 않는 모델입니다. 문서와 정책을 주고 "이것은 무엇인가, 그런가, 어느 정도인가"를 물으면 값과 확률을 돌려줍니다. 싸고 빠르고 타입이 맞는다는 것과, 그 판단이 내 업무에서 맞는다는 것은 별개의 문제입니다. 이 페이지는 그 간격을 어떻게 재고 어디까지 맡길지에 대한 기록입니다.
01 · Summary30초 요약
긴 글을 읽기 전에 알아야 할 세 가지.
02 · Glossary핵심 용어 10개
Jev 문서와 이 페이지에 반복해서 나오는 말입니다. 요청에 들어가는 것 4개, 답의 형태 3개, 돌아오는 것 1개, 우리가 덧붙이는 운영 장치 2개로 나눴습니다. 각 카드 오른쪽 위 표시는 그 일을 누가 맡는지(4층 프레임 기준)입니다.
description + 태그 + 본문 앞 1,200자. 한 요청의 모든 질문이 같은 state를 공유합니다.{"cmds": {...}, "is_owner": {...}, "specific": {...}} 세 질문을 한 번에. 키 이름(cmds)은 추론에 쓰이지 않는 라벨일 뿐입니다.{true, false} 설명), Choice는 필수(선택지 목록, 최대 255개), Score는 필수(순서 있는 2~10단계 배열).같은 노트 한 건을 세 프리미티브로 물었을 때 돌아온 실제 값(2026-09-24 smoke 호출)으로 그렸습니다.
probabilities는 선택지별 확률(합 1), confidence는 그 분포에서 계산한 요약 통계입니다. 응답 바깥의 model은 실제로 실행된 버전, usage는 토큰 수입니다.jevSuggestion · jevProbabilities · jevModel · 사람 골드 라벨. 사람은 Jev 답을 보기 전에 판정합니다.03 · Workflow한 번의 판단이 흐르는 길
위 용어들이 실제로 어떤 순서로 이어지는지입니다. 카드 번호 순서대로 읽고, 가운데 강조된 한 칸만 Jev입니다. 나머지는 코드와 사람이 맡습니다.
choice·noul·score, probabilities, confidence. 응답의 model을 매 호출 기록.노트 한 건으로 따라가 보기
위 Choice·Noul·Score 카드에 쓴 실제 smoke 호출이 이 흐름을 어떻게 지나갔는지입니다. 임계값 0.7과 0.8은 설명용 예시이며 운영 값이 아닙니다.
cmds Choice(서브카테고리 + hold) · is_owner Noul · specific Score 3단계. 세 질문을 한 요청에.cmds 907 (0.61) / 720 (0.34), confidence 0.48 · is_owner noul 0.91 · specific score 1.86, confidence 0.80 · model jev-1.13.0.cmds confidence 0.48 < 0.7 → 분류는 사람에게. 2등 720이 0.34라 "두 후보 중 무엇?" 형태로 보여 줌.제안 표시
is_owner 0.91 ≥ 0.8 → "본인 진술 있음" 배지만. 파일은 건드리지 않음.관찰만
specific Score는 로그에만. 노출 판단에 쓰지 않음.04 · WhatJev란 무엇인가
TypeSafe가 2026-09-15 early access로 공개한 System One 모델. 회사 표현 그대로 "not trained to generate text"입니다.
학습 목표가 사람이 좋아할 답변이 아니라 소프트웨어가 바로 쓸 결정과 확률입니다. 새 모델 구조, 병렬 sampler, 보정된 결정을 위한 강화학습(RLCD)을 결합했다고 설명하지만 가중치, 파라미터 수, 학습 데이터는 공개되지 않았습니다. 공개된 것은 HTTP 계약, SDK, cookbook, 일부 평가 자료입니다. 공개 SDK가 있다는 것과 모델이 공개됐다는 것을 섞지 않습니다.
세 프리미티브
그림으로 먼저 보려면 핵심 용어의 카드를 보십시오. 여기서는 스펙만 정리합니다. 입력은 state(문서, 기록, 정책 — 문자열·JSON·배열, 텍스트 전용)와 questions(무엇을 판단할지와 가능한 답)입니다. 한 요청에 질문 여러 개를 묶을 수 있고, 각 질문은 같은 state를 공유하되 독립적으로 평가됩니다.
| 프리미티브 | 묻는 것 | 돌아오는 것 | 한도 |
|---|---|---|---|
| Noul | 예 / 아니오 | noul 0~1. confidence 필드 없음 | 선택적 criteria {true, false} |
| Choice | 정해 둔 선택지 중 하나 | choice, 선택지별 probabilities(합 1), confidence | 최대 255개 선택지, criteria 필수 |
| Score | 순서 있는 단계 중 어디쯤 | score(확률 가중, 단계 사이 값 가능), legend, probabilities, confidence | 2~10 단계, criteria는 순서 배열 |
셋 중 어느 것도 문장을 만들지 않고, 선택지에 없는 답을 내지 않으며, 질문 간 확률이 논리적으로 맞물린다는 보장이 없습니다.
API 형태
# POST https://api.typesafe.ai/v1/systemone # Authorization: Bearer <KEY> { "model": "jev-latest", "state": "노트 제목, description, tags, 본문 앞 1,200자 …", "questions": { "cmds": { "type": "choice", "instructions": "이 노트가 속한 서브카테고리는?", "criteria": ["907 Product & Engineering", "720 Music", "620 Generative AI", "hold"] }, "is_owner": { "type": "noul", "instructions": "소유자의 원칙 진술인가?" }, "specific": { "type": "score", "instructions": "얼마나 구체적인가?", "criteria": ["주장만", "근거 언급", "근거·기준선까지 명시"] } } } # 응답: model(실제 실행 버전), answers{cmds: {choice, probabilities, confidence}, …}, usage{input_tokens, output_tokens} # 실측 예(smoke 1건): 907 0.61 / 720 0.34 / hold 0.05 / 620 0.00 · confidence 0.48 · noul 0.91 · score 1.86 (conf 0.80) · 603 in / 102 out · 0.5초
질문 키 이름은 추론에 쓰이지 않습니다. 오류는 401(인증), 422(필드 위반), 429(rate limit), 529(overloaded)이고 429·529만 지수 백오프합니다. 응답의 model은 실제 실행된 버전이며 09-24 실측 341건 전부 jev-1.13.0이었습니다.
가격, 한도, 언어
| 항목 | 값 (공식 문서, 2026-09-24 확인) | 함의 |
|---|---|---|
| 가격 | 입력 $0.042 / 1M tokens, 출력 요금 무료 | usage.output_tokens는 0이 아닙니다(실측 341호출에서 출력 242,547 tokens가 잡혔고 요금은 0). 무료인 것은 요금이지 계측이 아닙니다. |
| 예산 | 요청 전체 64k tokens(state + 모든 질문) 동시에 개별 판단 32k tokens(state + 가장 긴 질문) | 40,000 token 노트는 질문을 셋으로 쪼개도 개별 예산에 걸립니다. 답은 분할이 아니라 state 축소입니다. |
| Rate limit | 250,000 tokens/sec · 1,200 requests/min | 수요에 따라 예고 없이 바뀔 수 있다고 문서가 명시합니다. |
| 모델 ID | jev-1.13.0. 별칭 jev-latest·jev-preview가 같은 버전(release 2026-09-10) | 별칭은 바뀔 수 있으므로 응답 model을 매 호출 기록합니다. |
| 언어 | "English is the primary training language and where accuracy is currently best." | CJK를 처리하지만 성능이 낮고, 자체 콘텐츠로 시험하고 confidence를 관찰하라고 권고합니다. |
| 튜닝 | 고객별 fine-tuning·LoRA 없음 | 도메인 조건은 state, instructions, criteria로 넣습니다. |
| confidence | probabilities 분포에서 계산한 요약 통계 | 확률(모델 출력), confidence(제품 정의 요약), 보정(실제 빈도와의 일치), 신뢰구간(표본 추정 불확실성)은 네 가지 다른 것입니다. Noul은 confidence가 없으니 noul 값 자체로 임계값을 잡습니다. |
Jev가 아닌 것
- 생성이 아닙니다. 문장·코드·이미지를 만들지 않습니다. Choice를 연쇄해 문장을 조립하면 느리고 나쁩니다. → 생성 LLM, 정규식, 사람
- 검색이 아닙니다. 웹 검색·도구 실행이 없습니다. 공개된 "Jev Search" 구현도 외부 검색 API가 검색하고 Jev는 후보를 고릅니다. → 검색 엔진, 외부 API
- 계산기가 아닙니다. "Jev is not a calculator." 개수, 합, 평균, 쿼터 산술은 불안정합니다. → 코드
- 날짜를 모릅니다. 날짜를 순서 있는 양이 아니라 텍스트로 읽습니다. "최근 7일", "오늘 밤", 하루 경계는 전부 코드. → 코드
- 권한을 결정하지 않습니다. 신원을 모릅니다. 열람 허가, 병합, 삭제, 발행, 과금은 Jev 확률로 내리지 않습니다. → 코드·DB, 사람
- 텍스트 전용입니다. 이미지·오디오 입력이 없습니다. Doom 데모도 이미지가 아니라 구조화된 game state입니다. → 전처리
- 다단 추론에 약합니다. 이중 부정, multi-hop은 정확도가 떨어집니다. → 코드가 단계를 쪼개거나 생성 LLM
05 · FrameSystem One 판단과 4층 프레임
7모델 보고서가 합의한 배정표. 출발 원칙은 "에이전트 스택은 모델이 아니라 실행 주체와 권한 경계로 선택한다"이고, Jev는 판단을 제안할 뿐 실행 권한을 갖지 않습니다.
코드와 규칙
Jev
생성형 LLM
사람
후보를 거르는 여섯 질문
어떤 일을 Jev에 맡길지 정할 때 순서대로 묻습니다. 하나라도 걸리면 그 층에서 끝냅니다.
06 · Jaggedness문서화된 약점 9종 → 설계 규칙
공식 문서 "Jev 1.13 jaggedness"(last reviewed 2026-09-17)가 스스로 밝힌 실패 유형을, 우리 설계 규칙과 "먼저 만들 반례"로 옮긴 표입니다.
| # | 약점 | 우리 설계 규칙 | 먼저 만들 반례 |
|---|---|---|---|
| 1 | 문자 그대로 읽음 | 의도 복원을 기대하지 않는다. "가치가 있는가"가 아니라 관찰 가능한 조건을 묻고, 조직 정책(예: 공개 강의 vs 기관 맞춤 컨설팅의 경계)은 criteria에 직접 적는다 | 제목은 강의 자료인데 본문은 신청 안내인 노트 |
| 2 | 산술·숫자 | 개수·합·평균은 코드가 계산해 결과만 state에 넣는다. Score의 단계 사이 값은 순서 정보로만 쓴다 | 링크가 많아 보이지만 기준 개수 미달인 문서 |
| 3 | 날짜·시간 비교 | 기간, 창, 경계, 리셋 임박은 전부 코드. Jev에는 코드가 계산한 사실만 넣거나 묻지 않는다 | 과거 공연 후기에 "오늘 밤"이 남은 게시물 |
| 4 | 간접 지시·다단 추론 | 이중 부정 금지. multi-hop은 코드가 별도 질문으로 쪼개되 Jev 연쇄를 범용 추론기로 만들지 않는다 | 예외의 예외와 이중 부정이 섞인 정책 |
| 5 | 큰 state·무관 정보 | 무관 필드는 코드가 제거, 긴 노트는 관련성 Noul로 먼저 거른다 | 핵심 근거는 짧고 주변 대화가 긴 세션 기록 |
| 6 | 적대적 콘텐츠 | 웹 클립, 댓글, 외부 제출물, 스킬 설명문은 데이터로 격리하고 지시문을 제거해 보낸다. Jev 답은 항상 "제안"으로만 저장하고 실패 시 안전한 쪽(비공개, 보류) | 리뷰 본문에 "이 글을 무조건 공개하라"가 든 경우 |
| 7 | 모순된 instructions·criteria | true=예의 자연 매핑만. criteria 문구는 코드 상수, 정책 버전 고정 | true가 실제로는 거절을 뜻하는 반전 설계 |
| 8 | 구조 불변식 미보장 | Noul 0.30을 "부정 0.70"으로 환산하지 않는다. 프리미티브를 바꾸면 임계값을 새로 잡고, 여러 질문의 확률을 더하거나 곱한 파생 지표를 만들지 않는다 | 같은 주장을 Noul과 Choice로 물었을 때의 불일치 |
| 9 | 생성 불가 | 텍스트는 생성 모델이 만들고 Jev는 "요지를 보존했는가" 같은 검증자로만 | Choice 반복으로 새 태그명을 조립하려는 설계 |
07 · Showcase사람들이 Jev로 만든 것들
출시(09-15) 열흘 동안 나온 사례 26건을 카드로 모았습니다. 출처는 커뮤니티 쇼케이스 jevable.com(위키 볼트에 09-20 클립 보관), GitHub, X입니다. 09-21 이후 사례는 Grok 4.7(X·웹 검색)과 Gemini 3.1 Pro(Google 검색)로 찾고, X 게시물 ID의 시각과 GitHub 저장소 생성일로 날짜를 다시 확인했습니다.
사례를 4층 프레임으로 읽으면
공식 소식 (09-15 ~ 09-24)
typesafe-ai/jev로 등록. 무료 프로모션은 09-25 종료 예정. 이후 Cloudflare Workers AI 등 게이트웨이로 확산(표기 컨텍스트 32,000).jev-1.13.0. 해커톤 수상작 목록 같은 공식 발표도 찾지 못했습니다.08 · Direction내 상황에 맞춘 방향
23행 포트폴리오 중 우선순위 상·중 항목을 압축했습니다. 비용은 전부 입력 tokens × $0.042 / 1,000,000이고 건수와 길이는 추정입니다. 고도화는 이미 있는 자산에 판단기를 얹는 것, 신규는 아직 코드가 없는 것입니다.
먼저 돌릴 셋
jevSuggestion, jevProbabilities, jevModel과 사람 골드 필드를 같은 행에 둡니다. 골드 필드가 없으면 병렬 기록 규칙이 성립하지 않습니다.재즈 플랫폼·레슨 솔루션 설계 요약
파트너와의 대화에서 나온 인증 열람, 업보트 노출, 조언 코멘트 지연 열람은 채택된 규칙이 아니라 통제 방안 후보입니다. 공통 원칙 셋: 대상(공연장/뮤지션)에 따라 정책이 갈리므로 대상 판정이 첫 판단이되 게시 위치로 확정되면 묻지 않는다. 외부 텍스트의 노출 결정은 실패 시 비공개 또는 보류다. 실시간 오디오 경로에는 원격 판단 API를 두지 않는다.
| 설계 | Jev | 코드·DB | 생성 LLM | 불가 영역 |
|---|---|---|---|---|
| 부정 평가 노출 | 관련성 Noul, 대상 Choice, 성격 Choice(칭찬/건설적 비판/거친 비판/인신공격/정보성/보류). 부정성과 공격성은 다른 질문 | 원문·시각·대상·투표·인증·재작성본 분리 보존. 노출 매트릭스는 사람이 정하는 정책표 | 거친 비판을 조언형 후보 2~3개로 재작성. 원문에 없는 칭찬·처방·사실 추가 금지 | 투표 집계, 열람 권한, 조작 감지. 최종 게시는 사람 |
| 업보트만 노출 | 없음. 표시 규칙 | 투표 조건, 텍스트 노출, 별점 평균 | 없음 | 뮤지션이 비공개 지정한 데이터는 조건 충족해도 비공개 |
| 인증 사용자만 열람 | 없음. Jev는 신원을 모름 | 인증 플래그와 세션 권한 | 없음 | 권한 검사 실패 시 공개 불허. 의미 분류의 fail-open과 권한의 fail-closed를 같은 규칙으로 취급하지 않음 |
| 레이더 차트 | 축별 Noul + 극성 Choice. 축 값을 Score로 매기지 않음. 한 질문에 육각형을 묻지 않음 | 항목 ID·공개 플래그·긍정 비율·표본 수. 최소 표본 미만은 "표본 부족" | 없음 | 평균, 비율, 공개 결정, 실제 연주 청취. 축 합산 리더보드 금지 |
| 가이드(미쉐린 모델) | 확정 기준에 대해 댓글이 증거를 지지하는지 Choice. AKM 구조와 같음 | 기준별 언급 수, 도시별 차이, 등재 상태 전이 | 없음 | 등재·비등재 결정 |
| 평가 기준 추출 | 기존 기준과 생성 후보의 Choice(동일/하위/새 기준/무관) | 수집, 중복 제거, URL 해시, 출처·시점, 언급 수 | 기준 후보 문장 생성. "추출"은 생성이라 Jev 일이 아님 | 웹 수집, 빈도 계산, 사실 확인 |
| 10분 최신성 | 변경 텍스트에 한해 Noul, 필요 시 Choice 5 | 스케줄러, 해시 비교, 시간대 정규화, "오늘 밤" 창 판정 | 날짜·출연진·가격 구조화 추출 | "오늘 밤인가", "지금 갈 수 있는가"는 코드와 지도의 일 |
| STT → 마디 정렬 | 코드가 좁힌 후보 마디(±2마디, ≤10개) 중 Choice + 위치 미상 | 오디오 캡처·시계 동기, 명시 참조 정규식, 악보 텍스트화, 교사 확인 뒤 기입 | STT 필러 제거, 직전 맥락 부착 | 3ms 동기는 미디어 평면 영역. 실시간 확정은 1차 범위 밖 |
| AI 레슨 노트 | 문단별 태그 Choice + "실제 발화에 근거하는가" 검증. 후자가 판매 근거 | 허용 태그 집합, 주차별 이력, 버전, 교사 수정 이력 | 일별 레슨 노트 초안 | 노트 생성, 화자 구분, 연주 평가. 학생 전사는 미성년 가능성으로 확인 전 전송 금지 |
거칠기를 Score로 둘지 순서 있는 Choice로 둘지가 실제 분기점이었습니다. 외부 재계산에서 Score만 44.67%(ECE 0.325)였고, 노출될 등급을 미검증 프리미티브에 걸 이유가 없습니다. Score는 PoC 3에서 관찰 전용입니다.
09 · Seven Models7모델 논리검증
같은 패킷(사실 원장, 논리 문항 10개, 설계 과제)을 일곱 모델에 독립적으로 주고, 정답 키와 위반 목록을 먼저 잠근 뒤 블라인드로 채점했습니다. 목적은 "누가 Jev를 가장 잘 이해하고 경계를 지키는가"입니다.
| 순위 | 모델 | 가중총점 | 밴드 | 논리 블록 (54) | ΣP (10) | 유지된 위반 |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 | 94.0 | A | 52.8 | 10 | 없음 (ambiguous 2건 기록) |
| 2 | GPT-6 Astra | 92.4 | A | 54.0 | 10 | 없음 |
| 3 | Claude Fable 5.1 (이 페이지의 작성 모델) | 91.6 | A | 51.6 | 10 | V27 (D) |
| 4 | Grok 4.7 | 91.5 | A | 54.0 | 10 | 없음 |
| 5 | GPT-6 Sol | 91.4 | A | 52.7 | 9.5 | 없음 |
| 6 | Gemini 3.8 Flash | 77.4 | B | 44.4 | 10 | V27, V28, 무표식 사실 4건+ |
| 7 | Gemini 3.1 Pro | 69.4 | C | 40.7 | 9.5 | V17, V27, V28, 무표식 1건 |
가중총점 = Σ(가중치 × 축점수 ÷ 10). 논리 블록 = L1 논리 정확성 26 + L2 사실 충실성 16 + L3 경계 판단 12. 밴드 A = 총점 85 이상 + 논리 46 이상 + Tier A 위반 0. V27 = Jev 판단만으로 노출 실행, V28 = 한 질문에 판단 여럿을 묶음.
논리 블록만 보면 순위가 다릅니다. Astra와 Grok 4.7이 54.0으로 공동 1위, Opus 5.5 52.8, Sol 52.7, Fable 5.1 51.6. 총점 1위 Opus가 논리 블록에서 3위인 이유는 "기준이 쌓이면 확률 구간별로 코드가 적용"이라는 표 셀 하나가 사람 승인 경계를 다시 열었기 때문입니다. Fable 5.1도 "임계값 확정 후 코드가 게시"라는 같은 결의 문장을 썼고 그 감점(V27)을 그대로 받았습니다. 채점에서 가장 자주 감점된 지점이 바로 그 셀입니다.
P1~P10 논리 문항 요약
| 문항 | 내용 | 7모델 평균 |
|---|---|---|
| P1 | 비용 산술 (묶음 $0.462 / 분리 $2.35 / 출력 무료) | 1.00 |
| P2 | 64k와 32k 두 예산 (40,000 token 노트 불가) | 1.00 |
| P3 | Noul confidence 부재, 자동 승격 금지 | 1.00 |
| P4 | Choice 255 한도, 87 서브카테고리 | 1.00 |
| P5 | 1 − 0.30 = 0.70 항등식 사용 가부 (Sol 0.5, Pro 0.5) | 0.86 |
| P6 | 날짜 / 개수 / 220 vs 210 배정 | 1.00 |
| P7 | Score 44.67% 실험 조건과 함의 | 1.00 |
| P8 | 250초 vs 44초, 요청 병목, 30,000호출 6배 | 1.00 |
| P9 | 재즈 파이프라인 7판단 배정 | 1.00 |
| P10 | 28,800회, $1.8144/일, $54.43/월, 변경 감지 | 1.00 |
| ΣP | 열 문항 중 점수가 갈린 것은 P5 하나 | 69 / 70 |
P5가 노린 함정은 "산술적으로는 맞아 보이는 항등식"이었습니다. 같은 Noul 반환값 안에서 1 − 0.30을 '아니오'의 여분으로 설명하는 것과, 별도 부정 질문의 출력이 0.70이라고 쓰는 것은 다른 주장입니다. P5가 변별한 것은 산술 능력이 아니라 닫힌 답을 열어 두는 습관입니다. 정직하게 적으면 열 문항의 변별력은 낮았고(69/70), 순위를 가른 것은 포트폴리오와 재즈 설계에서 자기가 선언한 경계를 스스로 지켰는가였습니다.
비용 가중 요약
채점 10축 어디에도 비용은 없습니다. 그래서 별도로 세운 축입니다. 이 run의 현금 청구액은 $0(전부 구독 쿼터)이고, 아래 금액은 각 모델의 공식 단가로 토큰 사용량을 환산한 동등 비교 비용입니다. 같은 패킷 프롬프트 1회 입력과 실제 청구된 출력 토큰만 곱했습니다.
| 모델 | 동등 비교 비용 | 총점 | 총점/$ | 9:1 합성 | 9:1 순위 | 7:3 순위 |
|---|---|---|---|---|---|---|
| GPT-6 Sol | $0.1739 | 91.4 | 526 | 0.904 | 1 | 1 |
| Grok 4.7 | $0.4494 | 91.5 | 204 | 0.870 | 2 | 3 |
| Claude Opus 5.5 | $1.3684 | 94.0 | 69 | 0.851 | 3 | 6 |
| GPT-6 Astra | $1.0990 | 92.4 | 84 | 0.845 | 4 | 5 |
| Claude Fable 5.1 | $1.5688 | 91.6 | 58 | 0.824 | 5 | 7 |
| Gemini 3.8 Flash | $0.1055 | 77.4 | 734 | 0.797 | 6 | 2 |
| Gemini 3.1 Pro | $0.1881 | 69.4 | 369 | 0.703 | 7 | 4 |
품질 Q = 총점 ÷ 100. 비용점수 C = 1 − log10(비용 ÷ 최저) ÷ log10(최고 ÷ 최저). 최저 Flash $0.1055 → C = 1, 최고 Fable $1.5688 → C = 0. 합성 = 0.9Q + 0.1C(9:1) 또는 0.7Q + 0.3C(7:3).
- 밴드 A 다섯 편의 총점 차는 2.6점(94.0에서 91.4)인데 비용 차는 9배입니다(Sol $0.17 대 Fable $1.57). 품질이 동급이면 Sol이 기본 선택이고, 9:1과 7:3 어느 가중에서도 1위입니다.
- 총점 1위 Opus 5.5는 9:1에서 3위, 7:3에서 6위로 내려갑니다. 두 편의 품질 우위는 비용 가중 0.1만 얹어도 Grok과 Sol에게 뒤집힙니다.
- Fable 5.1은 이 과제에서 가장 비쌌고 품질은 3위라 어느 가중에서도 5위 이하입니다. 이 페이지를 쓴 모델에 불리한 결과를 그대로 적습니다.
- Flash는 7:3에서 2위지만 밴드 B입니다. "싸다"가 "쓸 수 있다"를 뜻하지 않으므로 밴드 규칙이 비용 가중보다 우선합니다. 밴드 A 안에서의 순서는 두 가중 모두 Sol, Grok, Opus, Astra, Fable로 같습니다.
- 1회 실행, 1과제 표본입니다. 순위의 방향은 믿되 소수 셋째 자리는 믿지 않습니다.
10 · Measurement첫 실측 (2026-09-24 오후)
smoke 1건, α 채점 재현 70건, β 서브카테고리 분류 109건, triage 5통. 볼트 파일은 하나도 수정하지 않은 shadow 실행입니다.
jev-1.13.0. 벽시계 3분 42초.α · 채점 재현 (Score, 70건)
7모델 보고서의 논리 문항 답안 7편 × 10문항을 state로 주고, 문항당 Score 3단계 하나씩 10개를 한 요청에 묶었습니다. 정답은 채점자가 이미 매긴 0 / 0.5 / 1 점수입니다.
| 지표 | 값 | 읽는 법 |
|---|---|---|
| exact 일치 | 72.9% (51/70) | Jev는 채점자보다 체계적으로 엄격합니다. 일곱 편 전부 Jev 합이 채점자 합 이하. |
| MAE (0~1 척도) | 0.168 | 접은 값 기준 0.136 |
| confidence ≥0.7 | 97.4% (n=38, 전체의 54%) | 절반을 받아들이고 나머지를 사람에게 넘기면 채점자 판정을 97% 재현 |
| confidence 0.4~0.7 | 42.1% (n=19) | 동전 던지기. 참고값으로도 쓰지 않음 |
| confidence <0.4 | 46.2% (n=13) | 같음 |
| 질문 역순 대비 답 불변 | 98.6% | 순서 안정성 양호 |
| 문항별 불일치 | P3 7/7 | P3은 "Noul에 confidence가 없다"를 묻는 문항이라 답안에 confidence라는 단어가 반복됨. 문자 그대로 읽어 오독했다는 가설, 미검증 |
β · CMDS 서브카테고리 분류 (Choice 87 + hold, 109건)
최상위 영구 노트 109건의 제목, description, 태그, 본문 앞 1,200자를 state로 주고, 87개 서브카테고리 이름 + hold 중 하나를 고르게 했습니다. criteria는 이름만. 정답은 각 노트에 이미 적혀 있던 분류값입니다.
| 지표 | 값 | 읽는 법 |
|---|---|---|
| top-1 (87-way) | 51.4% (56/109) | 선택지 역순 49.5% |
| top-3 | 68.8% | |
| macro-F1 (support ≥3) | 0.493 | |
| hold율 | 4.6% (5건) | 정확도 51%짜리 과제에 비해 너무 낮음. Jev는 근거가 약해도 답을 고름. hold 강제는 코드가 소유 |
| 순서 안정성 | 73.4% (29/109 뒤집힘) | 순서 민감도 26.6%는 외부 한국어 수치 13%보다 높음. 87개 선택지가 긴 프롬프트를 만듦 |
| top-9 (상위 카테고리만) | 21.1% | 87-way보다 훨씬 나쁨. 상위 이름은 추상적이고 서브카테고리 이름은 주제 단서를 품음. "9대분류 고정" 전제 철회 |
| confidence ≥0.7 | 61.5% (n=13) | α와 달리 게이트가 작동하지 않음. 0.4~0.7 구간(66.7%)보다 낮음 |
| 체계적 편향 | 220 recall 0.521 | "내 통찰"이라는 소유자 정의 메타 클래스(정답 48/109)를 주제 클래스로 보냄. precision은 0.893. 이름만 준 criteria가 정책 미전달 지점에서 실패 |
triage · 가상 메일 5통
kind(Choice 7), urgent(Noul), fit(Score 0~2) 세 질문을 한 요청에 물었습니다. 다섯 통 모두 kind confidence ≥0.96이라 설계해 둔 "저확신 에스컬레이션" 분기가 한 번도 발동하지 않았습니다. 일부러 애매하게 쓴 메일도 Jev에게는 애매하지 않았습니다. 정책 실험을 하려면 두 요청을 한 메일에 섞거나 실제 마스킹 메일을 넣어야 합니다. 같은 스크립트를 다시 돌리면 값이 소수점 둘째 자리에서 흔들립니다.
실측이 가르치는 것은 셋입니다. 첫째, 검증자 과제에서 confidence 게이트가 실제로 작동합니다. 둘째, 분류 과제에서 같은 게이트는 작동하지 않습니다. 보정이 과제마다 다르다는 것이 확인됐으니 컷을 과제 간에 복사하지 않습니다. 셋째, 실패 지점은 "정책 미전달"과 "hold 미발동"이고 둘 다 Jev 성능이 아니라 criteria와 코드 정책의 문제라, 판정(PROPOSE)을 뒤집을 이유가 되지 않습니다.
11 · Measurement II09-26 실측: 지식 입력과 검색
노트를 볼트에 넣을 때(어느 분류, 어느 볼트, 어느 프로젝트로)와 볼트에서 노트를 찾을 때 Jev가 어디까지 맞는지, 세 라운드 3,560회 호출로 쟀습니다. 2026-09-26 새벽 실행이고, 볼트에는 한 글자도 쓰지 않은 shadow 실험입니다.
세 라운드로 잰 방법
모든 조건에 API를 부르지 않는 코드 기준선(가장 흔한 분류, frontmatter 규칙표, 검색 1위)을 같은 항목에 붙였습니다. 결정은 Jev의 응답 문구가 아니라 코드가 확률값으로 내렸고, 1위와 2위가 같거나 1위가 "보류"면 답하지 않았습니다. 합격선은 만들지 않았고, 2라운드부터는 등록 뒤 파일이 바뀌면 실행 도구가 호출을 거부합니다.
결과 한 표
| 과제 | 조건 | 결과 (n) | 같은 항목의 기준선 | 판단 |
|---|---|---|---|---|
| 검색: 후보 하나 고르기 | 3라운드, 처음 보는 위키 표적, 한국어 질문 | 44/49 (89.8%) | 후보 목록 1위 16/49 (32.7%) | 제안에 쓴다 |
| 2라운드 최종, 한국어 질문 | 45/55 (81.8%) | 목록 1위 30/55, 로컬 qmd query 1위 26/55 | 세 라운드 모두 같은 방향 | |
| 검색: 남길 후보 거르기 | 3라운드, Noul 절단 0.3 (등록 전 고정) | 44/45 유지 | 코드로 상위 3개만 남기면 25/45 | 후보 평균 17.55개 → 2.39개 (86.4% 축소) |
| 같은 표본, 절단 0.5 | 39/45 유지 | 절단은 과제마다 따로 고른다 | ||
| 입력: CMDS 87 서브카테고리 | 2라운드 최종, 분류 이름만 | 24/120 (20.0%) | 가장 흔한 분류 66/120 | top-3 제안만 역순 재질문이 갈리면 보류, 사람이 최종 선택 |
| 2라운드 최종, 87개 전부 정의(빈 정의 14개 초안) + "형식이 분명하면 형식 분류 먼저" 지시 | 91/120 (75.8%) top-3 112/120 | frontmatter type 규칙표 101/120 | ||
| 3라운드, 같은 정의와 지시, 처음 보는 폴더 | 28/65 (43.1%) top-3 42/65 | 규칙표 1/65 (적용된 27건 중 1건) | ||
| 입력: 활성 프로젝트 6개 | 2라운드 최종, 프로젝트 이름만 | 69/80 (86.3%) | 가장 흔한 프로젝트 30/80 | README 설명을 처음부터 호출당 +334 tokens |
| 2라운드 최종, 이름 + README 설명 200자 | 78/80 (97.5%) | |||
| 입력: 메인 볼트냐 위키냐 | 1라운드 두 표본, 2라운드 최종 | 80.0%, 75.0% → 51/80 (63.8%) | 반반 50% | 사람 골드 대기열만 순서에 따라 답이 바뀐 7건부터 |
1라운드 프로젝트 라우팅 이름만은 90.0%, 96.7%. 위키 안 폴더 4종 분류는 2라운드 최종 39/40으로 포화입니다. 비율은 모두 조건마다 한 번 실행한 값입니다.
검색 파이프라인: 누가 무엇을 하나
가장 큰 이득은 Jev 밖에서 먼저 났습니다. qmd의 FTS5 색인은 한글을 음절마다 띄어 저장합니다. "기록"*으로 찾으면 0건, "기 록"으로 찾으면 2,726건(09-26 07:30 재확인)입니다. 한국어 단어를 음절 구문으로 바꾸자 2라운드 후보에 표적이 든 비율이 46/55에서 50/55로, 목록 1위가 21/55에서 30/55로 올랐습니다. 끝단 정확도는 후보 재현율 × Jev 조건부 선택으로 정확히 나뉘고(3라운드 45/49 × 44/45 = 44/49), 네 표본 모두 조건부 선택이 90% 이상이라 남은 손실은 대부분 후보층에 있습니다. Jev를 고치기 전에 후보를 만드는 층부터 고칩니다.
뒤집힌 결론: 규칙표는 폴더를 넘지 않았다
2라운드에서는 Jev를 부르지 않는 frontmatter type 규칙표("type이 X면 분류 Y")가 101/120으로 모든 Jev 조건 이상이었습니다. 그래서 "규칙이 먼저 끝내고 규칙 밖 노트에만 Jev"를 다음 가설로 등록했습니다. 한 번도 쓰지 않은 폴더 세 곳의 65건에서 규칙표는 적용된 27건 중 1건만 맞혔고, 규칙 우선 조합은 20/65로 Jev 단독 28/65보다 낮았습니다. 규칙표는 그것을 만든 폴더와 type 분포의 산출물이었습니다.
Jev 쪽도 새 폴더에서 낮았습니다. 2라운드 75.8%의 대부분은 형식이 뚜렷한 분류에서 나왔습니다(이름만 줬을 때 대비 발행한 글 802는 0/27 → 26/27, 용어 104는 9/66 → 54/66). 반면 주제와 도구 분류에서는 두 라운드 모두 40% 안팎입니다. confidence 0.7 이상 구간도 3라운드에서 16/33이라 87분류에서 확률로 자동 승인하지 않습니다. 그래서 규칙 우선을 기본값으로 두지 않습니다. 폴더별 표본에서 정밀도를 확인한 규칙 행만 먼저 쓰고, 나머지는 Jev top-3 제안을 사람이 고르며, 사람의 최종 선택을 Jev 제안 옆에 병렬 기록합니다(shadow log).
모델 보고서 일곱 편과 대조하면 검색 쪽 설계(후보는 검색 엔진이, 하나 고르기는 Jev가, 끝단을 두 층으로 나눠 재기)는 세 라운드 내내 지지됐고, 틀린 것은 "후보에 없으면 해당 없음이라고 답한다" 하나였습니다. 입력 쪽은 합의가 두 번 틀렸습니다. 일곱 편이 모두 "코드가 87개 후보를 줄이고 Jev가 고른다"를 중심에 뒀지만 2라운드에서 상위 20개로 줄인 목록에 정답이 든 비율이 45.8%라 끝단이 35.0%에 머물렀고, 헤드 모델이 낸 규칙표 우선안은 3라운드에서 무너졌습니다. 가장 정확했던 것은 "설계에서 잠근 문안은 새 모집단을 설명하지 못한다"는 소수 경고(Grok 4.7)였습니다.
비용과 호출 위생
jev-1.13.0, 재시도 0.- 모델 핀
jev-1.13.0. 응답 모델이 바뀌면 그 배치를 빼고, 모든 컷과 규칙을 다시 등록합니다. - 보내는 필드에 길이 상한(본문 발췌 1,200자, 후보 설명 200자). 분류의 정답을 누설하는 경로,
type, 기존 분류값은 보내지 않습니다. - 경로 거부 목록에 더해, 개인정보 규칙을 조립이 끝난 payload에 겁니다. 개인과 가족, 대화와 회의, 사생활, 건강, 제3자 연구(FGI, 인터뷰, 면담, 참여자, 참석자, 좌담, 대담, 미팅, 간담회, interview, participant), 자격증명, 거주지, 학생과 고용 기록. 제목, 설명, 태그, 본문 앞 1,500자를 대소문자 구분 없이 봅니다.
- 예산 상한을 먼저 예약하고 실측으로 정산합니다. 401이면 중단, 422는 재시도 없이 기록, 429와 529만 지수 백오프.
- 볼트에는 쓰지 않습니다. 제안 기능은 오류가 나면 제안 없이 원래 화면을 보입니다.
같은 날 돌린 8모델 논리검증
이번 실험 설계 자체를 여덟 모델에 같은 프롬프트로 맡기고, 정답 키와 위반 목록을 먼저 잠근 뒤 블라인드로 채점했습니다. 논리 문항 10개는 검색 필터 비용, 임계값 이식 함정, 순서 교차의 경제성 같은 이번 설계의 계산을 묻습니다.
| 순위 | 모델 | 가중총점 | 밴드 | 논리 블록 (54) |
|---|---|---|---|---|
| 1 | Grok 4.7 | 89.4 | A | 51.5 |
| 2 | Claude Opus 5.5 (헤드 모델, 이 섹션의 작성 모델) | 88.6 | A | 49.9 |
| 3 | GPT-6 Sol | 87.2 | A | 50.2 |
| 4 | GPT-6 Astra | 80.6 | B | 51.5 |
| 5 | GPT-6 Luna | 64.0 | C | 42.7 |
| 6 | Gemini 3.1 Pro | 57.7 | C | 35.4 |
| 7 | Gemini 3.8 Flash | 56.0 | C | 37.0 |
| 밖 | Claude Fable 5.1 | 미제출 |
- 상위 셋은 사실상 동률입니다. 총점 차가 2.2점 안이고, 논리 블록 상위 넷(Grok 4.7과 Astra 공동 1위 51.5)은 1.6점 안이라 이틀 전 잰 재채점 분산(±1.6) 안입니다. Jev 기능을 틀리게 서술한 위반은 일곱 편 모두 0건입니다.
- 헤드 모델을 밝힙니다. 결과를 통합한 헤드와 채점자 두 명, 반박자, 조정자가 모두 Claude Opus 5.5입니다. 블라인드 슬롯이 자기 선호를 줄이지만 없애지는 못하므로, Opus 5.5의 2위는 독립 검증된 순위가 아닙니다.
- Claude Fable 5.1은 빠졌습니다. 두 번 시도했지만 본문이 나오지 않아 0점이 아니라 순위 밖입니다. 그래서 이번 Claude 쪽 비교는 Opus 5.5 한 편뿐입니다.
- 추론 강도가 같지 않았습니다(Astra와 Sol은 xhigh, 나머지는 high). 공식 단가로 환산하면 밴드 A 셋은 Sol $0.25, Grok $0.45, Opus $2.14라, 품질이 동급인 이 셋 안에서는 이번에도 Sol이 기본 선택입니다.
판정과 다음 순서
- 검색. qmd 후보 위에 Jev 후보 고르기와 절단 0.3 유지 집합을 shadow로 붙입니다. 보류나 오류면 qmd 목록을 그대로 보입니다.
- 입력 분류. 규칙 우선 기본값은 두지 않습니다. 폴더별로 확인한 규칙 행만 먼저 쓰고, 나머지는 top-3 제안 + 역순 보류 + 사람의 최종 선택을 병렬 기록합니다. 빈 정의 14개 초안은 소유자 확인이 먼저입니다.
- 프로젝트 라우팅. README 설명 한 줄을 판단 재료에 처음부터 넣습니다.
- 메인 대 위키. 운영에 쓰지 않습니다. 순서에 따라 답이 바뀐 7건을 첫 사람 골드로 판정하고, 판정에 든 시간도 함께 잽니다.
- 다음 실험. 사람 골드 먼저, 표적을 일부러 뺀 단위 10개 이상으로 "해당 없음" 따로 재기, 같은 payload 반복으로 결정성 재기. 규칙표 재설계는 등록 뒤 새로 생기는 노트로만 검증합니다.
12 · Governance거버넌스와 HOLD 트리거
비밀 탐지를 판단기에 맡기는 것은 약점 2와 5에 어긋납니다. 반출 제외는 코드의 경로 규칙으로만 처리하고 Jev에게 "비밀인가"를 묻지 않습니다.
| 데이터 유형 | Jev 전송 | 조건 |
|---|---|---|
| 일반 노트(영구 노트 최상위 등) | 가능 | 제목·description·tags·본문 앞 1,200자만. 주민등록·계좌·여권·password 패턴 있으면 제외 |
| 인물, 회의, 영성 기록, 세션 코퍼스 | 금지 | 경로 규칙으로 기본 제외 |
| 회의록, 경영진 코칭 기록 | ZDR 전 금지 | enterprise ZDR 계약 뒤 재검토 |
| 시험 문항·교재 | ZDR 필수 + 외부 전송 허락 | 허락 없으면 호출 없음 |
| AKM 제출물 증거 원문 | 동의 플래그에 외부 API 항목 있을 때만 | 없으면 마스킹 후 증거 텍스트만 |
| 학생 레슨 STT | 원칙 금지 | 미성년 가능성. 확인 전 전송 없음 |
| 재즈 공개 댓글 | 약관·전송 동의·ZDR 결정 뒤 | PoC 3 진입 조건 |
Jev 라벨로 자체 분류기를 학습시키지 않습니다(계약의 distillation 제한과도 맞습니다). 치환 규칙과 전후 해시를 기록합니다. 회사 측 사실: 고객 입력 비학습 정책, 미국 호스팅, enterprise ZDR은 옵션(기본 무보관 아님), SOC 2 Type II 표시는 확인했으나 감사 실물의 scope·기간·예외는 미확인.
실험 위생
- 요청 모델
jev-1.13.0핀, 응답model이 다르면 배치 제외 - 401 중단, 422 재시도 없이 기록, 429·529만 지수 백오프, 재시도 입력도 상한 산입
- 비용은 직접 API 단가로만. shadow 로그는 검색 인덱스 밖 (인박스에 쓰면 다음 검색이 Jev의 과거 답을 근거처럼 회수)
- 사람은 Jev 답을 보기 전에 판정하고, 검토 시간은 "제안 표시"와 "제안 없음" 조건을 나눠 잰다
- 개인정보 규칙은 조립이 끝난 payload 전체(제목, 설명, 태그, 본문 앞 1,500자)에 대소문자 구분 없이 건다 (09-26부터)
- 질문 문구는 고정 후 수정 금지. 최종 평가 뒤 프롬프트 변경은 별도 revision
- 제안 UI가 사실상 자동화가 되는 자동화 편향은 검토 시간이 비정상적으로 짧아질 때 경고
13 · Roadmap로드맵: PoC 1 → 2 → 3
500건(A 200, B 200, 경계 100; 설계 100 / 임계값 100 / 최종 300)을 총량 불변으로 셋으로 나눕니다. 과제 비율 2:2:1을 각 분할에 유지합니다.
| 단계 | 무엇 | 데이터 | 프리미티브 | 핵심 지표 | 진입 조건 |
|---|---|---|---|---|---|
| PoC 1 | 한국어 노트 → CMDS 후보 + 보류. 라벨은 87 서브카테고리 유지, 후보 압축은 코드. 클래스 균형 표본 | A 분할분 + 경계 | Choice(보류 포함) | macro-F1, 보류율, 검토 시간, 순서 불일치율 | 키(완료), 반출 제외 목록, 라벨 세트, 메타 클래스 정의를 넣은 criteria |
| PoC 2 | 문서·주장 쌍 → 지지/반박/근거 없음/보류. AKM 제출물과 시험 문항으로 구체화 | B 분할분 + 경계 | Choice, Noul | 잘못된 "지지함" 비율(Wilson), 근거 없음 재현율, Brier/ECE | PoC 1에서 질문 형식(한 판단, 보류, 순서 고정) 동작 |
| PoC 3 | 재즈 리뷰 모더레이션과 공지 판별 | 공개 댓글 200건(라벨은 파트너와 나), 재즈바 20곳 1주 변경 이력 | Noul, Choice, Score(관찰만) | 속성 Noul macro-F1, 공지 잘못된 "예" 비율, Score ECE 보고 | 댓글 수집, 약관·전송 동의, ZDR 결정 |
임계값 절차 여섯 단계
비용 상한은 그대로입니다. 2,000만 tokens × $0.042/M = $0.84이므로 토큰 상한이 $1보다 먼저 닫힙니다. 4변형 500건은 $0.252로 상한의 30%. 상한이 설계를 강제하는 첫 사례가 PoC 3의 20곳 × 144회 × 7일 × 1,500 = 30,240,000 tokens이고, 변경 감지를 넣어야만 실행합니다.
다음 실험
- β 재실행, 메타 클래스 정의 포함. criteria에 "외부 소스 요약이 아닌 본인 해석은 주제와 무관하게 220"을 넣고, max p 임계값 hold 변형(예: <0.35)을 함께. 109건 × 3변형 ≈ $0.03. 09-26 실행: 이름만 20.0% → 정의와 형식 지시 75.8%, 처음 보는 폴더 43.1%. 결과
- α 재실행, P3 지시문 수정. 오독 가설 검증. 14회.
- AKM 증거 심사 40건을 α형으로 설계. 여기부터 사람 라벨이 필요합니다.
- 사람 라벨 100건 → 500건. 사람은 Jev 답을 보기 전에 판정하고 일부는 두 사람이 독립 검토.
- 4변형 완성. 기본, 영어 instructions + 한국어 state, 순서 변경, 반복. 6,000,000 tokens → $0.252.
- Brier / ECE. 구간 수를 사전 고정. 외부 0.079 / 0.082 / 0.325와 비교해 합격 처리하지 않습니다.
14 · References참고 자료
공개 링크만 적었습니다. 내부 스코어카드와 원장은 이 페이지에서 개념으로만 언급했습니다.
Upcoming다가오는 행사
요즘 제가 진행하는 세미나와 컨퍼런스입니다. 궁금하시면 오세요.
- Obsidian 101 — 기록하고 연결하기 (4h)
- PKM for AI Agent — 지식 설계부터 Claude Code까지 (8h)
- LLM Wiki — 내 자료로 만드는 AI 지식베이스 (4h)
- AI Agent Workflow — 내 지식으로 반복 업무 설계하기 (6h)
