CMDSPACE Labs
CMDS × Jev · TypeSafe System One · 조사 2026-09-20 · 실행 2026-09-24 · 2차 실행 2026-09-26

판단만 하는 모델,
Jev

Jev는 글을 쓰지 않는 모델입니다. 문서와 정책을 주고 "이것은 무엇인가, 그런가, 어느 정도인가"를 물으면 값과 확률을 돌려줍니다. 싸고 빠르고 타입이 맞는다는 것과, 그 판단이 내 업무에서 맞는다는 것은 별개의 문제입니다. 이 페이지는 그 간격을 어떻게 재고 어디까지 맡길지에 대한 기록입니다.

01 · Summary30초 요약

긴 글을 읽기 전에 알아야 할 세 가지.

무엇인가
생성이 아니라 판단
예/아니오(Noul), 선택(Choice), 단계(Score) 세 가지만 답합니다. 입력 $0.042/M tokens, 출력 요금 무료, 한 호출 0.5초대. 검색도, 계산도, 날짜 비교도, 권한 결정도 하지 않습니다.
어디에 쓰나
제안은 Jev, 실행은 코드와 사람
코드·규칙 / Jev / 생성 LLM / 사람의 4층 프레임으로 일을 나눕니다. 병합, 삭제, 발행, 게시처럼 되돌리기 어려운 행동은 Jev 성능과 무관하게 사람이 합니다.
첫 실측
341회
오류 0, $0.031, p50 0.52초. 검증자 과제는 confidence ≥0.7 구간에서 기존 판정을 97.4% 재현했고, 87개 분류 과제는 51.4%에 그쳤습니다. 판정은 PROPOSE 유지.
09-26 업데이트. 지식 입력과 검색을 세 라운드 3,560회 호출($0.35)로 다시 쟀습니다. 가장 강한 결과는 검색 후보 고르기(처음 보는 한국어 질문 44/49, 후보 목록 1위 16/49)이고, frontmatter 규칙표를 먼저 쓰자는 가설은 새 폴더에서 뒤집혔습니다. 판정은 그대로 PROPOSE입니다. 09-26 실측 보기
이 페이지의 결론은 한 문장입니다. Jev는 판단 부품이지 실행 주체가 아닙니다. 좋은 결과가 바꾸는 것은 도입 여부가 아니라, 제안이 사람에게 보이는 범위와 검토 순서뿐입니다.

02 · Glossary핵심 용어 10개

Jev 문서와 이 페이지에 반복해서 나오는 말입니다. 요청에 들어가는 것 4개, 답의 형태 3개, 돌아오는 것 1개, 우리가 덧붙이는 운영 장치 2개로 나눴습니다. 각 카드 오른쪽 위 표시는 그 일을 누가 맡는지(4층 프레임 기준)입니다.

요청에 들어가는 것 · Request
State판단 재료코드가 조립
Jev가 읽고 판단할 근거 전부입니다. 문서, 기록, 정책, 후보 목록을 문자열·JSON·배열로 넣습니다.
예: 노트의 제목 + description + 태그 + 본문 앞 1,200자. 한 요청의 모든 질문이 같은 state를 공유합니다.
텍스트 전용입니다. 이미지는 설명문으로, 게임 화면은 좌표 JSON으로 바꿔 넣습니다. 요청 전체 64k, 질문 하나당 32k tokens. 무관한 정보가 많을수록 정확도가 떨어지므로(약점 5) 코드가 먼저 줄입니다.
Questions판단 목록사람이 설계
"무엇을 판단할지"를 이름 붙여 묶은 목록입니다. 한 요청에 여러 개를 넣을 수 있고, 각 질문은 독립적으로 평가됩니다.
예: {"cmds": {...}, "is_owner": {...}, "specific": {...}} 세 질문을 한 번에. 키 이름(cmds)은 추론에 쓰이지 않는 라벨일 뿐입니다.
독립 평가라서 질문끼리의 확률이 논리적으로 맞물린다는 보장이 없습니다(약점 8). 여러 질문의 확률을 더하거나 곱해 새 지표를 만들지 않습니다.
Instructions질문 문장사람이 설계
각 질문의 본문입니다. Jev는 이 문장을 문자 그대로 읽습니다(약점 1).
좋은 예: "본문에 소유자 본인의 원칙 진술이 한 문장 이상 있는가?" 나쁜 예: "이 노트는 가치가 있는가?" 앞은 관찰 가능하고, 뒤는 의도를 복원해야 합니다.
이중 부정, "예외의 예외", 여러 판단을 한 문장에 묶는 것은 금지. 문구는 고정한 뒤 바꾸면 임계값을 다시 잡습니다.
Criteria답의 공간사람이 설계
허용되는 답의 목록과 그 뜻입니다. 프리미티브마다 모양이 다릅니다. Noul은 선택({true, false} 설명), Choice는 필수(선택지 목록, 최대 255개), Score는 필수(순서 있는 2~10단계 배열).
조직 정책은 여기에 씁니다. 예: "외부 소스 요약이 아닌 본인 해석은 주제와 무관하게 220". 실측에서 이 정의가 빠지자 220 재현율이 0.52로 떨어졌습니다.
"Zero hallucinations"는 이 목록 밖의 답을 내지 않는다는 뜻(schema matching)이지, 목록 안에서 맞는 답을 고른다는 뜻이 아닙니다.
답의 형태 · Primitives

같은 노트 한 건을 세 프리미티브로 물었을 때 돌아온 실제 값(2026-09-24 smoke 호출)으로 그렸습니다.

Noul예 / 아니오
"소유자의 원칙 진술인가?" 에 0~1 사이 값 하나를 돌려줍니다.
noul = 0.91 · 우리가 정한 임계값 0.8
임계값 0.8
0 · 아니오0.91예 · 1
"is_owner": { "noul": 0.91 }
confidence 필드가 없습니다. 그래서 임계값은 noul 값 자체에 겁니다. 0.30을 "부정 0.70"으로 뒤집어 읽지 않습니다(약점 8). 쓰임: 광고인가, 공지인가, 남길 기록인가 같은 필터와 게이트.
Choice여럿 중 하나
"이 노트가 속한 서브카테고리는?" 에 하나의 선택과 선택지별 확률을 돌려줍니다.
confidence 0.48 · 확률 합 1.00
907 Product & Eng.0.61
720 Music0.34
hold (보류)0.05
620 Generative AI0.00
"cmds": { "choice": "907 …", "probabilities": {…}, "confidence": 0.48 }
선택지는 최대 255개. 에이전트가 다음 행동을 고르는 데 가장 많이 쓰입니다(사례 카드 참고). 1등이 0.61이어도 confidence가 0.48이면 사람에게 넘깁니다.
Score순서 있는 단계
"얼마나 구체적인가?" 에 단계 사이의 위치를 확률 가중 평균으로 돌려줍니다.
3단계 (0 · 1 · 2) · confidence 0.80
0 주장만
1 근거 언급
2 기준선
score 1.86
"specific": { "score": 1.86, "legend": […], "confidence": 0.80 }
1.86은 "1.86점짜리 물건"이 아니라 2단계 쪽에 확률이 몰렸다는 순서 정보입니다. 단계는 2~10개. 외부 재계산에서 셋 중 보정이 가장 나빠(44.67%) 이 페이지의 설계에선 관찰 전용입니다.
돌아오는 것 · Response
Answersprobabilities · confidence · model · usageJev가 반환
질문 키별 결과입니다. probabilities는 선택지별 확률(합 1), confidence는 그 분포에서 계산한 요약 통계입니다. 응답 바깥의 model은 실제로 실행된 버전, usage는 토큰 수입니다.
확률(모델 출력), confidence(제품이 정의한 요약), 보정(실제 정답 빈도와의 일치), 신뢰구간(표본의 불확실성)은 네 가지 다른 것입니다.
confidence가 믿을 만한지는 과제마다 다릅니다. 실측에서 채점 재현은 ≥0.7 구간 97.4%, 분류는 같은 구간 61.5%였습니다. 임계값을 과제 사이에 복사하지 않습니다.
우리가 덧붙이는 운영 장치 · Ops
Gate · Hold임계값과 보류코드가 적용
Jev 답을 받은 뒤 코드가 내리는 분기입니다. 임계값을 넘으면 제안으로 표시, 못 넘으면 보류(hold)로 사람에게 보냅니다.
Jev는 스스로 잘 보류하지 않습니다. 87개 분류에서 정답률 51%인데 hold를 고른 건 4.6%뿐이었습니다. 그래서 hold는 선택지에 넣고, 동시에 코드가 "최대 확률 < 0.35면 hold"처럼 강제합니다.
실패 방향을 먼저 정합니다. 노출·발행처럼 틀리면 곤란한 일은 fail-closed(막음), 나머지는 fail-open(코드 규칙으로 퇴행).
Shadow log병렬 기록코드 + 사람
Jev 제안을 실제로 반영하지 않고, 사람 판정 옆에 같은 행으로 기록하는 로그입니다. 임계값은 이 기록 위에서만 잡습니다.
필드: jevSuggestion · jevProbabilities · jevModel · 사람 골드 라벨. 사람은 Jev 답을 보기 전에 판정합니다.
shadow 로그는 검색 인덱스 밖에 둡니다. 안에 두면 다음 검색이 Jev의 과거 답을 근거처럼 다시 끌어옵니다.

03 · Workflow한 번의 판단이 흐르는 길

위 용어들이 실제로 어떤 순서로 이어지는지입니다. 카드 번호 순서대로 읽고, 가운데 강조된 한 칸만 Jev입니다. 나머지는 코드와 사람이 맡습니다.

표시: 코드 결정론적 처리사람 설계·승인Jev 판단 1회LLM 필요할 때만 생성
코드
원문 수집
노트, 메일, 댓글, DOM, 게임 상태를 모읍니다. 해시로 바뀐 것만 고릅니다. 날짜·개수 계산도 여기서 끝냅니다.
코드
State 조립
필요한 필드만 남겨 텍스트로. 반출 금지 경로는 제외, 지시문처럼 보이는 외부 문장은 데이터로 격리.
사람 · 1회 고정
Questions 설계
질문마다 프리미티브 선택 + instructions + criteria(+ hold). 결과를 보기 전에 목표 문장과 함께 잠급니다.
Jev
POST /v1/systemone
state + questions 한 요청. 0.5초대, 입력 $0.042/M tokens. 오류는 429·529만 재시도.
Jev → 코드
Answers 받기
질문별 choice·noul·score, probabilities, confidence. 응답의 model을 매 호출 기록.
코드
Gate
과제별로 잡은 임계값, hold 강제, fail-open / fail-closed. 여기서 "제안 표시"와 "사람 검토 큐"로 갈립니다.
사람
검토 · 승인
병합, 삭제, 발행, 노출, 과금처럼 되돌리기 어려운 일은 항상 여기서. 문장이 필요하면 LLM이 초안을 쓰고 사람이 고릅니다.
코드 + 사람
Shadow log
제안과 사람 판정을 같은 행에. 쌓이면 ⑥의 임계값을 다시 잡고, 실패 사례로 ③의 criteria를 고칩니다.
되돌아가는 화살표 두 개. ⑧ → ⑥ 임계값 재보정(같은 과제 안에서만), ⑧ → ③ criteria 수정(수정하면 임계값도 새로). 프리미티브, 문구, 모델 버전 중 하나라도 바뀌면 이 고리를 처음부터 다시 돕니다.

노트 한 건으로 따라가 보기

위 Choice·Noul·Score 카드에 쓴 실제 smoke 호출이 이 흐름을 어떻게 지나갔는지입니다. 임계값 0.7과 0.8은 설명용 예시이며 운영 값이 아닙니다.

① ② State코드
영구 노트 1건의 제목, description, tags, 본문 앞 1,200자. 인물·회의 경로가 아니라 반출 가능. 603 input tokens.
③ Questions사람
cmds Choice(서브카테고리 + hold) · is_owner Noul · specific Score 3단계. 세 질문을 한 요청에.
④ ⑤ AnswersJev · 0.5초
cmds 907 (0.61) / 720 (0.34), confidence 0.48 · is_owner noul 0.91 · specific score 1.86, confidence 0.80 · model jev-1.13.0.
⑥ Gate코드
사람 큐cmds confidence 0.48 < 0.7 → 분류는 사람에게. 2등 720이 0.34라 "두 후보 중 무엇?" 형태로 보여 줌.
제안 표시is_owner 0.91 ≥ 0.8 → "본인 진술 있음" 배지만. 파일은 건드리지 않음.
관찰만specific Score는 로그에만. 노출 판단에 쓰지 않음.
⑦ 승인사람
사람이 분류를 확정하고 frontmatter를 직접 고칩니다. Jev는 어떤 파일도 쓰지 않았습니다.
⑧ Shadow log코드
제안 907 · 사람 확정값 · 확률 전체 · 모델 버전을 한 행에. 이런 행이 과제당 100건 쌓이면 0.7이라는 컷을 실제 값으로 바꿉니다.
이 흐름에서 Jev가 맡은 건 ④ 한 칸입니다. 좋은 사례일수록 이 비율이 같습니다. 아래 "사람들이 만든 것" 카드들도 거의 전부 수집·계산·실행은 코드가 하고, Jev는 한 번의 선택만 합니다.

04 · WhatJev란 무엇인가

TypeSafe가 2026-09-15 early access로 공개한 System One 모델. 회사 표현 그대로 "not trained to generate text"입니다.

학습 목표가 사람이 좋아할 답변이 아니라 소프트웨어가 바로 쓸 결정과 확률입니다. 새 모델 구조, 병렬 sampler, 보정된 결정을 위한 강화학습(RLCD)을 결합했다고 설명하지만 가중치, 파라미터 수, 학습 데이터는 공개되지 않았습니다. 공개된 것은 HTTP 계약, SDK, cookbook, 일부 평가 자료입니다. 공개 SDK가 있다는 것과 모델이 공개됐다는 것을 섞지 않습니다.

세 프리미티브

그림으로 먼저 보려면 핵심 용어의 카드를 보십시오. 여기서는 스펙만 정리합니다. 입력은 state(문서, 기록, 정책 — 문자열·JSON·배열, 텍스트 전용)와 questions(무엇을 판단할지와 가능한 답)입니다. 한 요청에 질문 여러 개를 묶을 수 있고, 각 질문은 같은 state를 공유하되 독립적으로 평가됩니다.

프리미티브묻는 것돌아오는 것한도
Noul예 / 아니오noul 0~1. confidence 필드 없음선택적 criteria {true, false}
Choice정해 둔 선택지 중 하나choice, 선택지별 probabilities(합 1), confidence최대 255개 선택지, criteria 필수
Score순서 있는 단계 중 어디쯤score(확률 가중, 단계 사이 값 가능), legend, probabilities, confidence2~10 단계, criteria는 순서 배열

셋 중 어느 것도 문장을 만들지 않고, 선택지에 없는 답을 내지 않으며, 질문 간 확률이 논리적으로 맞물린다는 보장이 없습니다.

API 형태

# POST https://api.typesafe.ai/v1/systemone
# Authorization: Bearer <KEY>
{
  "model": "jev-latest",
  "state": "노트 제목, description, tags, 본문 앞 1,200자 …",
  "questions": {
    "cmds":       { "type": "choice", "instructions": "이 노트가 속한 서브카테고리는?",
                    "criteria": ["907 Product & Engineering", "720 Music", "620 Generative AI", "hold"] },
    "is_owner":   { "type": "noul",   "instructions": "소유자의 원칙 진술인가?" },
    "specific":   { "type": "score",  "instructions": "얼마나 구체적인가?",
                    "criteria": ["주장만", "근거 언급", "근거·기준선까지 명시"] }
  }
}

# 응답: model(실제 실행 버전), answers{cmds: {choice, probabilities, confidence}, …}, usage{input_tokens, output_tokens}
# 실측 예(smoke 1건): 907 0.61 / 720 0.34 / hold 0.05 / 620 0.00 · confidence 0.48 · noul 0.91 · score 1.86 (conf 0.80) · 603 in / 102 out · 0.5초

질문 키 이름은 추론에 쓰이지 않습니다. 오류는 401(인증), 422(필드 위반), 429(rate limit), 529(overloaded)이고 429·529만 지수 백오프합니다. 응답의 model은 실제 실행된 버전이며 09-24 실측 341건 전부 jev-1.13.0이었습니다.

가격, 한도, 언어

항목값 (공식 문서, 2026-09-24 확인)함의
가격입력 $0.042 / 1M tokens, 출력 요금 무료usage.output_tokens는 0이 아닙니다(실측 341호출에서 출력 242,547 tokens가 잡혔고 요금은 0). 무료인 것은 요금이지 계측이 아닙니다.
예산요청 전체 64k tokens(state + 모든 질문) 동시에 개별 판단 32k tokens(state + 가장 긴 질문)40,000 token 노트는 질문을 셋으로 쪼개도 개별 예산에 걸립니다. 답은 분할이 아니라 state 축소입니다.
Rate limit250,000 tokens/sec · 1,200 requests/min수요에 따라 예고 없이 바뀔 수 있다고 문서가 명시합니다.
모델 IDjev-1.13.0. 별칭 jev-latest·jev-preview가 같은 버전(release 2026-09-10)별칭은 바뀔 수 있으므로 응답 model을 매 호출 기록합니다.
언어"English is the primary training language and where accuracy is currently best."CJK를 처리하지만 성능이 낮고, 자체 콘텐츠로 시험하고 confidence를 관찰하라고 권고합니다.
튜닝고객별 fine-tuning·LoRA 없음도메인 조건은 state, instructions, criteria로 넣습니다.
confidenceprobabilities 분포에서 계산한 요약 통계확률(모델 출력), confidence(제품 정의 요약), 보정(실제 빈도와의 일치), 신뢰구간(표본 추정 불확실성)은 네 가지 다른 것입니다. Noul은 confidence가 없으니 noul 값 자체로 임계값을 잡습니다.

Jev가 아닌 것

"Zero hallucinations"는 schema matching 보장입니다. 회사도 "Our number is not empirical"이라고 씁니다. 허용된 타입 안에서 답한다는 뜻이지 의미가 맞다는 뜻이 아닙니다.

05 · FrameSystem One 판단과 4층 프레임

7모델 보고서가 합의한 배정표. 출발 원칙은 "에이전트 스택은 모델이 아니라 실행 주체와 권한 경계로 선택한다"이고, Jev는 판단을 제안할 뿐 실행 권한을 갖지 않습니다.

Layer 1

코드와 규칙

날짜·기간·창 비교, 개수, 합계와 평균, 정규식, 스키마, 권한과 인증, 쿼터 산술, 해시와 변경 감지, 임계값 적용, 재시도와 백오프, 상태 전이, 파일 이동
모호한 문장의 의미를 정규식으로 무리하게 확정
결정론적으로 계산되거나 불변식을 지켜야 하면 여기서 끝낸다
Layer 2

Jev

텍스트 하나 또는 쌍에 대한 단일 판단: Noul(예/아니오), Choice(255 이하), Score(2~10단계). 코드나 생성 모델이 만든 후보 중 고르기
생성, 검색, 시청각, 산술, 날짜, 다단 추론, 여러 판단을 한 질문에 묶기, 권한 결정과 실행
state에 근거가 있고 답 집합이 닫혀 있으며 사후 검증 가능한 정답이 있을 때 시험한다
Layer 3

생성형 LLM

후보 생성(분류 후보, 재작성, 기준 초안, 문항), 요약, 필드 추출, 비정형 전처리(STT 정리, 이미지 설명), 코멘터리, 브리핑
자기 산출물의 최종 검증, 출처 없는 사실 확정, 확률의 보정 선언
생성자와 검증자를 분리하고 생성 결과는 원문과 함께 보존한다
Layer 4

사람

정책 확정, 경계 사례 골드 라벨, 임계값 승인과 잠금, 되돌리기 어려운 행동(병합, 삭제, 승격, 발행, 발송, 노출, 과금)의 승인, 데이터 반출 승인
코드가 끝낸 계산을 눈대중으로 다시 하는 일, 로그 없는 직감 승인
원문과 실패 사례를 볼 수 있는 검토 화면을 제공한다

후보를 거르는 여섯 질문

어떤 일을 Jev에 맡길지 정할 때 순서대로 묻습니다. 하나라도 걸리면 그 층에서 끝냅니다.

코드로 결정론적으로 계산할 수 있는가
그렇다면 코드. 날짜, 개수, 해시, 권한은 여기서 끝납니다.
출력이 문장·코드·이미지·소리여야 하는가
그렇다면 생성 모델이나 사람. Jev는 값과 확률만 돌려줍니다.
한 질문에 판단이 하나이고 답이 닫혀 있으며 잘린 텍스트로 근거가 충분한가
여러 판단을 한 질문에 묶으면 약점 8(구조 불변식)에 걸립니다.
state를 32k 안에 관련 정보만으로 만들 수 있는가
32k 안에 들어간다는 사실이 정확도 유지를 뜻하지는 않습니다. 무관 정보는 코드가 먼저 제거합니다.
틀렸을 때 되돌릴 수 있는가
아니면 shadow 제안만. 노출·발행·삭제는 사람 승인 뒤에만.
이 데이터를 미국 호스팅 원격 API로 보내도 되는가
전송 경계입니다. 정책을 관찰 가능한 문장으로 criteria에 쓸 수 없으면 아예 묻지 않습니다.

06 · Jaggedness문서화된 약점 9종 → 설계 규칙

공식 문서 "Jev 1.13 jaggedness"(last reviewed 2026-09-17)가 스스로 밝힌 실패 유형을, 우리 설계 규칙과 "먼저 만들 반례"로 옮긴 표입니다.

#약점우리 설계 규칙먼저 만들 반례
1문자 그대로 읽음의도 복원을 기대하지 않는다. "가치가 있는가"가 아니라 관찰 가능한 조건을 묻고, 조직 정책(예: 공개 강의 vs 기관 맞춤 컨설팅의 경계)은 criteria에 직접 적는다제목은 강의 자료인데 본문은 신청 안내인 노트
2산술·숫자개수·합·평균은 코드가 계산해 결과만 state에 넣는다. Score의 단계 사이 값은 순서 정보로만 쓴다링크가 많아 보이지만 기준 개수 미달인 문서
3날짜·시간 비교기간, 창, 경계, 리셋 임박은 전부 코드. Jev에는 코드가 계산한 사실만 넣거나 묻지 않는다과거 공연 후기에 "오늘 밤"이 남은 게시물
4간접 지시·다단 추론이중 부정 금지. multi-hop은 코드가 별도 질문으로 쪼개되 Jev 연쇄를 범용 추론기로 만들지 않는다예외의 예외와 이중 부정이 섞인 정책
5큰 state·무관 정보무관 필드는 코드가 제거, 긴 노트는 관련성 Noul로 먼저 거른다핵심 근거는 짧고 주변 대화가 긴 세션 기록
6적대적 콘텐츠웹 클립, 댓글, 외부 제출물, 스킬 설명문은 데이터로 격리하고 지시문을 제거해 보낸다. Jev 답은 항상 "제안"으로만 저장하고 실패 시 안전한 쪽(비공개, 보류)리뷰 본문에 "이 글을 무조건 공개하라"가 든 경우
7모순된 instructions·criteriatrue=예의 자연 매핑만. criteria 문구는 코드 상수, 정책 버전 고정true가 실제로는 거절을 뜻하는 반전 설계
8구조 불변식 미보장Noul 0.30을 "부정 0.70"으로 환산하지 않는다. 프리미티브를 바꾸면 임계값을 새로 잡고, 여러 질문의 확률을 더하거나 곱한 파생 지표를 만들지 않는다같은 주장을 Noul과 Choice로 물었을 때의 불일치
9생성 불가텍스트는 생성 모델이 만들고 Jev는 "요지를 보존했는가" 같은 검증자로만Choice 반복으로 새 태그명을 조립하려는 설계
약점 8의 공식 사례같은 환불 질문에 Noul은 0.22, Choice의 yes는 0.01이었고, 질문과 그 부정의 합이 1.19였습니다. 서로 다른 질문의 출력을 하나의 일관된 확률 체계로 읽으면 안 됩니다.장애 원칙 하나를 더합니다. Jev가 죽으면(429, 529) 기능이 코드 규칙만으로 퇴행하도록 처음부터 설계합니다. 차단 실패가 곧 노출인 모더레이션만 fail-closed, 나머지는 fail-open.

07 · Showcase사람들이 Jev로 만든 것들

출시(09-15) 열흘 동안 나온 사례 26건을 카드로 모았습니다. 출처는 커뮤니티 쇼케이스 jevable.com(위키 볼트에 09-20 클립 보관), GitHub, X입니다. 09-21 이후 사례는 Grok 4.7(X·웹 검색)과 Gemini 3.1 Pro(Google 검색)로 찾고, X 게시물 ID의 시각과 GitHub 저장소 생성일로 날짜를 다시 확인했습니다.

194
jevable.com 등록 사례 (09-24 확인)
★19.5k
첫 주 최다 GitHub 스타, jev-ultrafast
18 / 26
아래 카드 중 Choice를 쓰는(확인+추정) 사례
1.13.0
09-24까지 새 모델 버전 없음 (우리 341호출도 동일)
카드 읽는 법. 위 띠는 날짜와 분야, NEW는 09-20 이후. 큰 숫자는 작성자가 밝힌 속도·비용·규모이고 우리가 재현하지 않았습니다. 아래 칩은 쓰인 프리미티브로, 실선은 README·문서에서 확인, 점선과 물음표는 설명을 보고 추정한 것, "미공개"는 알 수 없음입니다. 카드를 누르면 원문으로 갑니다.
NEW · 2026-09-24개발 도구·검증
jevmem — 기억할 줄만 고르기
98.5%66개 메시지 기준 · 약 0.3초 · 작성자 주장
Claude Code 프로젝트 기억을 레포 파일 하나로. 대화의 각 줄을 남길지 Jev가 판단합니다.
눈여겨볼 점 · 줄마다 예/아니오. 쓰는 건 에이전트, 고르는 건 Jev.
Noul@jetwaniavinash · X ↗
NEW · 2026-09-23데이터·검색
HN Jev Scores
5요인요인별 Score → 코드가 합산
Hacker News 글마다 관련성, 깊이, 지속성, 1차 출처 여부, 과장 정도 다섯 요인을 매겨 피드를 다시 정렬하는 크롬 확장.
눈여겨볼 점 · 가중치 합산과 정렬은 코드. HN 점수는 참고로만 state에 넣음.
Scoreqiyangdev · GitHub ↗
NEW · 2026-09-23에이전트·브라우저
Jev Browser Use
CLI · MCP
로그인된 크롬 세션에서 다음 브라우저 행동은 Jev가 고르고, Codex·Claude는 추론과 글쓰기만 맡습니다. CLI·MCP·확장 제공.
눈여겨볼 점 · 생성 모델과 판단 모델의 분업을 그대로 도구로 만든 사례.
ChoiceAuroraPixel · GitHub ↗
NEW · 2026-09-24생활·창작
Whose Fault Is It
잘못 비율
메신저 대화 내보내기를 올리면 이름을 가린 채 '누구 잘못인지'를 비율로 보여 주는 장난감.
눈여겨볼 점 · 재미용. 프리미티브는 공개되지 않았습니다.
프리미티브 미공개@vamostweb · 웹 ↗
NEW · 2026-09-22생활·창작
말하면 UI가 되는 텍스트 박스
TypeSafe 인용
원하는 화면을 적으면 텍스트 박스가 그 UI로 바뀝니다. TypeSafe 공식 계정이 인용해 소개했습니다.
눈여겨볼 점 · 허용된 컴포넌트 중 고르기 구조로 추정.
Choice@anishfn · X ↗
NEW · 2026-09-24데이터·검색
ECCV 연구자 500명 검색
500명작성자 주장
ECCV 2026 연구자 500명의 논문을 대상으로 복잡한 조건 질의. 작성자는 Claude로 돌린 결과와 같았다고 씁니다.
눈여겨볼 점 · 검색 후보는 외부, 조건 판정은 Jev. 코드는 비공개.
프리미티브 미공개@WeymanXie · X ↗
NEW · 2026-09-20게임·로봇
Codenames with Jev
jevable 최신
보드게임 코드네임을 Jev와 함께. "아주 빠르고 아주 싸서 게임 안에 깊이 넣을 수 있다"는 게 작성자의 요지.
눈여겨볼 점 · jevable 최신순 1위(09-24 확인).
프리미티브 미공개Hugo Montenegro · jevable ↗
NEW · 2026-09-20데이터·검색
Jev-Mem
연구 구현
에이전트 기억을 System One / Two로 나눈 연구 구현. 검색 예산 배분, 후보 점수, 증거를 더 찾을지 재평가를 Jev가 합니다.
눈여겨볼 점 · 벤치마크 표로 기존 메모리 방식과 비교(작성자 결과).
ScoreChoicelibingzheren · GitHub ↗
NEW · 2026-09-20데이터·검색
Jevflake
SQL 함수 3종
Snowflake 안에서 SQL 함수로 jev_noul, jev_choice, jev_score를 호출. dbt 패키지와 Terraform 모듈.
눈여겨볼 점 · 데이터 웨어하우스의 행 단위 판단을 SQL 한 줄로.
NoulChoiceScoreLuke Kranz · GitHub ↗
2026-09-17에이전트·브라우저
jev-ultrafast
7.1초 · $0.0039취리히→런던 항공권 검색 · ★19.5k
다음 브라우저 동작과 대상 DOM 요소를 한 호출에 고릅니다. 글자를 입력해야 할 때만 작은 LLM이 씁니다.
눈여겨볼 점 · '완료' 선택도 결과를 따로 검증해야 한다고 README가 명시.
Choicebrowser-use (Gregor Zunic) · GitHub ↗
2026-09-17개발 도구·검증
fast-jev-compaction
★6.6k요약이 아니라 선별
Claude Code의 컨텍스트 요약 대신, 도구 호출마다 남길지·자를지를 한 요청에 판단. 남긴 것은 원문 그대로입니다.
눈여겨볼 점 · 호출당 Noul 두 개(호출을 남길까, 결과를 남길까).
NoulTamara Tran · GitHub ↗
2026-09-17개발 도구·검증
jev-review
4단계★587
단계형 코드 리뷰: 위험 매트릭스 → 파일 프로필 → 근거 선택 → 메커니즘 분류, 로컬 대시보드 포함.
눈여겨볼 점 · 세 프리미티브를 단계마다 다르게 쓰는 교과서형 파이프라인.
NoulChoiceScoredevagrawal09 · GitHub ↗
2026-09-17에이전트·브라우저
typesafe-computer-use
$0.0002 / step작성자 주장 · ★939
macOS에서 화면을 OCR → 다음 행동을 Jev가 고름 → 클릭. 계획이 필요 없는 대부분의 단계를 싸게.
눈여겨볼 점 · 막힌 경우는 거의 '뜻이 같은 두 선택지' 때문이었다고 작성자가 기록.
ChoiceAaron Levin · GitHub ↗
2026-09-18데이터·검색
pg-jev
SQL 확장★329
PostgreSQL 확장. 자연어 조건으로 행을 거르고(Noul), 점수·선택 함수와 confidence 함수도 제공합니다.
눈여겨볼 점 · 임베딩 없이 WHERE 절에 판단을.
NoulScoreChoicerealZachi · GitHub ↗
2026-09-18에이전트·브라우저
TypeSafe AdBlock
배치 Noul
화면의 DOM 요소마다 '이것은 광고인가?'를 묻고 임계값을 넘으면 제거하는 크롬 확장.
눈여겨볼 점 · 후보 묶음을 한 요청에 Noul 여러 개로. 작성자 스스로 '진짜 광고 차단기 아님'.
NoulrealZachi · GitHub ↗
2026-09-17게임·로봇
jev-drone
2.5 Hz판단 주기
MuJoCo 속 카메라 드론. 전술 판단만 Jev: 기동(유지·좌·우·상승·제동·재탐색), 위험도, 목표 상실 여부.
눈여겨볼 점 · 한 루프에 Choice·Score·Noul을 각각 하나씩. 비행 제어는 코드.
ChoiceScoreNoulRomanSlack · GitHub ↗
2026-09-17에이전트·브라우저
jev-trader
블록당 1회★2.2k
Monad 블록(약 300ms)마다 MON-USDC 매수·매도 결정을 1회. 공개 데모의 기본값은 모의 실행(dry-run)입니다.
눈여겨볼 점 · 되돌리기 어려운 실행을 작성자가 스스로 막아 둔 점이 핵심.
ChoiceJarrod Watts · GitHub ↗
2026-09-19데이터·검색
이메일 63,000통 분류
2분 54초 · $0.98작성자 주장
63,045통을 카테고리로 분류. 작성자는 LLM으로 했다면 수백 달러였을 거라고 씁니다.
눈여겨볼 점 · 정확도 수치는 공개되지 않았습니다.
ChoiceNathan Wilbanks · jevable ↗
2026-09-19데이터·검색
Proq 건설 도면 분류
26장 · 2.9초$0.0052 · 작성자 주장
건축·토목 도면 세트를 자재 목록으로 바꾸는 파이프라인에서 도면 분류를 Jev로 교체.
눈여겨볼 점 · GPT-4.1·GPT-6 Astra 결과와 100% 일치했다고 작성자가 보고.
ChoiceTrinay Hari · jevable ↗
2026-09-19생활·창작
Higgsfield 모델 라우팅
모델 라우터
사용자의 프롬프트를 보고 이미지·영상 생성 모델 중 가장 맞는 것을 고릅니다.
눈여겨볼 점 · 생성은 다른 모델, 어느 모델에 보낼지만 Jev.
ChoiceHiggsfield AI · jevable ↗
2026-09-19개발 도구·검증
AI 글 slop 탐지기
검증자
Opus가 즐겨 쓰는 상투적 문장을 찾아 표시합니다.
눈여겨볼 점 · 생성 모델의 글을 판단 모델이 검사하는 Generator-Verifier 구조.
NoulChase Lean · jevable ↗
2026-09-19게임·로봇
Doom, 갈라지는 미래
병렬 시도
같은 체크포인트에서 여러 미래를 병렬로 시도하고 가장 좋은 쪽에서 이어갑니다. 동작은 Jev, 결과 검토와 다음 시도 조정은 LLM.
눈여겨볼 점 · 판단(빠름)과 반성(느림)의 2단 구조.
Choicetoks · jevable ↗
2026-09-20생활·창작
Drape 실시간 가상 착장
약 620ms한 번 $0.0011 · 작성자 주장
목소리로 원하는 스타일을 말하면 옷장에서 한 벌을 골라 바로 갈아입혀 보여 줍니다.
눈여겨볼 점 · 이미지 생성은 별도, 어떤 옷인지 고르기만 Jev.
ChoiceNailthy Tang · jevable ↗
2026-09-18개발 도구·검증
Pydantic AI 공식 통합
TypeSafeModel
기존 output_type의 필드 하나가 질문 하나가 되어 한 요청으로 나갑니다. 필드 설명이 instructions가 됩니다.
눈여겨볼 점 · 스키마를 이미 쓰는 팀은 코드 변경 거의 없이 시험 가능.
NoulChoiceScorePydantic · 공식 문서 ↗
2026-09-15게임·로봇
Doom 실시간 플레이
초당 ~10회팀 추정 시간당 약 $7
게임 상태를 구조화된 텍스트로 넣고 초당 약 10회 다음 동작을 고릅니다. 이미지가 아니라 state입니다.
눈여겨볼 점 · 출시 글의 대표 데모.
ChoiceTypeSafe (출시 데모) · 공식 블로그 ↗
2026-09-15게임·로봇
Wikiracing
255개Choice 선택지 한도
위키백과 문서에서 목표 문서로 가기 위해 다음 링크를 고릅니다. 선택지가 많아 Choice 255개 한도를 그대로 씁니다.
눈여겨볼 점 · 한도를 넘는 후보는 코드가 먼저 줄여야 한다는 걸 보여 주는 예.
ChoiceTypeSafe (출시 데모) · 공식 블로그 ↗

사례를 4층 프레임으로 읽으면

Choice = 행동 선택자
코드가 후보를 만들고, Jev가 하나 고르고, 코드가 실행
브라우저·데스크톱·게임·드론·트레이딩이 전부 이 모양입니다. 가능한 동작 목록(DOM 요소, 합법 수, 기동 6종)은 코드가 만들고 실행도 코드가 합니다. Jev 몫은 "다음 한 수"뿐입니다.
Noul = 필터와 게이트
한 요청에 후보 여러 개를 예/아니오로
광고 요소, 컨텍스트 압축, 기억할 줄, PR 위험도. 후보마다 Noul 하나씩을 묶어 한 번에 보내고, 임계값은 코드가 겁니다. 우리 계획의 발행 게이트·최신성 판별과 같은 구조입니다.
Score = 정렬 재료
점수가 아니라 순서 정보로
HN 피드와 스프레드시트는 요인별 Score를 받아 코드가 가중 합산해 정렬합니다. 노출·차단을 Score 하나에 거는 사례는 찾지 못했습니다.
우리가 가져올 것과 조심할 것잘 된 사례는 공통적으로 Jev를 한 칸에만 둡니다(위 흐름도의 ④). jev-trader가 공개 데모를 모의 실행으로 둔 것, jev-ultrafast가 "완료 선택도 따로 검증하라"고 적은 것이 사람 경계를 스스로 그은 예입니다.조심할 것: 속도와 비용 숫자는 넘치지만 정확도를 사람 라벨로 잰 사례는 거의 없습니다(Proq의 모델 간 일치, jevmem의 66건 정도). 다른 모델과 같다는 것은 맞다는 뜻이 아닙니다. 그래서 우리는 채점 재현 97.4%, 분류 51.4%를 직접 쟀고, 이 숫자가 사례들의 헤드라인을 대신할 수 없다는 점도 같이 적습니다.

공식 소식 (09-15 ~ 09-24)

09-15Jev 출시, early access. System One 모델과 jev-1.13.0. 같은 날 DCVC가 $40M Series Seed를 발표. 출시 글 ↗
09-16Vercel AI Gateway에 typesafe-ai/jev로 등록. 무료 프로모션은 09-25 종료 예정. 이후 Cloudflare Workers AI 등 게이트웨이로 확산(표기 컨텍스트 32,000).
09-18Pydantic AI 공식 문서에 TypeSafeModel. 문서 ↗
09-21대기자 명단 해제, 콘솔 개방, 가입 시 $5 크레딧. 가격은 그대로(입력 $0.042/M, 출력 무료). TypeSafe X ↗
09-22docs에 cookbook(entity alignment, rerank, parallel questions) 게시. 같은 날 부하로 신규 가입이 일시 중단됐다는 보고가 있으나 공식 공지는 확인하지 못했습니다. 기존 키는 동작(우리 09-24 호출 정상).
09-24모델 버전 변화 없음. 공개 문서와 우리 341호출 모두 jev-1.13.0. 해커톤 수상작 목록 같은 공식 발표도 찾지 못했습니다.

08 · Direction내 상황에 맞춘 방향

23행 포트폴리오 중 우선순위 상·중 항목을 압축했습니다. 비용은 전부 입력 tokens × $0.042 / 1,000,000이고 건수와 길이는 추정입니다. 고도화는 이미 있는 자산에 판단기를 얹는 것, 신규는 아직 코드가 없는 것입니다.

고도화 · 첫 적용
문서·주장 관계 판정 (공통 검증자)
Choice 4(지지/반박/근거 없음/보류). 인용문 존재는 문자열 검색, 관계만 Jev. 상태 갱신은 사람. 같은 검증자가 AKM 심사, 사실 확인, 시험 문항, 리뷰 윤문에 재사용됩니다.
고도화 · 첫 적용
AKM 수신함 증거 심사
Choice 4 × 25기준을 한 호출. 동의 플래그, 날짜, 점수 합, 보드 배포는 코드와 운영자. 제출당 약 $0.000735. 줄어드는 것은 비용이 아니라 25기준 증거를 읽는 검토 시간입니다.
고도화 · 조건부
시험 문항 검증
한 대학 교수팀의 시험 출제 프로젝트. 생성 모델 출제 → Jev 필드별 검사 → 교수 채택. 500문항 × 3회 $0.189. 교재의 외부 API 전송 허락 전에는 호출하지 않습니다.
고도화 · 두 번째 물결
스킬 라우팅 misfire 예방
Choice(후보 ≤10~20 + 해당 없음). 후보 축소는 description 매칭, Jev는 불일치 경고만. 라우팅 실패 원장이 이미 1행씩 쌓여 라벨 제작 비용이 0에 가깝습니다.
신규 · 선행
예산 카운터·서킷 브레이커
Jev 없음, 코드만. 누적 입력 2,000만 tokens에서 가상 429. 장애 시 코드 규칙 페일오버. 골드 라벨 필드를 같은 행에 두는 shadow 로그 스키마가 함께 갑니다.
고도화 · 상 → 보류
노트 → 서브카테고리 라우팅
Choice ×2(보류 포함). 실측 87-way 51.4%라 criteria 보강, 후보 압축, hold 강제 없이는 못 씁니다. 첫 적용에서 빼되 한국어 순서 민감도 표본으로 함께 돌립니다. 09-26: 정의를 보강하면 75.8%, 처음 보는 폴더에서 43.1%. top-3 제안으로만 씁니다. 결과
고도화 · 중
검색 후보 재정렬
Choice 3, 후보 30개 한 호출. BM25·벡터·HyDE·RRF는 검색 엔진이. 외부 실험에서 단독 개선은 +0.012에 그쳤고 결합만 유효했습니다. Score 보정이 나빠 Choice로 시작. 09-26: 우리 실측에서는 가장 강한 결과(처음 보는 질문 44/49, 목록 1위 16/49). 결과
신규 · 정책 확정 뒤 상
재즈 리뷰 모더레이션·완곡화 검증
대상별 Noul + 속성 Noul ×7 + Noul(요지 보존). 투표·별점·노출 매트릭스는 코드, 재작성은 생성 모델, 게시는 사람. fail-closed.
신규 · 설계 결정
10분 주기 최신성 파이프라인
Noul(공지인가) + Choice 5. 수집·해시·diff·날짜·"오늘 밤"은 코드, 변경된 텍스트만 Jev. 7편 전부가 독립적으로 도달한 유일한 설계이며 월 $54.43 기준선을 줄이는 단 하나의 레버.
고도화 · 중
발행 게이트
Noul ×3. 정규식이 1차, Jev는 의미적 노출만. fail-closed. 먼저 볼 실패는 공개 맥락에서 괜찮은 이름까지 과잉 차단하는 경우.
23행 전체의 월 비용을 더해도 큰 항목은 둘($12.6, $54.43)뿐이고 나머지 합은 $1 안팎입니다. 돈이 걸리는 곳은 호출이 아니라 설계 방식과 사람 검토 시간입니다.

먼저 돌릴 셋

선행: 예산 카운터와 shadow 로그 스키마를 코드로
누적 입력 tokens를 세어 2,000만에서 멈추고, jevSuggestion, jevProbabilities, jevModel과 사람 골드 필드를 같은 행에 둡니다. 골드 필드가 없으면 병렬 기록 규칙이 성립하지 않습니다.
AKM 수신함 증거 심사를 공통 검증자의 첫 적용으로
판단 형태가 검증자 과제(α)와 같고, 라벨이 운영자 판정과 재평가 이력에서 바로 나옵니다. α 실측의 ≥0.7 게이트(재현 97.4%, coverage 54%)를 그대로 이식할 수 있는 모양입니다.
시험 문항 검증은 조건부
교착의 원인은 Jev 부재가 아니라 라벨 부재. 교재 외부 전송 허락과 협업 방식이 정해지기 전에는 호출하지 않고, 포맷 통일과 마크다운 헤드 파일이 먼저입니다.
스킬 misfire 예방은 두 번째 물결
결과가 "불일치 경고"에 그쳐 실행권과 분리됩니다. 스킬 설명문 속 지시가 판정을 탈취할 수 있다는 주입 면의 경고는 유효합니다.

재즈 플랫폼·레슨 솔루션 설계 요약

파트너와의 대화에서 나온 인증 열람, 업보트 노출, 조언 코멘트 지연 열람은 채택된 규칙이 아니라 통제 방안 후보입니다. 공통 원칙 셋: 대상(공연장/뮤지션)에 따라 정책이 갈리므로 대상 판정이 첫 판단이되 게시 위치로 확정되면 묻지 않는다. 외부 텍스트의 노출 결정은 실패 시 비공개 또는 보류다. 실시간 오디오 경로에는 원격 판단 API를 두지 않는다.

설계Jev코드·DB생성 LLM불가 영역
부정 평가 노출관련성 Noul, 대상 Choice, 성격 Choice(칭찬/건설적 비판/거친 비판/인신공격/정보성/보류). 부정성과 공격성은 다른 질문원문·시각·대상·투표·인증·재작성본 분리 보존. 노출 매트릭스는 사람이 정하는 정책표거친 비판을 조언형 후보 2~3개로 재작성. 원문에 없는 칭찬·처방·사실 추가 금지투표 집계, 열람 권한, 조작 감지. 최종 게시는 사람
업보트만 노출없음. 표시 규칙투표 조건, 텍스트 노출, 별점 평균없음뮤지션이 비공개 지정한 데이터는 조건 충족해도 비공개
인증 사용자만 열람없음. Jev는 신원을 모름인증 플래그와 세션 권한없음권한 검사 실패 시 공개 불허. 의미 분류의 fail-open과 권한의 fail-closed를 같은 규칙으로 취급하지 않음
레이더 차트축별 Noul + 극성 Choice. 축 값을 Score로 매기지 않음. 한 질문에 육각형을 묻지 않음항목 ID·공개 플래그·긍정 비율·표본 수. 최소 표본 미만은 "표본 부족"없음평균, 비율, 공개 결정, 실제 연주 청취. 축 합산 리더보드 금지
가이드(미쉐린 모델)확정 기준에 대해 댓글이 증거를 지지하는지 Choice. AKM 구조와 같음기준별 언급 수, 도시별 차이, 등재 상태 전이없음등재·비등재 결정
평가 기준 추출기존 기준과 생성 후보의 Choice(동일/하위/새 기준/무관)수집, 중복 제거, URL 해시, 출처·시점, 언급 수기준 후보 문장 생성. "추출"은 생성이라 Jev 일이 아님웹 수집, 빈도 계산, 사실 확인
10분 최신성변경 텍스트에 한해 Noul, 필요 시 Choice 5스케줄러, 해시 비교, 시간대 정규화, "오늘 밤" 창 판정날짜·출연진·가격 구조화 추출"오늘 밤인가", "지금 갈 수 있는가"는 코드와 지도의 일
STT → 마디 정렬코드가 좁힌 후보 마디(±2마디, ≤10개) 중 Choice + 위치 미상오디오 캡처·시계 동기, 명시 참조 정규식, 악보 텍스트화, 교사 확인 뒤 기입STT 필러 제거, 직전 맥락 부착3ms 동기는 미디어 평면 영역. 실시간 확정은 1차 범위 밖
AI 레슨 노트문단별 태그 Choice + "실제 발화에 근거하는가" 검증. 후자가 판매 근거허용 태그 집합, 주차별 이력, 버전, 교사 수정 이력일별 레슨 노트 초안노트 생성, 화자 구분, 연주 평가. 학생 전사는 미성년 가능성으로 확인 전 전송 금지

거칠기를 Score로 둘지 순서 있는 Choice로 둘지가 실제 분기점이었습니다. 외부 재계산에서 Score만 44.67%(ECE 0.325)였고, 노출될 등급을 미검증 프리미티브에 걸 이유가 없습니다. Score는 PoC 3에서 관찰 전용입니다.

09 · Seven Models7모델 논리검증

같은 패킷(사실 원장, 논리 문항 10개, 설계 과제)을 일곱 모델에 독립적으로 주고, 정답 키와 위반 목록을 먼저 잠근 뒤 블라인드로 채점했습니다. 목적은 "누가 Jev를 가장 잘 이해하고 경계를 지키는가"입니다.

순위모델가중총점밴드논리 블록 (54)ΣP (10)유지된 위반
1Claude Opus 5.594.0A52.810없음 (ambiguous 2건 기록)
2GPT-6 Astra92.4A54.010없음
3Claude Fable 5.1 (이 페이지의 작성 모델)91.6A51.610V27 (D)
4Grok 4.791.5A54.010없음
5GPT-6 Sol91.4A52.79.5없음
6Gemini 3.8 Flash77.4B44.410V27, V28, 무표식 사실 4건+
7Gemini 3.1 Pro69.4C40.79.5V17, V27, V28, 무표식 1건

가중총점 = Σ(가중치 × 축점수 ÷ 10). 논리 블록 = L1 논리 정확성 26 + L2 사실 충실성 16 + L3 경계 판단 12. 밴드 A = 총점 85 이상 + 논리 46 이상 + Tier A 위반 0. V27 = Jev 판단만으로 노출 실행, V28 = 한 질문에 판단 여럿을 묶음.

논리 블록만 보면 순위가 다릅니다. Astra와 Grok 4.7이 54.0으로 공동 1위, Opus 5.5 52.8, Sol 52.7, Fable 5.1 51.6. 총점 1위 Opus가 논리 블록에서 3위인 이유는 "기준이 쌓이면 확률 구간별로 코드가 적용"이라는 표 셀 하나가 사람 승인 경계를 다시 열었기 때문입니다. Fable 5.1도 "임계값 확정 후 코드가 게시"라는 같은 결의 문장을 썼고 그 감점(V27)을 그대로 받았습니다. 채점에서 가장 자주 감점된 지점이 바로 그 셀입니다.

P1~P10 논리 문항 요약

문항내용7모델 평균
P1비용 산술 (묶음 $0.462 / 분리 $2.35 / 출력 무료)1.00
P264k와 32k 두 예산 (40,000 token 노트 불가)1.00
P3Noul confidence 부재, 자동 승격 금지1.00
P4Choice 255 한도, 87 서브카테고리1.00
P51 − 0.30 = 0.70 항등식 사용 가부 (Sol 0.5, Pro 0.5)0.86
P6날짜 / 개수 / 220 vs 210 배정1.00
P7Score 44.67% 실험 조건과 함의1.00
P8250초 vs 44초, 요청 병목, 30,000호출 6배1.00
P9재즈 파이프라인 7판단 배정1.00
P1028,800회, $1.8144/일, $54.43/월, 변경 감지1.00
ΣP열 문항 중 점수가 갈린 것은 P5 하나69 / 70

P5가 노린 함정은 "산술적으로는 맞아 보이는 항등식"이었습니다. 같은 Noul 반환값 안에서 1 − 0.30을 '아니오'의 여분으로 설명하는 것과, 별도 부정 질문의 출력이 0.70이라고 쓰는 것은 다른 주장입니다. P5가 변별한 것은 산술 능력이 아니라 닫힌 답을 열어 두는 습관입니다. 정직하게 적으면 열 문항의 변별력은 낮았고(69/70), 순위를 가른 것은 포트폴리오와 재즈 설계에서 자기가 선언한 경계를 스스로 지켰는가였습니다.

비용 가중 요약

채점 10축 어디에도 비용은 없습니다. 그래서 별도로 세운 축입니다. 이 run의 현금 청구액은 $0(전부 구독 쿼터)이고, 아래 금액은 각 모델의 공식 단가로 토큰 사용량을 환산한 동등 비교 비용입니다. 같은 패킷 프롬프트 1회 입력과 실제 청구된 출력 토큰만 곱했습니다.

모델동등 비교 비용총점총점/$9:1 합성9:1 순위7:3 순위
GPT-6 Sol$0.173991.45260.90411
Grok 4.7$0.449491.52040.87023
Claude Opus 5.5$1.368494.0690.85136
GPT-6 Astra$1.099092.4840.84545
Claude Fable 5.1$1.568891.6580.82457
Gemini 3.8 Flash$0.105577.47340.79762
Gemini 3.1 Pro$0.188169.43690.70374

품질 Q = 총점 ÷ 100. 비용점수 C = 1 − log10(비용 ÷ 최저) ÷ log10(최고 ÷ 최저). 최저 Flash $0.1055 → C = 1, 최고 Fable $1.5688 → C = 0. 합성 = 0.9Q + 0.1C(9:1) 또는 0.7Q + 0.3C(7:3).

10 · Measurement첫 실측 (2026-09-24 오후)

smoke 1건, α 채점 재현 70건, β 서브카테고리 분류 109건, triage 5통. 볼트 파일은 하나도 수정하지 않은 shadow 실행입니다.

호출
341
오류 0, 재시도 0. 전부 jev-1.13.0. 벽시계 3분 42초.
비용
$0.031
입력 736,861 tokens × $0.042/M. 상한($0.84 = 2,000만 tokens) 대비 3.7%.
지연
0.52초
호출당 p50. p95 0.632초. 출력 242,547 tokens는 usage에 잡히지만 요금 0.

α · 채점 재현 (Score, 70건)

7모델 보고서의 논리 문항 답안 7편 × 10문항을 state로 주고, 문항당 Score 3단계 하나씩 10개를 한 요청에 묶었습니다. 정답은 채점자가 이미 매긴 0 / 0.5 / 1 점수입니다.

지표값읽는 법
exact 일치72.9% (51/70)Jev는 채점자보다 체계적으로 엄격합니다. 일곱 편 전부 Jev 합이 채점자 합 이하.
MAE (0~1 척도)0.168접은 값 기준 0.136
confidence ≥0.797.4% (n=38, 전체의 54%)절반을 받아들이고 나머지를 사람에게 넘기면 채점자 판정을 97% 재현
confidence 0.4~0.742.1% (n=19)동전 던지기. 참고값으로도 쓰지 않음
confidence <0.446.2% (n=13)같음
질문 역순 대비 답 불변98.6%순서 안정성 양호
문항별 불일치P3 7/7P3은 "Noul에 confidence가 없다"를 묻는 문항이라 답안에 confidence라는 단어가 반복됨. 문자 그대로 읽어 오독했다는 가설, 미검증

β · CMDS 서브카테고리 분류 (Choice 87 + hold, 109건)

최상위 영구 노트 109건의 제목, description, 태그, 본문 앞 1,200자를 state로 주고, 87개 서브카테고리 이름 + hold 중 하나를 고르게 했습니다. criteria는 이름만. 정답은 각 노트에 이미 적혀 있던 분류값입니다.

지표값읽는 법
top-1 (87-way)51.4% (56/109)선택지 역순 49.5%
top-368.8%
macro-F1 (support ≥3)0.493
hold율4.6% (5건)정확도 51%짜리 과제에 비해 너무 낮음. Jev는 근거가 약해도 답을 고름. hold 강제는 코드가 소유
순서 안정성73.4% (29/109 뒤집힘)순서 민감도 26.6%는 외부 한국어 수치 13%보다 높음. 87개 선택지가 긴 프롬프트를 만듦
top-9 (상위 카테고리만)21.1%87-way보다 훨씬 나쁨. 상위 이름은 추상적이고 서브카테고리 이름은 주제 단서를 품음. "9대분류 고정" 전제 철회
confidence ≥0.761.5% (n=13)α와 달리 게이트가 작동하지 않음. 0.4~0.7 구간(66.7%)보다 낮음
체계적 편향220 recall 0.521"내 통찰"이라는 소유자 정의 메타 클래스(정답 48/109)를 주제 클래스로 보냄. precision은 0.893. 이름만 준 criteria가 정책 미전달 지점에서 실패

triage · 가상 메일 5통

kind(Choice 7), urgent(Noul), fit(Score 0~2) 세 질문을 한 요청에 물었습니다. 다섯 통 모두 kind confidence ≥0.96이라 설계해 둔 "저확신 에스컬레이션" 분기가 한 번도 발동하지 않았습니다. 일부러 애매하게 쓴 메일도 Jev에게는 애매하지 않았습니다. 정책 실험을 하려면 두 요청을 한 메일에 섞거나 실제 마스킹 메일을 넣어야 합니다. 같은 스크립트를 다시 돌리면 값이 소수점 둘째 자리에서 흔들립니다.

정직한 경계오늘 실행은 계획한 PoC의 실행이 아니라 축소판입니다.표본이 500건이 아니라 179건이고, 설계 / 임계값 / 최종 분할이 없으며, 하루 한 모델 버전으로만 돌렸고, 정답이 새로 만든 사람 라벨이 아닙니다. α의 정답은 채점자 점수, β의 정답은 기존 분류 메타데이터입니다. 그래서 이 수치는 "얼마나 맞는가"가 아니라 "이미 있는 판단을 얼마나 재현하는가"입니다. Brier / ECE는 미계산이고 4변형 중 순서 변형만 돌렸습니다.

실측이 가르치는 것은 셋입니다. 첫째, 검증자 과제에서 confidence 게이트가 실제로 작동합니다. 둘째, 분류 과제에서 같은 게이트는 작동하지 않습니다. 보정이 과제마다 다르다는 것이 확인됐으니 컷을 과제 간에 복사하지 않습니다. 셋째, 실패 지점은 "정책 미전달"과 "hold 미발동"이고 둘 다 Jev 성능이 아니라 criteria와 코드 정책의 문제라, 판정(PROPOSE)을 뒤집을 이유가 되지 않습니다.

11 · Measurement II09-26 실측: 지식 입력과 검색

노트를 볼트에 넣을 때(어느 분류, 어느 볼트, 어느 프로젝트로)와 볼트에서 노트를 찾을 때 Jev가 어디까지 맞는지, 세 라운드 3,560회 호출로 쟀습니다. 2026-09-26 새벽 실행이고, 볼트에는 한 글자도 쓰지 않은 shadow 실험입니다.

Jev는 검색 후보를 고를 때 가장 강했다. 검색 엔진이 뽑은 후보 가운데 하나를 고르게 하자, 한 번도 쓰지 않은 한국어 질문 49개 중 44개에서 찾던 노트를 골랐습니다. 같은 후보 목록의 1위를 그대로 믿었다면 16개였습니다. 반대로 노트를 87개 분류에 넣는 일은 처음 보는 폴더에서 43%에 그쳤고, 2라운드에서 가장 강했던 규칙표는 새 폴더에서 무너졌습니다.

세 라운드로 잰 방법

1라운드: 연습 표본으로 문안을 다듬는다 (1,557회)
첫 호출 전에 절차 문서를 고정하고 해시를 남겼습니다(사전 등록). 설계용과 임계값용 표본만 돌리고, 최종 시험 표본은 봉인해 두었습니다.
2라운드: 봉인한 최종 시험을 한 번만 연다 (1,726회)
임계값은 임계값 표본에서 한 번만 고르고 기록했습니다. 최종 표본에는 조건마다 한 번만 보냈고, 결과를 본 뒤 다시 보낸 호출은 0건입니다.
3라운드: 결과를 보고 세운 가설은 새 자료로 다시 잰다 (277회)
2라운드 결과를 본 뒤 생긴 가설 두 개(규칙 우선 라우팅, 후보 고르기와 절단 0.3)는 같은 자료로는 검증할 수 없습니다. 앞 두 라운드가 어떤 역할로든 쓴 노트 1,130개를 빼고, 한 번도 쓰지 않은 노트로 다시 등록해 쟀습니다. 방향 예측 13개를 미리 적었고 모두 방향이 맞았습니다.

모든 조건에 API를 부르지 않는 코드 기준선(가장 흔한 분류, frontmatter 규칙표, 검색 1위)을 같은 항목에 붙였습니다. 결정은 Jev의 응답 문구가 아니라 코드가 확률값으로 내렸고, 1위와 2위가 같거나 1위가 "보류"면 답하지 않았습니다. 합격선은 만들지 않았고, 2라운드부터는 등록 뒤 파일이 바뀌면 실행 도구가 호출을 거부합니다.

결과 한 표

과제조건결과 (n)같은 항목의 기준선판단
검색: 후보 하나 고르기3라운드, 처음 보는 위키 표적, 한국어 질문44/49 (89.8%)후보 목록 1위 16/49 (32.7%)제안에 쓴다
2라운드 최종, 한국어 질문45/55 (81.8%)목록 1위 30/55, 로컬 qmd query 1위 26/55세 라운드 모두 같은 방향
검색: 남길 후보 거르기3라운드, Noul 절단 0.3 (등록 전 고정)44/45 유지코드로 상위 3개만 남기면 25/45후보 평균 17.55개 → 2.39개 (86.4% 축소)
같은 표본, 절단 0.539/45 유지절단은 과제마다 따로 고른다
입력: CMDS 87 서브카테고리2라운드 최종, 분류 이름만24/120 (20.0%)가장 흔한 분류 66/120top-3 제안만
역순 재질문이 갈리면 보류, 사람이 최종 선택
2라운드 최종, 87개 전부 정의(빈 정의 14개 초안) + "형식이 분명하면 형식 분류 먼저" 지시91/120 (75.8%)
top-3 112/120
frontmatter type 규칙표 101/120
3라운드, 같은 정의와 지시, 처음 보는 폴더28/65 (43.1%)
top-3 42/65
규칙표 1/65 (적용된 27건 중 1건)
입력: 활성 프로젝트 6개2라운드 최종, 프로젝트 이름만69/80 (86.3%)가장 흔한 프로젝트 30/80README 설명을 처음부터
호출당 +334 tokens
2라운드 최종, 이름 + README 설명 200자78/80 (97.5%)
입력: 메인 볼트냐 위키냐1라운드 두 표본, 2라운드 최종80.0%, 75.0% → 51/80 (63.8%)반반 50%사람 골드 대기열만
순서에 따라 답이 바뀐 7건부터

1라운드 프로젝트 라우팅 이름만은 90.0%, 96.7%. 위키 안 폴더 4종 분류는 2라운드 최종 39/40으로 포화입니다. 비율은 모두 조건마다 한 번 실행한 값입니다.

정직한 경계이 수치는 "얼마나 맞는가"가 아니라 "이미 있는 판단을 얼마나 재현하는가"입니다.정답은 사람이 새로 붙인 라벨이 아니라 볼트에 이미 적힌 분류값과 위치이고, 불일치 일부는 볼트 쪽이 틀렸을 수 있습니다. 한 모델 버전, 하루, 조건마다 한 번 실행이라 결정성은 모릅니다. 한국어 질문은 다른 생성 모델이 노트 설명을 보고 만든 것이라 실제 사용자 질문이 아니고, 3라운드 검색 표적은 모두 위키 페이지입니다. n이 45~120이라 구간이 넓습니다(절단 0.3의 유지율 97.8%는 95% 구간 하한이 88.4%). 표적이 후보에 없을 때 "해당 없음"을 고른 비율은 2라운드 0/5, 3라운드 0/4라 Jev는 아직 "찾는 노트가 없다"를 말하지 못합니다. 검토 시간 절감은 재지 않았습니다.

검색 파이프라인: 누가 무엇을 하나

코드가 후보를 만든다
질문을 음절 구문 BM25(qmd의 FTS5 색인)와 qmd 벡터 상위 10개로 찾고, 두 목록을 RRF로 합친 뒤 금지 경로를 걸러 냅니다.
Jev가 하나를 고른다
후보마다 제목과 200자 이내 설명만 보내고, 후보 목록 + "해당 없음" 중 하나를 Choice로 묻습니다. 질문 1,000개당 약 $0.07.
코드가 순서를 뒤집어 한 번 더 묻는다
두 답이 다르거나 1위와 2위 확률이 같으면 보류합니다. 3라운드에서 이 규칙을 걸면 49개 중 46개에 답했고 그중 43개가 맞았습니다(93.5%). 3개는 보류.
보류나 오류면 원래 목록을 그대로 보인다
제안은 실패 시 열어 둡니다(fail-open). 제안이 없을 뿐 검색은 멈추지 않습니다. 남길 후보를 줄일 때는 후보마다 "이 질문에 필요한가"를 Noul로 묻고 0.3을 넘는 것만 남깁니다.

가장 큰 이득은 Jev 밖에서 먼저 났습니다. qmd의 FTS5 색인은 한글을 음절마다 띄어 저장합니다. "기록"*으로 찾으면 0건, "기 록"으로 찾으면 2,726건(09-26 07:30 재확인)입니다. 한국어 단어를 음절 구문으로 바꾸자 2라운드 후보에 표적이 든 비율이 46/55에서 50/55로, 목록 1위가 21/55에서 30/55로 올랐습니다. 끝단 정확도는 후보 재현율 × Jev 조건부 선택으로 정확히 나뉘고(3라운드 45/49 × 44/45 = 44/49), 네 표본 모두 조건부 선택이 90% 이상이라 남은 손실은 대부분 후보층에 있습니다. Jev를 고치기 전에 후보를 만드는 층부터 고칩니다.

뒤집힌 결론: 규칙표는 폴더를 넘지 않았다

2라운드에서는 Jev를 부르지 않는 frontmatter type 규칙표("type이 X면 분류 Y")가 101/120으로 모든 Jev 조건 이상이었습니다. 그래서 "규칙이 먼저 끝내고 규칙 밖 노트에만 Jev"를 다음 가설로 등록했습니다. 한 번도 쓰지 않은 폴더 세 곳의 65건에서 규칙표는 적용된 27건 중 1건만 맞혔고, 규칙 우선 조합은 20/65로 Jev 단독 28/65보다 낮았습니다. 규칙표는 그것을 만든 폴더와 type 분포의 산출물이었습니다.

Jev 쪽도 새 폴더에서 낮았습니다. 2라운드 75.8%의 대부분은 형식이 뚜렷한 분류에서 나왔습니다(이름만 줬을 때 대비 발행한 글 802는 0/27 → 26/27, 용어 104는 9/66 → 54/66). 반면 주제와 도구 분류에서는 두 라운드 모두 40% 안팎입니다. confidence 0.7 이상 구간도 3라운드에서 16/33이라 87분류에서 확률로 자동 승인하지 않습니다. 그래서 규칙 우선을 기본값으로 두지 않습니다. 폴더별 표본에서 정밀도를 확인한 규칙 행만 먼저 쓰고, 나머지는 Jev top-3 제안을 사람이 고르며, 사람의 최종 선택을 Jev 제안 옆에 병렬 기록합니다(shadow log).

모델 보고서 일곱 편과 대조하면 검색 쪽 설계(후보는 검색 엔진이, 하나 고르기는 Jev가, 끝단을 두 층으로 나눠 재기)는 세 라운드 내내 지지됐고, 틀린 것은 "후보에 없으면 해당 없음이라고 답한다" 하나였습니다. 입력 쪽은 합의가 두 번 틀렸습니다. 일곱 편이 모두 "코드가 87개 후보를 줄이고 Jev가 고른다"를 중심에 뒀지만 2라운드에서 상위 20개로 줄인 목록에 정답이 든 비율이 45.8%라 끝단이 35.0%에 머물렀고, 헤드 모델이 낸 규칙표 우선안은 3라운드에서 무너졌습니다. 가장 정확했던 것은 "설계에서 잠근 문안은 새 모집단을 설명하지 못한다"는 소수 경고(Grok 4.7)였습니다.

비용과 호출 위생

호출
3,560
세 라운드 합계. 전부 HTTP 200, 요청과 응답 모두 jev-1.13.0, 재시도 0.
비용
$0.35
입력 8,264,570 tokens × $0.042/M. 미리 걸어 둔 상한 1,500만 tokens($0.63)의 55.1%.
단가
$2.4
볼트 1만 노트를 87분류로 한 번 돌리는 값(1,000건당 약 $0.24). 병목은 토큰이 아니라 사람의 검토 시간입니다.

같은 날 돌린 8모델 논리검증

이번 실험 설계 자체를 여덟 모델에 같은 프롬프트로 맡기고, 정답 키와 위반 목록을 먼저 잠근 뒤 블라인드로 채점했습니다. 논리 문항 10개는 검색 필터 비용, 임계값 이식 함정, 순서 교차의 경제성 같은 이번 설계의 계산을 묻습니다.

순위모델가중총점밴드논리 블록 (54)
1Grok 4.789.4A51.5
2Claude Opus 5.5 (헤드 모델, 이 섹션의 작성 모델)88.6A49.9
3GPT-6 Sol87.2A50.2
4GPT-6 Astra80.6B51.5
5GPT-6 Luna64.0C42.7
6Gemini 3.1 Pro57.7C35.4
7Gemini 3.8 Flash56.0C37.0
밖Claude Fable 5.1미제출

판정과 다음 순서

판정은 PROPOSE 유지입니다. Jev는 제안하고, 코드와 사람이 실행합니다. 이번 결과가 바꾼 것은 도입 여부가 아니라 Jev가 서는 자리입니다. 검색에서는 후보를 고르는 자리가 분명해졌고, 입력 분류에서는 자동 판정이 아니라 top-3 제안 자리로 물러났습니다.

12 · Governance거버넌스와 HOLD 트리거

비밀 탐지를 판단기에 맡기는 것은 약점 2와 5에 어긋납니다. 반출 제외는 코드의 경로 규칙으로만 처리하고 Jev에게 "비밀인가"를 묻지 않습니다.

데이터 유형Jev 전송조건
일반 노트(영구 노트 최상위 등)가능제목·description·tags·본문 앞 1,200자만. 주민등록·계좌·여권·password 패턴 있으면 제외
인물, 회의, 영성 기록, 세션 코퍼스금지경로 규칙으로 기본 제외
회의록, 경영진 코칭 기록ZDR 전 금지enterprise ZDR 계약 뒤 재검토
시험 문항·교재ZDR 필수 + 외부 전송 허락허락 없으면 호출 없음
AKM 제출물 증거 원문동의 플래그에 외부 API 항목 있을 때만없으면 마스킹 후 증거 텍스트만
학생 레슨 STT원칙 금지미성년 가능성. 확인 전 전송 없음
재즈 공개 댓글약관·전송 동의·ZDR 결정 뒤PoC 3 진입 조건

Jev 라벨로 자체 분류기를 학습시키지 않습니다(계약의 distillation 제한과도 맞습니다). 치환 규칙과 전후 해시를 기록합니다. 회사 측 사실: 고객 입력 비학습 정책, 미국 호스팅, enterprise ZDR은 옵션(기본 무보관 아님), SOC 2 Type II 표시는 확인했으나 감사 실물의 scope·기간·예외는 미확인.

실험 위생

HOLD 트리거. 60일 현금화 플랜(2026-09-03~11-03) 기간 안에 라벨링 인력을 잡지 못하면 HOLD입니다. 500건 × 1분 ≈ 8.3시간(추정)이 실제 병목이고, $0.84짜리 토큰 상한이 아닙니다. 확보하면 PoC 1만 창 안에서 돌리고 2와 3은 11-03 이후로 미룹니다. Jev는 60일 안에 돈을 만드는 도구가 아니라, 60일 뒤에도 남을 라벨과 임계값과 criteria를 지금 쌓기 시작하는 도구입니다.

13 · Roadmap로드맵: PoC 1 → 2 → 3

500건(A 200, B 200, 경계 100; 설계 100 / 임계값 100 / 최종 300)을 총량 불변으로 셋으로 나눕니다. 과제 비율 2:2:1을 각 분할에 유지합니다.

단계무엇데이터프리미티브핵심 지표진입 조건
PoC 1한국어 노트 → CMDS 후보 + 보류. 라벨은 87 서브카테고리 유지, 후보 압축은 코드. 클래스 균형 표본A 분할분 + 경계Choice(보류 포함)macro-F1, 보류율, 검토 시간, 순서 불일치율키(완료), 반출 제외 목록, 라벨 세트, 메타 클래스 정의를 넣은 criteria
PoC 2문서·주장 쌍 → 지지/반박/근거 없음/보류. AKM 제출물과 시험 문항으로 구체화B 분할분 + 경계Choice, Noul잘못된 "지지함" 비율(Wilson), 근거 없음 재현율, Brier/ECEPoC 1에서 질문 형식(한 판단, 보류, 순서 고정) 동작
PoC 3재즈 리뷰 모더레이션과 공지 판별공개 댓글 200건(라벨은 파트너와 나), 재즈바 20곳 1주 변경 이력Noul, Choice, Score(관찰만)속성 Noul macro-F1, 공지 잘못된 "예" 비율, Score ECE 보고댓글 수집, 약관·전송 동의, ZDR 결정

임계값 절차 여섯 단계

결과를 보기 전에 목표를 문장으로 정한다
예: 잘못된 지지함의 95% 상한 ≤ 5%를 지키는 범위에서 coverage 최대. 5%는 예시이고 값은 내가 정합니다.
설계 100에서 문안·순서·보류 정의·라벨 집합을 고정한다
임계값 100에서만 컷을 고른다
프리미티브 사이에도, 같은 프리미티브의 다른 과제 사이에도 컷을 복사하지 않습니다(α 0.7이 β에서 안 통했습니다).
프리미티브·문구·모델 버전이 바뀌면 다시 한다
최종 300을 한 번만 채점하고 Wilson 95% 구간을 붙인다
정확도 90% 부근에서 ±3.4%p. 120건 무오류여도 상한 2.5%라 "오류율 1% 미만"은 증명 불가.
사람이 승인하고 GO / HOLD / STOP 노트를 남긴다

비용 상한은 그대로입니다. 2,000만 tokens × $0.042/M = $0.84이므로 토큰 상한이 $1보다 먼저 닫힙니다. 4변형 500건은 $0.252로 상한의 30%. 상한이 설계를 강제하는 첫 사례가 PoC 3의 20곳 × 144회 × 7일 × 1,500 = 30,240,000 tokens이고, 변경 감지를 넣어야만 실행합니다.

다음 실험

14 · References참고 자료

공개 링크만 적었습니다. 내부 스코어카드와 원장은 이 페이지에서 개념으로만 언급했습니다.

Official
docs.typesafe.ai
System One API, 프리미티브, 가격·한도, "Jev 1.13 jaggedness" 약점 문서, cookbook. 이 페이지의 [공식] 수치 출처.
CMDS
system.cmdspace.work
CMDS 시스템 파일 공개본. 4층 프레임의 출발 원칙과 서브카테고리 체계가 여기에 있습니다.
LLM Wiki
llm-wiki.cmdspace.work
Generator-Verifier 패턴, Local vs Cloud 라우팅 등 이 페이지가 기대는 개념의 위키 가이드.
Agents
9yohan.cmdspace.work
9-에이전트 오케스트라. 라우터 배정 검증이 Jev 후보 8행입니다.
이 페이지의 근거. 공식 문서 확인 2026-09-24 · 외부 조사와 재계산 2026-09-20 · 7모델 논리검증 채점 2026-09-24 · 직접 호출 341회 2026-09-24 오후 · Jev API 3라운드 3,560회와 8모델 논리검증 2026-09-26 새벽 · 커뮤니티 사례 jevable.com·GitHub·X 2026-09-24 저녁 확인(사례의 속도·비용·정확도는 작성자 주장). 외부 수치는 조건이 다르고 우리 실측은 기존 라벨 재현입니다. 어느 것도 사람 신규 라벨 정확도가 아닙니다. 가격·별칭·한도·약관은 실행 직전에 다시 확인합니다. 이 페이지의 어떤 문장도 아직 운영 정책이 아니며, 다음 갱신 시점은 사람 라벨 100건 위에서 첫 수치가 나올 때입니다.
v1.2 · 2026-09-26 · 09-26 실측(지식 입력과 검색, 8모델 요약) 섹션 추가 (작성 Claude Opus 5.5, 검토 전) · v1.1 · 2026-09-24 저녁 · 핵심 용어·흐름도·사례 26건 추가 (작성 Claude Opus 5.5, 사례 검색 Grok 4.7·Gemini 3.1 Pro) · v1.0 작성 Claude Fable 5.1 · 검토 구요한

Upcoming다가오는 행사

요즘 제가 진행하는 세미나와 컨퍼런스입니다. 궁금하시면 오세요.

상시 안내 · 온·오프라인
CMDS Bootcamp 1기
기록에서 지식으로, 지식에서 실행으로. 입문자와 고도화 두 갈래로, 각자의 필요에 맞게 필요한 과정만 단독 수강할 수 있습니다.
  • Obsidian 101 — 기록하고 연결하기 (4h)
  • PKM for AI Agent — 지식 설계부터 Claude Code까지 (8h)
  • LLM Wiki — 내 자료로 만드는 AI 지식베이스 (4h)
  • AI Agent Workflow — 내 지식으로 반복 업무 설계하기 (6h)
온·오프라인 동시 · 구요한 단독 강의
자세히 알아보기
그 밖의 일과 연락
bio.cmdspace.work
강의, 컨설팅, 뉴스레터 더배러, 월간옵시디언 등 진행 중인 일 전체와 연락처는 바이오 페이지에 모아 두었습니다.
bio.cmdspace.work