CMDSPACE
데이터셋 설명

실제 ASIMOV 데이터로 합니다

무엇을 쓰는지, 진짜 데이터의 출처, 대표샘플이 왜 의미 있는지
★ 진위ASIMOV Benchmark는 실재하는 공개 벤치마크입니다. Google DeepMind + Princeton(Pierre Sermanet, Anirudha Majumdar 등)이 CoRL 2025로 공개한 로봇 semantic/physical safety 벤치마크 family. 논문 arXiv:2503.08663 · 공식 asimov-benchmark.github.io · 데이터 gs://gresearch/robotics/(공개 GCS).
실습 데이터 한 번에 받기 lite
9개 시나리오 전부를 돌리는 데 필요한 데이터 일체 — 대표·실 CSV, 멀티모달 이미지 6장, 영상 프레임 10장, 헌법 쌍, 컨텍스트 문서. zip을 풀면 경로가 프롬프트(data/samples/…)와 그대로 일치합니다.
⬇ asimov-practice-data-lite.zip (5.5 MB)
영상 원본 tfrecord(364MB)는 실습에 쓰지 않아 lite에서 제외 — 추출 프레임으로 진행합니다. 원본 포함 번들은 후속 제공 예정 (직접 접근: gs://gresearch/robotics/ 공개 버킷). ⚠ 번들에 answerkey·골든(강사 대조용)이 포함돼 있으니 세션 중 claude.ai에 업로드 금지 — 상세는 zip 안 README.txt.

1. 우리가 실제로 받은 것

이번 준비에서 GCS builder(anon)로 실 subset 4종을 다운로드·검증하고(텍스트·이미지 36MB + 영상 364MB), claude.ai에 올릴 수 있게 변환했습니다.

실 데이터규모내용/출처세션 사용
asimov_real_cases.csv24건asimov_injury_val — 실제 병원 부상 보고서 기반 상황SCN-05 배치 분류
images/*.png6장asimov_multimodal_auto_val — 실제 로봇 장면 이미지SCN-06 멀티모달
video_frames/*.jpg10장(2영상)asimov_v2_videos — 실제 로봇 안전 영상 프레임(720×1280, 부상위험·개입시점 판정)SCN-06 멀티모달(영상)
asimov_constitution_pairs.md4건 (안전2+위험2)injury_val의 prompt_with/without_constitution 원본 필드SCN-08 헌법 전후
data/cache/*/*.tfrecord4 subsetinjury 304 · multimodal 50 · dilemmas 34 · videos 287 (원천 바이너리)변환 원천
tfrecord는 바이너리라 claude.ai에 직접 못 올립니다. 그래서 위 CSV·PNG·MD로 변환해 둔 것. 더 큰 규모는 scripts/03_cache_datasets.py로 확장 캐싱 → 같은 CSV 파이프라인 재사용.

2. 대표샘플은 왜 쓰고, 왜 의미 있나

가상이 아니라 “통제된 대표”
sample_cases.csv(14건)는 실 스키마(context·instruction·label)를 그대로 따르되, 12개 위험 유형을 균등 배치하고 결정론적 정답(골든 reference_category_summary.md)을 갖췄습니다. 덕분에 2시간 세션에서 Claude 분류의 정확도를 즉석 검증할 수 있습니다 — 수십만 건 원본에선 불가능한 것. 실데이터와 컬럼이 같아 1:1 교체됩니다. 권장 순서: 대표(깔끔한 데모+정확도 검증) → 실 ASIMOV(진짜라는 신뢰).

3. 리허설 실측 — 이 데이터로 실제 검증한 결과

D-day 모의 실습(Claude Code, 블라인드 판정 후 answer key 대조)에서 나온 실측치입니다. 세션 중 "이 워크플로가 검증된 것인가"라는 질문에 대한 답.

검증 항목실측의미
실 injury 24건 블라인드 분류24/24 (100%) · FP 0 · FN 0위험 놓침도, 과잉 거절도 없음 (단 경계 뚜렷한 paired 세트)
대표세트 14건 블라인드 분류13/14 (92.9%) · FN 0유일 오답은 딜레마를 위험으로 — 과잉 신중 방향(안전 평가에서 옳은 오류 방향)
confidence calibration최저 confidence(0.45) 케이스 = 유일한 오답모델의 자기 불확실성 보고가 실제 오류를 예측
severity 대조불일치 3건 전부 critical→high 같은 방향체계적 편향 → 채점 룰 1줄로 교정 (프롬프트에 반영됨)
멀티모달이미지 6장 × 후보 지시 28건 판독물리 위해 없는 절차·실험 훼손도 undesirable로 판정됨을 확인
Robot Constitution안전 케이스 = 판단 불변 · 위험/모호/악의 4건 = flip좋은 guardrail의 조건 = 비대칭성

4. “15,000개”는?

CTO님이 말씀하신 “15,000개 테스트셋”은 공개 자료상 단일 세트로는 존재하지 않습니다. ASIMOV는 수십만 situations ~ 수백만 instructions 규모의 family이고, 가장 가까운 대규모 축은 Multimodal-Auto train ≈ 11,080 contexts. 세션 초반에 이걸 정확히 프레이밍하고, 원본 15,000건이 별도로 있으면 같은 taxonomy·batch pipeline으로 확장합니다.
← 실습 개요첫 시나리오 시작 →