데이터셋 설명
실제 ASIMOV 데이터로 합니다
★ 진위ASIMOV Benchmark는 실재하는 공개 벤치마크입니다. Google DeepMind + Princeton(Pierre Sermanet, Anirudha Majumdar 등)이 CoRL 2025로 공개한 로봇 semantic/physical safety 벤치마크 family. 논문 arXiv:2503.08663 · 공식 asimov-benchmark.github.io · 데이터
gs://gresearch/robotics/(공개 GCS).실습 데이터 한 번에 받기 lite
9개 시나리오 전부를 돌리는 데 필요한 데이터 일체 — 대표·실 CSV, 멀티모달 이미지 6장, 영상 프레임 10장, 헌법 쌍, 컨텍스트 문서. zip을 풀면 경로가 프롬프트(
⬇ asimov-practice-data-lite.zip (5.5 MB)data/samples/…)와 그대로 일치합니다.영상 원본 tfrecord(364MB)는 실습에 쓰지 않아 lite에서 제외 — 추출 프레임으로 진행합니다. 원본 포함 번들은 후속 제공 예정 (직접 접근:
gs://gresearch/robotics/ 공개 버킷). ⚠ 번들에 answerkey·골든(강사 대조용)이 포함돼 있으니 세션 중 claude.ai에 업로드 금지 — 상세는 zip 안 README.txt.1. 우리가 실제로 받은 것
이번 준비에서 GCS builder(anon)로 실 subset 4종을 다운로드·검증하고(텍스트·이미지 36MB + 영상 364MB), claude.ai에 올릴 수 있게 변환했습니다.
| 실 데이터 | 규모 | 내용/출처 | 세션 사용 |
|---|---|---|---|
실 asimov_real_cases.csv | 24건 | asimov_injury_val — 실제 병원 부상 보고서 기반 상황 | SCN-05 배치 분류 |
실 images/*.png | 6장 | asimov_multimodal_auto_val — 실제 로봇 장면 이미지 | SCN-06 멀티모달 |
실 video_frames/*.jpg | 10장(2영상) | asimov_v2_videos — 실제 로봇 안전 영상 프레임(720×1280, 부상위험·개입시점 판정) | SCN-06 멀티모달(영상) |
실 asimov_constitution_pairs.md | 4건 (안전2+위험2) | injury_val의 prompt_with/without_constitution 원본 필드 | SCN-08 헌법 전후 |
실 data/cache/*/*.tfrecord | 4 subset | injury 304 · multimodal 50 · dilemmas 34 · videos 287 (원천 바이너리) | 변환 원천 |
tfrecord는 바이너리라 claude.ai에 직접 못 올립니다. 그래서 위 CSV·PNG·MD로 변환해 둔 것. 더 큰 규모는
scripts/03_cache_datasets.py로 확장 캐싱 → 같은 CSV 파이프라인 재사용.2. 대표샘플은 왜 쓰고, 왜 의미 있나
가상이 아니라 “통제된 대표”
sample_cases.csv(14건)는 실 스키마(context·instruction·label)를 그대로 따르되, 12개 위험 유형을 균등 배치하고 결정론적 정답(골든 reference_category_summary.md)을 갖췄습니다. 덕분에 2시간 세션에서 Claude 분류의 정확도를 즉석 검증할 수 있습니다 — 수십만 건 원본에선 불가능한 것. 실데이터와 컬럼이 같아 1:1 교체됩니다. 권장 순서: 대표(깔끔한 데모+정확도 검증) → 실 ASIMOV(진짜라는 신뢰).3. 리허설 실측 — 이 데이터로 실제 검증한 결과
D-day 모의 실습(Claude Code, 블라인드 판정 후 answer key 대조)에서 나온 실측치입니다. 세션 중 "이 워크플로가 검증된 것인가"라는 질문에 대한 답.
| 검증 항목 | 실측 | 의미 |
|---|---|---|
| 실 injury 24건 블라인드 분류 | 24/24 (100%) · FP 0 · FN 0 | 위험 놓침도, 과잉 거절도 없음 (단 경계 뚜렷한 paired 세트) |
| 대표세트 14건 블라인드 분류 | 13/14 (92.9%) · FN 0 | 유일 오답은 딜레마를 위험으로 — 과잉 신중 방향(안전 평가에서 옳은 오류 방향) |
| confidence calibration | 최저 confidence(0.45) 케이스 = 유일한 오답 | 모델의 자기 불확실성 보고가 실제 오류를 예측 |
| severity 대조 | 불일치 3건 전부 critical→high 같은 방향 | 체계적 편향 → 채점 룰 1줄로 교정 (프롬프트에 반영됨) |
| 멀티모달 | 이미지 6장 × 후보 지시 28건 판독 | 물리 위해 없는 절차·실험 훼손도 undesirable로 판정됨을 확인 |
| Robot Constitution | 안전 케이스 = 판단 불변 · 위험/모호/악의 4건 = flip | 좋은 guardrail의 조건 = 비대칭성 |
4. “15,000개”는?
CTO님이 말씀하신 “15,000개 테스트셋”은 공개 자료상 단일 세트로는 존재하지 않습니다. ASIMOV는 수십만 situations ~ 수백만 instructions 규모의 family이고, 가장 가까운 대규모 축은 Multimodal-Auto train ≈ 11,080 contexts. 세션 초반에 이걸 정확히 프레이밍하고, 원본 15,000건이 별도로 있으면 같은 taxonomy·batch pipeline으로 확장합니다.
CMDSPACE