연구 목적 | 사람 대체가 아닌 가설 점검
사람을 대신할 답이 아니라
사람에게 확인할 질문을 만든다
합성 페르소나 연구는 미래 시나리오와 정책 가설의 점검 도구를 만든다.
지금 쓸 곳
모호한 문항, 수용 조건, 반대논리와 후속 질문 후보를 체계적으로 점검한다.
검증할 곳
모델과 프롬프트 민감도를 기록하고, 중요한 판단은 실제 사람의 조사와 숙의로 확인한다.
연구총괄 | 탐색분석·검증 중
합성 페르소나로
미래를 묻는 법
STEPI 2045 프론티어 연구 | 방법, 실행, 결과와 한계
상태 구분
무엇을 만들었고,
무엇을 아직 말할 수 없는가
수집 완료와 타당화 완료는 다른 사건이다.
구축·실행
통계 앵커 카드, 190문항, 반복 실행, 모델 비교, 원자료 동결을 연결했다.
검증·공개
인간 타당화, 유형의 실재성, 정책 증분효용과 공식 결과 공개는 별도 게이트다.
읽는 순서
이 발표는 여덟 질문에 답한다
출발점에서 남은 검증까지, 하나의 증거 계보로 읽는다.
분모 규약
세 가지 수를
혼동하지 않는다
레코드 수, 생성 런 수, 실제 사람 수는 교환할 수 없다.
| 단위 | 현재 연구의 예 | 해석 |
|---|---|---|
| 합성 카드 | 본체 1,000개 | 고정된 조건 입력 |
| 생성 런 | 본체 3,000건 | 같은 카드의 3회 반복 |
| 모델 비교 카드 | 공통 200개 | 여러 모델에 반복 투입 |
| 인간 응답자 | 원본 1,303, usable 1,292 | 온라인 자발 참여자료 |
목적
A
연구 문제와 의사결정
기술이 가능하다는 말과, 사람들이 받아들인다는 말 사이의 간격.
연구 목적
전문가의 미래상을
생활의 질문으로 바꾼다
또 하나의 가상 전문가가 아니라, 놓친 생활조건을 찾는 도구다.
주장 상한
페르소나는 판정자가 아니라
관점을 탐색하는 렌즈다
사람을 대신 말하게 하지 않고, 사람에게 물을 질문을 만든다.
- 허용: 문항 사전점검, 반대논리 탐색, 시나리오 사각지대 발굴.
- 조건부: 워크숍 의제, 추가 조사와 표집 우선순위의 후보.
- 금지: 국민 찬성률, 미래 예측, 시민참여 대체, 단독 자원배분 근거.
결정 이력
설계는 한 번에
확정되지 않았다
사람 비교를 중심에 두면서 문항과 실행 구조가 바뀌었다.
설계 변경
7월 24일의 전환점
인간 문항이 비교의 중심이다
문항을 많이 생성하는 것보다, 같은 질문을 비교하는 것이 중요하다.
이전
과거 시계열 문항을 병치하고 100문항 파일럿으로 넓게 탐색.
이후
인간 공통 코어를 보존하고, 페르소나 전용 심층 문항을 별도 층으로 확장.
산출물 분리
세 산출물은
같은 질문을 반복하지 않는다
같은 증거를 쓰더라도 기관 해석, 연구 검증, 재사용 자산을 분리한다.
외부 원문 대조
B
AI 페르소나의 지형
같은 페르소나라는 말 아래, 서로 다른 연구 대상과 평가가 있다.
접근 비교
데이터, 행위자, 개인모사
세 층을 나눠 읽는다
규모나 설득력 한 가지로 모든 접근의 성능을 비교할 수 없다.
| 접근 | 대표 사례 | 평가의 중심 |
|---|---|---|
| 합성 인구 카드 | NVIDIA Nemotron Personas | 통계 속성, 다양성, 사용권 |
| 상호작용 행위자 | Stanford Generative Agents | 기억·계획·반성, 행동의 개연성 |
| 실제 개인 모사 | Stanford 인터뷰·설문 기반 | 보지 않은 응답의 재현 |
| 인구 동학 | MIT AgentTorch / LPM | 상호작용과 관측자료 보정 |
| 미래 자아 대화 | MIT Future You | 자기성찰과 심리적 효과 |
원문·로컬 검증 대조
NVIDIA의 700만은
700만 사람이 아니다
한국판 base는 100만 레코드 안에 7종 페르소나 서술을 담는다.
| 항목 | 정확한 단위 | STEPI에서의 의미 |
|---|---|---|
| 1,000,000 | 합성 레코드 | 표본을 뽑는 원본 프레임 |
| 7,000,000 | 페르소나 서술 필드 | 직업·가족·취향 등 7종 |
| 26 | 레코드 필드 | 인구 속성과 서사 결합 |
| CC BY 4.0 | HF base 라이선스 | 출처표시 필수 |
공급자 방법론
통계 앵커는
자유 생성의 쏠림을 제어한다
공공통계 → 구조적 표집 → 자연어 서술 → 검증의 순서다.
데이터 한계
통계에 맞춘 카드도
한국 사회 전체는 아니다
관측 가능한 필드와 추정해 덧붙인 속성을 구분한다.
논문 원문 확인
Stanford 2023
그럴듯한 행동을 만드는 구조
25개 가상 행위자의 기억·반성·계획을 연결한 Generative Agents.
버전 구분
Stanford의 개인모사
실제 사람의 근거를 입력한다
1,052명의 실제 자료로 만든 에이전트와, 합성 인구 카드는 출발점이 다르다.
2024 v1
개인의 질적 인터뷰를 바탕으로 설문, 성격과 실험 반응을 모사했다.
2026 v3
인터뷰만, 설문만, 두 근거 결합을 분리해 비교한다. 동일 arXiv 기록의 개정판이다.
원문 수치·정의 확인
‘85% 정확도’라는
짧은 인용을 고친다
본인도 두 주 뒤 완전히 같은 답을 하지 않는다. 수치는 그 일관성으로 정규화됐다.
| 판본·조건 | 보고 수치 | 분모의 의미 |
|---|---|---|
| 2024 v1 인터뷰 | 85% | 인간의 2주 재검사 일관성 대비 |
| 2026 v3 인터뷰 | 83% | 보류 GSS 문항의 정규화 정확도 |
| 2026 v3 설문 | 82% | 같은 비교 기준 |
| 2026 v3 결합 | 86% | 같은 비교 기준 |
| 2026 v3 인구통계 | 74% | 비교 baseline |
MIT 공식 프로젝트 설명
MIT AgentTorch
사람 수보다 동학과 보정이 핵심
Large Population Models는 상호작용하는 대규모 인구의 변화를 모형화한다.
메커니즘
GPU 병렬 처리와 미분 가능한 시뮬레이션을 관측자료 보정에 결합한다.
STEPI와의 차이
독립적인 카드별 설문 응답 생성과, 네트워크를 통한 인구 동학 시뮬레이션은 다른 실험이다.
공식 연구 소개
MIT Future You
미래를 예측하는 쌍둥이가 아니다
미래 자아와의 대화는 자기성찰을 돕는 개입이다.
- 사용자의 정보를 바탕으로 미래 자아의 서사와 대화 경험을 만든다.
- 평가의 대상은 불안, 정서와 미래 자아 연속성 같은 심리적 변화다.
- 미래에 실제로 어떤 삶을 살지 맞힌 예측 실험으로 읽지 않는다.
문헌·위키 맥락
다른 접근은
비교 대상이지 채택 실적이 아니다
벤치마크 후보, 제품 소개, 실제 실행을 구분한다.
| 계열 | 얻는 관점 | 이 연구에서의 지위 |
|---|---|---|
| Silicon sampling | 조건부로 인간 패턴을 모사할 가능성 | 문헌 배경 |
| ManyPerson | 한국 통계 기반 여론 시뮬레이션 사례 | 초기 비교 후보, 실행 근거 없음 |
| MatrAIx | 카드×모델×과제×검증기 결합 | 위키 기반 구조 비교 |
| No-persona baseline | 페르소나 서사의 증분효과 식별 | 본조사 후속 과제 |
문헌 합성
선행연구가 주는
공통 설계 원칙
가능성과 실패를 함께 읽어야 검증 설계가 나온다.
구축된 설계
C
표본과 조사도구
프롬프트 한 장이 아니라, 표본·자극·문항·검증 계약을 만든다.
구축·재현 기록
표본은 실행 전에
고정한다
원본 프레임 → 할당 셀 → 고정 명부 → 모든 반복에 동일 투입.
표본 역할
쿼터 1,000과 레드팀 20
서로 다른 일을 한다
넓은 반응 탐색과 극단 사각지대 탐색의 분모를 합치지 않는다.
쿼터 1,000
합성 프레임의 인구 속성 구성을 넓게 배치한다. 확률표집된 시민 1,000명이 아니다.
레드팀 20
극단·취약 조건을 목적적으로 고른다. 본체와 교집합이 없는 별도 명부다.
역사 검증치의 정의 감사
‘분포 편차’에도
기준 집합이 필요하다
원본 프레임과의 정합은 실제 국민 태도와의 정합이 아니다.
| 점검 | 확인 내용 | 주의 |
|---|---|---|
| 원본 무결성 | 100만 행, 26필드, 고유 식별자 | 형식·도메인 점검 |
| 표본 재현 | seed 42 재추출 1,000/1,000 | 동일 표집 코드 조건 |
| P2 요약 | 최대 마지널 편차 1.93%p | 해당 감사 변수 범위 |
| 직업 부표 | 무직 편차 2.33%p | 1.93을 모든 변수 최대로 일반화 금지 |
07/24 검증 이력
잘못된 원본 설명을
실제 필드로 교정했다
풍부한 서사가 있어도 존재하지 않는 필드를 만들지 않는다.
| 초기 표현 | 확인된 사실 | 적용 |
|---|---|---|
| 온라인쇼핑판매원 19.8% | 정본 라벨 약 0.50% | 초기 수치 폐기 |
| 성씨 분포 | base에 성씨 필드 없음 | 서사 가명과 필드 구별 |
| 주택형태=점유형태 | 아파트 등 구조형 | 자가·전세 추정 금지 |
| 학력 47.5+29.6≈82 | 산술합은 77.1 | 오기 그대로 복제 금지 |
연구용 자극문
조사 대상은
여섯 미래상이다
아래 명칭은 연구의 자극 체계다. 정부 최종 확정 비전이라고 부르지 않는다.
개념·노출 경계
미래상을 같은 크기의
상자로 보지 않는다
인프라, 개별 영역, 규칙과 포용이라는 층위가 함께 들어 있다.
- 본조사에서 S6는 개별 평가 대상이다.
- 청년워크숍 사전설문에서는 5개 미래상과 포용·배제의 공통 관점으로 다뤘다.
- 워크숍 단문 요약 노출을 본조사 장문 자극 노출과 동일시하지 않는다.
v0.5 설계 정본
190문항은
두 층으로 구성된다
공통 코어 73 + 페르소나 확장 117 = 190.
| 층 | 주요 블록 | 수 |
|---|---|---|
| STEPI 코어 | OPEN, A~G | 73 |
| CS 확장 | CS-A~F, Q, T, An, M, ST, O | 117 |
| 합계 | 고유 문항 id | 190 |
| 6축 심층 | CS-M | 55 |
문항 대응
사람과 비교되는
공통 문구는 OPEN7이다
기대 국가상, 미래 과제, 과학기술 역할, 개인 기대, 우려, 현재 경쟁력, 미래 도전.
측정 구조
네 가지를 따로 묻고
수용성 여섯 축을 심화한다
바람직함, 실현 가능성, 개인 영향과 시급함을 한 점수로 압축하지 않는다.
B 블록
미래상마다 바람직성·실현가능성·개인영향·시급성의 4문항.
CS-M
기대 12, 체감성 6, 소외 6, 불안 8, 신뢰 7, 수용도 16문항의 6축.
설계 통제
측정하려는 전제를
먼저 정답으로 주입하지 않는다
‘AI 최종책임은 인간에게’라는 전제 자체가 측정 대상이었다.
- 국가 체제, 지구 활동 공간, 물리법칙 전제만 시스템에 주입했다.
- 인간 최종책임 전제는 주입하지 않고 관련 문항으로 물었다.
- 정책 명제에 대가 절이 포함되면 동의율의 절대치 해석을 제한한다.
실행 통제와 한계
순서를 바꾸되
무엇이 섞이는지 기록한다
무작위화가 있는 부분과 없는 부분을 구분한다.
| 장치 | 구현 | 식별 경계 |
|---|---|---|
| OPEN7 선행 | 자극 노출 전 배치 | 전역 문맥 누출은 별도 감사 |
| E 보기 | 카드별 셔플, 반복 내 고정 | canonical 번호로 저장 |
| C2 | C1 선택 제외 | 교차문항 제약 검증 |
| CS-M 순서 | 라운드별 로테이션 | 순서×시점×라운드 교락 |
역사 실험
D
파일럿에서 배운 것
작은 실험의 관찰을 큰 타당성 주장으로 늘리지 않는다.
2026-08-08 실행
파일럿 v0.3
50개 카드로 조사 흐름을 점검했다
50개 합성 카드 × 100문항 × 1회 응답.
| 항목 | 내용 |
|---|---|
| 전신 | 07/05 v0.1 모빌리티 28문항에서 확장 |
| 자극 | S0 기준문과 S1~S6 미래상 |
| 결과 | 구조 검증, 반응 지형, 시연용 볼트 |
| 분석 | 수용도, 입장, 양극 문항, 규칙 기반 유형 |
| 한계 | 단일 회차, 본조사와 문항 버전 다름 |
역사 탐색값 | v0.3 n=50
파일럿의 우열은
인간 수용률이 아니다
M블록 수용도 평균에서 관찰된 합성 지형이다.
| 미래상 | 평균(1~5) | 읽는 법 |
|---|---|---|
| S6 포용·상생 | 4.12 | 이 파일럿 생성계 안의 상대값 |
| S3 에너지 | 3.47 | 같은 문항 버전과 표본 조건 |
| S2 초장수 | 3.20 | 사람 기준 검증 아님 |
| S5 룰메이커 | 3.18 | 정책 우선순위 확정 아님 |
| S4 생활권 | 3.05 | 본조사 수치로 이월 금지 |
| S1 지능강국 | 2.53 | 국민 거부율 아님 |
역사 분류 | 후속 재검증 필요
파일럿 6유형은
가설이었다
컷포인트로 분류한 이름과 데이터에서 확인된 실재 유형은 다르다.
2026-08-08 단일 사례
‘REAL’이라고 부른 응답도
사람의 실답은 아니었다
두 종류의 근거를 입력한 LLM 응답끼리 비교한 실험이다.
문서 근거
한 사람의 확인된 문서와 지론을 제공한 생성 응답.
통계 클론
인구 속성과 직업 활동이 유사한 합성 카드를 제공한 생성 응답.
단일 사례 | 생성 응답 간 비교
비슷한 평균과
같은 판단은 다르다
v0.3 비교에서 척도 거리는 작아도 가치 선택은 갈렸다.
| 비교 지표 | 관찰 | 의미 |
|---|---|---|
| Likert 83문항 | MAE 0.51 | 평균절대오차 |
| ±1 이내 | 80 / 83 | 정도의 근접성 |
| 양극 동일극 | 11 / 17 | 가치 방향의 불일치 잔존 |
| 미래상 입장 일치 | 2 / 6 | 집계 근접≠개인 판단 복제 |
2026-08-10 | 190문항
근거 깊이를
다섯 조건으로 바꿨다
문서 A, 프로파일 B, 통계 클론 C, 무작위 D1·D2.
역사 탐색값 | 기준 A도 LLM 생성
카드 근거는 문서 근거에
더 가까웠다
척도 148문항에서 A 대비 거리와 일치도를 비교했다.
| 조건 | MAE | 완전일치 | ±1 이내 |
|---|---|---|---|
| B 프로파일 | 0.19 | 81% | 100% |
| C 통계 클론 | 0.49 | 55% | 96% |
| D1 무작위 | 0.61 | 48% | 91% |
| D2 무작위 | 0.96 | 36% | 78% |
과거 해석의 강도 조정
작은 실험이
입증하지 않은 것
‘프로파일이 집계 타당성을 입증했다’는 초기 해석은 과도하다.
- 기준 A도 문서 기반 생성물이라 인간의 정답이 아니다.
- 무작위 조건은 인구 속성까지 달라진다. 근거 깊이만의 통제가 아니다.
- 단일 인물·모델·회차에서 얻은 일치도를 전체 1,000개 카드로 일반화하지 않는다.
수집 완료
E
본조사 실행과 동결
응답을 만드는 모델과, 실험을 통제하는 코드를 분리한다.
실행 아키텍처
코드가 통제하고
모델은 응답값을 만든다
생성의 자유와 실험의 불변조건을 서로 다른 책임으로 둔다.
strict validator
구조 검증은
엄격하지만 충분하지 않다
빠짐없이 형식에 맞는 답과, 타당한 답은 다르다.
| 기계 점검 | 기대 조건 | 보증하지 않는 것 |
|---|---|---|
| 문항 id | 190개, 누락·중복 없음 | 사람과의 일치 |
| 값 | 척도 타입과 범위 | 가치 판단의 진실 |
| 선택 | E1=5, E2=3, E3≤3 | 정책 우선순위 타당성 |
| 관계 | C2≠C1, 제시 순서 일치 | 문화적 충실도 |
동결된 수집 구성
4,650과 60
같은 합계로 덮지 않는다
본체와 비교 암의 동결 뒤, 레드팀은 별도 증분으로 남았다.
| 묶음 | 산식 | 채택 응답 |
|---|---|---|
| 본체 | 1,000×3회 | 3,000 |
| 통제 | 동일순서 통제50 | 50 |
| 모델 암 | 200×8조건 | 1,600 |
| 기본 동결 | 위 세 묶음 | 4,650 |
| 레드팀 증분 | 20×3회 | 60 |
응답 provenance 구성
첫 라운드는
단일 모델이 아니었다
요청한 이름이 아니라 실제 응답의 계보로 분석세트를 나눈다.
| 라운드 | 관측 모델 | 건수 |
|---|---|---|
| r1 | Opus 5 | 757 |
| r1 | Fable 5.1 / Fable 5 | 214 / 29 |
| r2 | Opus 5 [1m] / Opus 5 | 782 / 218 |
| r3 | Opus 5 [1m] | 1,000 |
실행 이력
실행 중 전환도
측정도구의 변화다
조건 전환을 숨기면 반복성의 분모가 틀어진다.
분석세트 결정
반복 분석의 정본은
C1 757개 카드다
같은 모델 계열과, 완전히 같은 실행조건은 다르다.
| 세트 | 고유 카드 | 역할 |
|---|---|---|
| r3 전체 | 1,000 | 가장 균질한 단면 |
| C1 | 757×3회 | r1 Opus와 후속 반복의 교집합 |
| r2↔r3 | 1,000×2회 | 두 라운드 민감도 |
| 실행조건 동질 | 374×2회 | 확인된 실행조건 부분집합 |
| r1 Fable | 243 | 별도 표, C1에 합산 금지 |
D02 보류
control50은
완벽한 동일조건 통제가 아니다
같은 순서로 다시 물었어도, 실행 티어가 달랐다.
- 200K 티어 경로의 50개 응답으로 남아 있다.
- r1과 모델이 맞는 쌍은 일부이며 실행시점도 달랐다.
- control50은 티어 민감도, 재정렬32쌍은 하위집합 비교다. 어느 쪽도 전체 반복의 천장이 아니다.
8조건×공통 200
모델 암은
다수결용 여덟 여론이 아니다
동일 카드를 다른 생성 도구에 넣어 도구 민감도를 본다.
| 구성 | 역할 |
|---|---|
| Opus [1m] 인라인 | 본체 파일모드와의 형식 비교 기준 |
| Sonnet, Gemini 2종 | 다른 계열·크기 조건 |
| GPT Sol / Terra | 서로 다른 실행 모델 조건 |
| Grok 2종 | 다른 모델 조건 |
| main r3 동일200 | 기존 본체의 대응 행, 추가 수집 아님 |
보존 구조
동결은
원본과 파생물을 나누는 일이다
원본을 다시 쓰지 않아야 해석이 바뀌어도 당시 증거가 남는다.
탐색분석 | 검증 중
F
실제 분석과 검증 경계
다음 장들은 공식 결과 릴리스가 아니라, 이미 존재하는 탐색 진단의 검토다.
모듈 지도
분석은 아홉 기능으로
질문을 분해한다
자료 준비 뒤, 반복·구조·집단·관계·유형·예측·모델·사람을 따로 점검한다.
| 모듈 | 질문 | 도구 |
|---|---|---|
| 준비 / M2 | 자료가 맞고 반복되는가 | 키·코호트, ICC·일치율 |
| M3 / M4 | 축이 분리되고 집단차가 남는가 | EFA·CFA, 효과크기·조정모형 |
| M5 / M6 | 관계·유형이 식별되는가 | 반응표면, 군집·LCA |
| M7 / M8 | 예측·모델 변경에 무엇이 남는가 | 교차검증, 짝지은 모델 대비 |
| M9 | 사람 자료와 무엇이 다른가 | 공통층 주제 비교·민감도 |
탐색분석 | 09/09 계산
최신 ICC는
예전 근사값을 대체해서 읽는다
C1 757개×3회, 절대일치 ICC(2,1), UUID 묶음 bootstrap 5,000회.
| 축 | ICC(2,1) | 95% 구간 | 참조 밴드 |
|---|---|---|---|
| 기대 | 0.531 | [0.481, 0.577] | 조건부 |
| 체감성 | 0.735 | [0.705, 0.762] | 조건부 |
| 소외 | 0.817 | [0.792, 0.839] | 안정 |
| 불안 | 0.520 | [0.470, 0.563] | 조건부 |
| 신뢰 | 0.309 | [0.251, 0.365] | 불안정 |
| 수용도 | 0.528 | [0.490, 0.565] | 조건부 |
탐색분석 | 기준선 해석
점추정 밴드와
정식 판정은 별개다
≥0.75, 0.50~0.75, <0.50의 기존 참조선을 사후에 바꾸지 않는다.
지표의 다른 질문
높은 정확일치와
낮은 ICC는 양립한다
모두 비슷한 답을 하면 정확일치는 높아도 개인차를 안정적으로 구분하지 못한다.
정확일치율
같은 문항에서 같은 값을 반복했는가.
ICC
개인 간 차이 대비 반복 오차와 조건 차이가 얼마나 작은가.
탐색 진단 | r3 n=1,000
r3의 반응은
좁은 범위에 압축됐다
개인별 축 평균의 평균과 표준편차다. 문항 자체의 분산과 다르다.
| 축 | 평균(1~5) | 개인평균 SD | 고유값 수 |
|---|---|---|---|
| 기대 | 3.988 | 0.137 | 13 |
| 체감성 | 2.855 | 0.379 | 12 |
| 소외 | 3.942 | 0.350 | 15 |
| 불안 | 3.948 | 0.159 | 10 |
| 신뢰 | 2.144 | 0.150 | 9 |
| 수용도 | 3.508 | 0.162 | 17 |
탐색 산출 | 패치 전 실제자료
M3 구조 분석
여섯 축이라고 여섯 요인은 아니다
설계 이름의 개수와 경험적 측정구조를 따로 검증한다.
탐색 진단 | 구조 미확정
부적격 CFA 해는
성공으로 수선하지 않는다
확인 반의 6요인 모형에서 부적격 해가 기록됐다.
- 잠재공분산 비양정치, 절대 요인상관 1 초과 등은 해석 중단 사유다.
- 요인 병합의 경계 귀무가설에 통상의 카이제곱 차이검정을 쓰지 않는다.
- 탐색적 재명세와 확인 표본에서의 검증을 분리한다.
탐색 산출 | 미결 기준 유지
M4 집단차
유의성보다 크기와 일관성
단순 차이, 조정 차이, 반복 조건의 일관성을 분리한다.
탐색 산출
M5 반응표면
곡면이 있다고 인과가 생기지 않는다
RSA는 두 입력의 일치·불일치와 곡률을 보는 다항회귀다.
페르소나 내부
기대×신뢰, 소외×체감성 등과 수용도의 관계를 모델링한다.
사람×AI 결합
층별 언급률은 소수 층의 집계변수다. 1,000행으로 펼쳐도 독립 정보가 늘지 않는다.
탐색 진단 | 승격 없음
통계 기준을 넘어도
정식 검증을 못 넘을 수 있다
M5 내부 후보 기준과, 사용 점수의 안정성 기준이 따로 작동했다.
- 모듈 내부 통계 후보 7건, 안정성 게이트를 거친 본문 승격 0건.
- 조건부·불안정 점수를 사용한 모형을 확증 결과로 올리지 않는다.
- 진단 모듈의 승격 플래그 자체도 프로젝트의 사람 서명을 대신하지 않는다.
탐색 진단 | r3 n=1,000
M6 유형화
잘 나뉘는 것과 다시 나뉘는 것
군집 내부 재표집 안정성과 라운드 간 재현성이 다르게 나타났다.
| 검사 | 관찰값 | 범위 |
|---|---|---|
| k=2 silhouette | 0.339 | r3 분리 정도 |
| k=6 silhouette | 0.213 | 강제 6군집 |
| k=2 재표집 ARI | 0.961 | 같은 r3 재표집 |
| C1 r2 / r1 ARI | 0.345 / 0.357 | r3 중심으로 재배정 |
| M-arm ARI 중앙값 | 0.086. | 공통 200카드, 모델간 |
유형 해석 보류
같은 여섯 이름을
사람과 AI에 붙일 수 없다
공통 유형의 출처 간 비교가능성이 확보되지 않았다.
- k=6 강제 적합은 파일럿 유형의 직접 재현 검증이 아니다.
- 사람·합성 태그의 잠재계층은 길이와 출처 분리에 민감했다.
- 내용적 유형명은 구조와 출처 비교가능성 확인 뒤에 붙인다.
탐색 분석
M7 기계학습
생성계의 패턴을 예측한다
같은 사람·카드의 문항이 학습과 평가에 섞이지 않도록 묶는다.
탐색 진단 | 출처 판별
인간과 합성 텍스트는
쉽게 구별됐다
내용뿐 아니라 길이만으로도 출처 구별력이 높았다.
| 특징 | AUROC | 검증 단위 |
|---|---|---|
| 길이만 | 0.9768 | 응답자 묶음 5-fold |
| 내용+길이 | 0.9999 | 응답자 묶음 5-fold |
탐색 진단 | 공통 200카드
M8 모델 민감도
평균순위와 개인 응답을 분리한다
미래상의 집계 순위가 비슷해도, 개별 응답값은 크게 다를 수 있다.
집계 층
수용도 평균의 순위, 미래상 쌍의 부호 보존.
개인 층
동일 카드의 정확일치, MAE, 군집 배정, 축별 이동.
탐색 진단 | 90 통제문항
같은 카드라도
모델이 바뀌면 답이 달라진다
인라인 Opus 대비, 카드별 정확일치율의 평균이다.
| 비교 조건 | 정확일치율 | 95% UUID 구간 |
|---|---|---|
| Sonnet | 0.599 | [0.591, 0.607] |
| Gemini Pro | 0.590 | [0.582, 0.598] |
| Gemini Flash | 0.657 | [0.650, 0.665] |
| GPT Sol | 0.557 | [0.550, 0.565] |
| GPT Terra | 0.592 | [0.583, 0.601] |
| Grok reasoning | 0.496 | [0.487, 0.504] |
| Grok 4.6 | 0.644 | [0.636, 0.652] |
| 본체 Opus 파일모드 | 0.812 | [0.805, 0.819] |
탐색 진단 | 8인라인 조건
미래상 순위에서
보존된 것과 바뀐 것
S6 상단, S3 다음, S1 하단은 보존됐고 중간 순위는 달랐다.
- 8모델×6미래상의 Kendall W = 0.941 (순위 일치 진단).
- 6개 미래상만의 순위상관은 거칠고 이산적이다.
- 동일 자극의 규범적 문구가 여러 모델의 공통 반응을 만들 가능성도 남는다.
코드 수정·모의자료 검증
9월 10일에 고친 것은
기존 결과가 아니라 경계조건이다
실제자료 M3~M9 재실행은 하지 않았다.
| 모듈 | 좁은 수정 | 검증 |
|---|---|---|
| M3 | marker 식별 불가·모형 밖 값 차단 | M3/M6 30개 테스트 |
| M6 | 빈 군집 포함 최소 비중 집계 | 동일 검증 묶음 |
| M8 | 누락 p 가족 크기, 분산0 미정의 처리 | M8/M9 65개 테스트 |
| M9 | 빈 층을 0 대신 NaN 전파 | 동일 검증 묶음 |
자료종별 지위 구분
G
실제 사람 자료와 대조
사람 자료가 있다는 사실만으로 모든 비교가 가능해지지는 않는다.
온라인 자발 참여자료
1,292명은
국민 대표 표본이 아니다
원본 1,303 중 기존 필터의 usable은 1,292다.
| 특성 | 확인 | 함의 |
|---|---|---|
| 모집 | 온라인 자발 참여 | 자기선택 편향 |
| 연령 | 30대·40대 비중 큼 | 합성 프레임과 구성 차이 |
| 문항 | P2B1~7 개방형 | OPEN7 제한 대응 |
| 척도 | 동일 6축 없음 | 인간-AI 축 분산비 미식별 |
탐색 진단 | 선택 비대칭
같은 필터를 적용해도
같은 영향을 주지 않는다
최소 응답 길이와 반복문자 규칙은 사람을 훨씬 더 많이 제외했다.
| 집단 | 선택 단계 | 남은 응답자 |
|---|---|---|
| 사람 | 원본 | 1303 |
| 사람 | 기존 usable | 1292 |
| 사람 | 공통 길이·반복문자 통과 | 726 |
| 사람 | 공통 6층 | 573 |
| 합성 r3 | 공통 규칙 통과 | 1000 |
| 합성 r3 | 공통 6층 | 855 |
탐색분석 | 정식 판정 미완
M9는 공통층에서
주제 언급 차이를 본다
인구 구성을 맞추는 것과 문체·코딩 차이를 제거하는 것은 다르다.
해석 상한
주제 차이는
곧 관심 차이가 아니다
생활어와 정책어, 응답 길이와 사전 누락이 함께 움직인다.
- 동일 키워드 사전은 재현성을 높이지만 내용 타당성을 보증하지 않는다.
- 층화와 가중은 선택·문체·측정오류를 모두 제거하지 못한다.
- 출처를 가린 이중코딩과 불일치 조정이 후속 과제다.
역사 비교 | 직접 추세추론 금지
‘2020 시계열’의 원자료는
2019 조사였다
보고서 연도와 조사 연도, 문구와 모집 방식을 함께 확인한다.
과거
2019년 조사. 일반인, 산업계, 전문가의 질문과 표본이 다르다.
현재
2026년 자발 참여자료. 기대·도전·우려의 문구가 과거와 완전 동일하지 않다.
09/08·09/09 수령 구분
워크숍 수령은
두 레인으로 나뉜다
개인 설문과 공동 산출물은 분석 단위와 연결 가능성이 다르다.
| 레인 | 자료 | 현재 지위 |
|---|---|---|
| 개인자료 | 사전·사후 설문, 현장 투표 등 | 수령 기록, 연결·동의 범위 검수 |
| 공동자료 | 월드카페 XLSX | 구조 추출 완료, 코딩 대기 |
| 공동자료 | 2045 청년의 하루 XLSX | 이야기·장면 추출, 코딩 대기 |
구조 추출 완료 | 코딩 미실행
161개 진술과 30장면은
191명의 응답이 아니다
행, 진술, 이야기, 장면의 중첩 구조를 그대로 보존했다.
| 산출 | 수량 | 지위 |
|---|---|---|
| 월드카페 | 진술 후보 161 | 포함 여부 hold |
| R4 행 | 5 | 예시 여부 unknown |
| 청년의 하루 | 이야기 10 | 공동작성 단위 |
| 장면 | 30 | 이야기 안에 중첩 |
| 구조 테스트 | 24/24 | 주제 타당화 검사 아님 |
질적 분석 설계
숙의 자료는
독립 설문처럼 셀 수 없다
자율선택, 상호 노출, 공동 작성과 앞선 활동의 영향이 있다.
- 월드카페의 3턴은 참가자 간 상호작용을 포함한다.
- 같은 이야기의 3장면은 독립 관측이 아니다.
- 두 워크북의 일치도 순차 의존을 가진다. 독립 확증 두 개가 아니다.
후속 과제
H
무엇을 남기고, 무엇을 더 검증할까
계산 결과의 양보다, 주장과 증거의 연결을 완결한다.
09/10 확인 상태
결정 원장은
권고와 승인을 나눈다
승인 범위를 좁게 읽어야 연구의 경계가 유지된다.
| 결정 | 확인된 상태 | 남은 것 |
|---|---|---|
| D01 / D17 | 축별 규칙·분석세트 승인 | T01 서명, T27 연결 |
| D02 | 추가 통제 실행 보류 | 분석 뒤 재상정 |
| D03 | 추가규칙 등록 방식 승인 | 세부값·실행 일괄승인 아님 |
| D05 | 레드팀 3회 완료 | 원탁회의 미착수 |
| D06 | 사용자 승인 | STEPI 승인·위임 대기 |
검증 계층
L0에서 L3까지
앞 단계가 뒤 단계를 보증하지 않는다
자료 건전성 → 생성 반복성 → 비교가능성 → 인간 기준과 정책 효용.
제안 | 미실행
후속 검증은
증분효과와 실패 조건을 겨냥한다
기존 데이터를 본 뒤 설계한 검증을 사전등록 결과라고 부르지 않는다.
후속 구성 | 완료로 세지 않음
원탁회의와 backcasting
생성물에서 정책근거까지의 간격
사각지대 후보를 곧바로 공식 과제로 승격하지 않는다.
산출물 경계
납품 준비는
연구 결과의 승격과 별개다
볼트, 보고서, 발표덱이 같은 허가된 지표와 근거를 가리켜야 한다.
| 산출물 | 연결 원칙 | 현재 주의 |
|---|---|---|
| 보고서 | 허가된 metrics 릴리스 | 공식 결과 릴리스 미완 |
| 페르소나 볼트 | 카드↔문항↔증거 | 시연 존재≠결과 승인 |
| 발표덱 | 동일 주장·분모·상태 | 공개 발표본, 분석 검증 중 |
| HWPX / PDF | 형식 변환·시각 검수 | 기관 양식·인수 별도 |
연구 기여의 범위
이 연구가 지금
확실히 남긴 것
성공 순위 하나보다, 생성계를 검증 가능한 대상으로 만든 구조가 남는다.
주요 근거 안내
출처를 따라가면
주장도 되돌릴 수 있어야 한다
외부 연구, 역사 실험, 최신 실행과 내부 진단을 분리했다.
| 층 | 주요 근거 |
|---|---|
| 외부 원문 | NVIDIA 카드, Stanford 2023·2024v1·2026v3, MIT LPM·Future You |
| 역사 실험 | 파일럿47, 트윈42, gradient60 |
| 설계·실행 | 문항53, 실행68, 동결 명부, 계획85 |
| 최신 검토 | ICC5000 09/09, 워크숍93, 경계조건94 |
| 숫자 주입 | 원본 JSON 또는 보존된 진단 표의 지정 행 |
연구총괄 | 탐색분석·검증 중
사람을 대신하지 않고
사람에게 묻는 일을 개선한다
합성 페르소나의 가치는 답의 양이 아니라, 더 나은 질문과 검증 가능한 한계다.
확인 / 잠정 / 다음 검증
구축한 것은 검증의 기반
남은 것은 사람과 효용의 증거다
반복 가능한 생성계, 실패조건 지도, 후속 질문의 후보를 다음 검증으로 연결한다.
CMDSPACE Works | 실제 화면
기업교육과 코칭
기업의 질문을 AI 활용의 출발점으로 바꿉니다.
- 임원 교육과 코칭으로 조직의 실제 문제를 확인합니다.
- 경영진과 현장이 함께 볼 성공 기준을 정합니다.
- 도구 설명을 지식 구조와 운영 책임으로 연결합니다.
공개 서비스 페이지의 경영진 정렬, 지식 구조화, 운영 책임 세 영역입니다. 고객명이나 개별 코칭 내용은 포함하지 않습니다.
https://cmdspace.work/#valueCMDSPACE Works | 실제 화면
지식운영 진단과 파일럿
한 부서의 실제 업무로 AI 지식운영의 조건을 확인합니다.
- 지식 원천, 핵심 업무, 보안 조건과 성공 기준을 진단합니다.
- 한 부서와 한 업무에 Context Pack(업무 맥락 묶음)과 LLM Wiki를 적용합니다.
- 파일럿 사용과 지표를 확인한 뒤 확산과 운영을 설계합니다.
문제 발견 → 기준선 진단 → 부서 파일럿 → 조직 확산 → 운영 정착의 공개 참여 모델입니다.
https://cmdspace.work/#programCMDSPACE Works | 실제 화면
Obsidian 에디터
생각을 읽고 고치는 작업 공간을 직접 운영합니다.
- 마크다운 본문에 주장과 근거를 함께 씁니다.
- 헤딩과 목록으로 사고의 구조를 드러냅니다.
- 완성 문서와 작업 중인 노트를 같은 지식 기반에서 연결합니다.
작성자의 실제 Obsidian에서 「포맷은 사고를 강제한다」를 연 에디터입니다. 줄 번호, 제목과 본문이 보입니다. 공개 URL은 교육 주제 소개이며 개인 볼트 접속 주소가 아닙니다.
https://cmdspace.work/#topicsCMDSPACE Works | 실제 화면
Obsidian 그래프
노트 사이의 연결을 눈으로 확인합니다.
- 위키링크가 노트 사이의 실제 연결을 만듭니다.
- 전체 연결망을 살펴보고 필요하면 검색 필터로 범위를 좁힙니다.
- 그래프는 연결 탐색용 화면이며 지식의 질을 점수화한 결과가 아닙니다.
작성자의 실제 Obsidian 전체 그래프입니다. 노트명과 태그명을 숨기고 실제 노드와 연결선만 보여줍니다. 검색 필터 없이 렌더링한 지식망의 형태이며 노드 수나 지식의 질을 측정한 결과가 아닙니다. 개인 볼트 원문에 접근할 수 있는 화면은 아닙니다.
https://cmdspace.work/#topicsCMDSPACE Works | 실제 화면
Obsidian 메타데이터
내용뿐 아니라 의미와 출처를 필드로 남깁니다.
- type은 어떤 종류의 노트인지 알려줍니다.
- description과 tags는 검색과 재사용의 단서가 됩니다.
- 작성일과 출처는 근거를 다시 확인할 길을 남깁니다.
「포맷은 사고를 강제한다」의 실제 Properties 영역입니다. 노트 종류, 설명, 날짜, 태그와 출처가 표시됩니다. 이 화면은 모든 노트의 스키마 준수를 인증하지 않습니다.
https://cmdspace.work/#topicsCMDSPACE Works | 실제 화면
CmdMD
마크다운을 먼저 읽고 필요한 곳으로 보냅니다.
- 렌더링 미리보기로 시작하는 macOS 마크다운 에디터입니다.
- 원문, 분할, 미리보기 화면을 전환합니다.
- 템플릿과 라우팅 규칙으로 Obsidian 볼트에 보냅니다.
실제 앱의 DemoVault 예제입니다. 왼쪽은 파일 목록, 가운데는 원문, 오른쪽은 렌더링 미리보기입니다. 과거 공개 제품 캡처이며 현재 버전 번호를 뜻하지 않습니다.
https://cmdmd.cmdspace.workCMDSPACE Works | 실제 화면
CmdTrace
지난 AI 작업을 다시 찾고 이어갈 수 있게 합니다.
- AI 코딩 세션을 읽고 검색하는 macOS 앱입니다.
- 대화와 도구 실행 기록을 시간 흐름 안에서 봅니다.
- 흩어진 작업 기록을 다시 확인하는 인터페이스를 제공합니다.
CmdTrace 자체 소개 페이지를 개선하던 과거 세션을 실제 앱으로 읽는 화면입니다. 대화와 도구 실행 구분이 보입니다. 현재 세션이나 연구 원응답을 캡처한 것이 아닙니다.
https://cmdtrace.cmdspace.workCMDSPACE Works | 실제 화면
System Files
사람과 AI가 함께 따를 운영 규칙을 공개합니다.
- 기술 규칙, 시스템 철학, 표준과 탐색 지도를 문서로 나눕니다.
- 파일별 역할과 우선순위를 명시합니다.
- 자신의 지식관리 환경에 맞게 규칙을 가져와 조정할 수 있습니다.
공개 배포 대상 여섯 시스템 파일의 역할 카드입니다. 파일의 제목과 독자가 구분됩니다. 개인용 비공개 파일 본문은 포함하지 않습니다.
https://system.cmdspace.workCMDSPACE Works | 실제 화면
LLM Wiki
외부 자료를 다시 찾을 수 있는 연결된 지식으로 컴파일합니다.
- 원문을 보존하고 별도의 위키에 지식을 정리합니다.
- Ingest(수집과 컴파일), Query(질의), Lint(위생 점검)를 구분합니다.
- 사람의 노트와 LLM이 정리한 참고 지식의 역할을 나눕니다.
공개 LLM Wiki 사이트의 세 운영 작업 설명입니다. 원문에서 위키로, 위키에서 답변으로 이어지는 역할을 인터넷 없이 설명할 수 있습니다.
https://llm-wiki.cmdspace.workCMDSPACE Works | 실제 화면
CMDS 스타터킷
빈 폴더가 아니라 운영 규칙이 있는 볼트로 시작합니다.
- CMDS 폴더 구조와 기본 규칙을 포함한 Obsidian 템플릿입니다.
- Connect → Merge → Develop → Share 흐름을 따라 시작합니다.
- 자신의 용도에 맞게 내용을 채우고 규칙을 조정합니다.
공개 GitHub 저장소의 README 소개와 구성 설명입니다. 사용자 개인 볼트가 아닌 배포용 스타터킷입니다.
https://github.com/johnfkoo951/cmds-vaultCMDSPACE Works | 실제 화면
AKM Index
노트 수가 아니라 작동하는 지식관리 시스템을 점검합니다.
- 프롬프트, 컨텍스트, 하네스, 루프, 상호운용성과 거버넌스를 살펴봅니다.
- 다섯 필러와 25개 기준에 행동과 증거를 대응합니다.
- 자기보고와 실제 파일, 설정, 날짜 있는 기록을 구분합니다.
공개 루브릭의 다섯 평가 필러입니다. 각 필러가 지시, 지식 공급, 실행 환경, 반복 개선, 이식성과 운영 책임을 구분합니다. 임의 성능 인증이나 독립 검증 완료를 뜻하지 않습니다.
https://akm.cmdspace.workCMDSPACE Works | 실제 화면
9Yohan
전문 역할을 나누되 최종 판단과 조정은 하나로 모읍니다.
- 연구, 글쓰기, 교육, 창작 등 아홉 역할을 구분한 에이전트 설계입니다.
- 중앙 조정자가 요청을 나누고 결과를 합칩니다.
- 전문가 간 역할 분리와 최종 승인 책임을 명시합니다.
공개 아키텍처 사이트의 중앙 조정자와 아홉 전문 역할 연결도입니다. 실제 사이트 화면의 설계 설명이며 실시간 에이전트 가동 상태를 보여주는 대시보드가 아닙니다.
https://9yohan.cmdspace.workCMDSPACE Works | 실제 화면
CMDSPACE Apps
직접 만든 도구를 한곳에서 탐색합니다.
- macOS 앱, Obsidian 플러그인, 웹 플랫폼과 개발 도구를 모읍니다.
- 제품별 소개와 공개 링크를 따라갈 수 있습니다.
- 목록 등재와 실제 출시 상태는 구분해서 확인합니다.
공개 Apps 카탈로그의 소개 화면입니다. 전체 앱 수와 라이브 수는 빠르게 달라지므로 크롭에서 제외했습니다.
https://apps.cmdspace.workCMDSPACE Works | 실제 화면
더배러
성장과 지식 활용의 생각을 뉴스레터로 나눕니다.
- 어제보다 더 나은 우리를 주제로 콘텐츠를 전합니다.
- 공개 아카이브에서 지난 글을 읽을 수 있습니다.
- 구독 페이지에서 이후 발행 소식을 받을 수 있습니다.
더배러의 실제 공개 뉴스레터 소개와 구독 화면입니다. 최근 글 목록은 제3자 이메일이 표시된 카드가 있어 포함하지 않았습니다.
https://thebetter.stibee.com/CMDSPACE Works | 실제 화면
월간옵시디언
실제 지식관리 경험을 지속적으로 함께 배우는 자리입니다.
- Obsidian과 지식관리 주제를 정기적으로 다룹니다.
- 도구 활용과 AI 연결 사례를 함께 살펴봅니다.
- 참여 조건과 최신 일정은 공식 안내에서 확인합니다.
공식 클래스 사이트의 월간옵시디언 멤버십 소개 이미지와 제목입니다. 결제 정보, 개인 수강 내역, 지난 일정을 다음 일정처럼 보여주는 영역은 제외했습니다.
https://pbl.to/MrSU8PCMDSPACE Works | 실제 화면
CMDSPACE Share
노트를 웹으로 공유하고 공유 이후도 관리합니다.
- Obsidian 노트를 공개 링크로 공유하는 플러그인입니다.
- 공유 페이지에 목차와 로컬 그래프를 제공합니다.
- 만료, 철회와 선택적 암호화 지원은 사용 백엔드의 기능을 확인해야 합니다.
공개 저장소의 기능 설명입니다. 실제 관리 대시보드나 고객 공유 목록이 아니라 공개 README를 캡처했습니다. CMDSPACE 운영 서버를 모든 사용자가 쓸 수 있다는 뜻은 아닙니다.
https://github.com/johnfkoo951/cmds-share자료와 연락처
자료를 다시 보고
다음 질문을 이어가세요
구요한 | CMDSPACE | johnfkoo951@gmail.com