생성형 AI 활용
연구 데이터 분석 — 실습 가이드
구요한 (커맨드스페이스) · Day 1: 내 연구 데이터의 재현 가능한 분석 하네스 만들기 · Day 2: 연구 지식의 LLM Wiki 구축. 이 페이지 하나로 실습 키트 다운로드부터 단계별 프롬프트 복사까지 해결됩니다.
1. 실습 키트 받기
본인 연구 데이터가 없어도 끝까지 따라올 수 있는 더미데이터 키트입니다.
⬇ postech-practice-kit.zip (38KB) 📄 강의자료 보기
2. 환경 준비 (경로 A만 · 한 번만)
체크포인트 ④⑤의 코드 실행에 필요한 Python 패키지. 경로 B는 건너뜁니다.
pip install pandas scipy statsmodels matplotlib
3. 실습 — 5개 체크포인트
각 단계의 프롬프트를 복사해 붙여넣고, 통과 기준을 확인한 뒤 Zoom 채팅창에 "① 완료"처럼 남겨 주세요. 경로 A는 키트 폴더에서 그대로, 경로 B는 CSV(data/experiment_nanoparticle.csv)를 먼저 업로드하고 진행합니다.
데이터 구조 파악 — AI는 시키는 만큼만 의심한다
data/experiment_nanoparticle.csv 의 구조를 파악해줘. 컬럼별 타입, 결측, 이상해 보이는 값을 표로 정리해.
통과 기준 — AI가 스스로 4가지를 찾으면 통과: 날짜 포맷 3종 혼재 · 촉매 표기 불일치(A/a/Cat-A/촉매A) · 온도에 켈빈 혼입("353.4K") · 소수점 누락 10배 이상치
못 찾으면 의심을 지시하세요:
이 데이터는 3명이 입력했어. 표기 불일치와 단위 혼입 가능성을 의심하고 다시 봐.
정리·전처리 — 원본 불변 · 코드로 · 로그
발견한 문제를 모두 정리하는 전처리 코드를 작성하고 실행해. 단, 각 정리 단계마다 몇 행이 영향을 받았는지 로그로 남겨. 원본은 절대 덮어쓰지 말고 data/clean/ 에 저장해.
- 경로 B: "실행해" 대신 "코드를 작성해줘" → 받아서 로컬에서 실행하거나, 챗 내 코드 실행 기능 사용
통과 기준 — clean_experiment.csv 생성 + "무엇을 몇 건 고쳤는지" 요약. 손으로 엑셀에서 고치면 재현성이 끝납니다.
분석 방향 설정 — AI는 후보를 내고, 선택은 연구자가
연구질문: "어떤 조건에서 40nm 이하 입자를 수율 85% 이상으로 얻는가?" 이 질문에 적합한 분석 기법 후보 2~3개를 각각의 가정·한계와 함께 제안해. 아직 실행하지 마.
통과 기준 — AI가 기법을 "하나 골라주는" 게 아니라 가정·한계를 붙여 후보를 제시하고, 선택은 내가 합니다.
분석 코드 작성·실행·디버깅
③에서 내가 고른 방법으로 분석 코드를 작성하고 실행해. 에러가 나면 스스로 고치고, 최종 결과만 보고해.
통과 기준 — 촉매 효과·온도 효과가 통계적으로 확인됨. 이 데이터에는 신호가 심어져 있으니, 안 나오면 전처리 단계를 의심하세요.
해석 + 논문용 표·그래프 — 같은 결과, 세 개의 얼굴
결과를 (1) 논문 Results 단락 초안 3~4문장 (2) 학회 발표용 그래프 1장 (3) 지도교수께 보고할 요약 3줄, 세 가지 버전으로 정리해. 그래프는 figures/ 에 PNG로 저장.
통과 기준 — 같은 결과가 목적별로 다른 형태로 나옴. 분석과 전달의 분리.
하네스로 고정 — 말로 한 지시를 파일로 박제
키트의 CLAUDE.md를 열어보세요. 오늘 ①~⑤에서 매번 말로 지시한 규칙들(원본 불변·로그·가정 확인·효과 크기 병기·그래프 규칙)이 파일로 박제되어 있습니다. 마지막 요청:
오늘 우리가 정한 분석 규칙을 CLAUDE.md 에 우리 랩 버전으로 갱신해줘.
- 오늘 밤 할 일: 본인 연구 폴더에 랩 버전 CLAUDE.md 한 장 (30분). Codex는 같은 내용을 AGENTS.md로.
- 웹 챗만 쓰는 경우: Claude/ChatGPT Projects 지침에 같은 내용 저장 = 절반의 하네스.
4. v1 · v2 · v3 — 시연 프롬프트 (직접 체험)
강의 앞부분 "같은 데이터, 세 개의 답" 시연에 쓴 프롬프트 3종. 시간이 남으면 직접 비교해 보세요.
실험 데이터 분석해줘.
연구질문에 답해줘: 어떤 조건에서 40nm 이하 입자를 수율 85% 이상으로 얻을 수 있어?
맥락을 다 실어 물어보기 — 이번 한 번은 정확, 매번 재입력
너는 재료공학 연구실의 데이터 분석 조교다. [데이터 배경] - 첨부한 experiment_nanoparticle.csv 는 나노입자 합성 실험 기록이다. - 3명의 학생이 두 달간 번갈아 입력해서 표기 불일치가 있을 수 있다. - 컬럼: sample_id, 합성일, Temp_C(°C), pH, reaction_time_min(분), catalyst(A/B/C), particle_size_nm(반응변수), yield(%)(반응변수), 측정장비, 기록자, 비고 [연구 질문] - 어떤 조건(온도·시간·촉매·pH)에서 40nm 이하 입자를 수율 85% 이상으로 얻는가? [작업 규칙] - 먼저 데이터 품질 문제(결측·단위 혼입·표기 불일치·이상치)를 전수 점검하고 표로 보고할 것 - 원본을 수정하지 말고 정리 과정을 코드로 보여줄 것 - 통계 검정은 가정 확인과 함께, p-값과 효과 크기를 같이 보고할 것 - 결과는 (1) 요약 3줄 (2) 상세 분석 (3) 논문용 그래프 제안 순서로 이 규칙대로 분석을 시작해.
