---
원제: AI 에이전트들로 만든 외계 행성 문명 생성 시뮬레이션 공개
창작 제목: "AI는 문명을 발견했을까, 외운 걸 읊었을까"
출처: https://discuss.pytorch.kr/t/ai/11777
라이브 데모: https://huggingface.co/spaces/VIDraft/ai-world
제작: VIDRAFT · CIVOS
정리: 다비(davi.kr)
정리일: 2026-09-01
태그: AI에이전트, 멀티에이전트, 창발, 암송, 대조군실험, 허깅페이스
---

> **문서의 목적**: 멀티에이전트 시뮬레이션에서 나타나는 '문명의 창발'이 진짜 탐색의 결과인지, 아니면 LLM이 학습한 인류사를 그대로 읊은 것인지를 대조군 실험으로 검증한 CIVOS 연구를 쉽게 정리한다.

# AI는 문명을 발견했을까, 외운 걸 읊었을까

원문: <https://discuss.pytorch.kr/t/ai/11777>

---

## 쉬운 설명

AI 에이전트 수천 개를 가상 세계에 풀어놓으면 사회가 만들어지고 역할이 나뉘고 문명이 발전합니다. 그런데 여기엔 함정이 있습니다. 그 AI를 움직이는 언어모델은 **이미 인류 역사를 다 배운 상태**입니다. 돌을 깨서 날을 세우고, 불이 농사보다 먼저였다는 것을 이미 알고 있죠. 그러니 AI가 스스로 알아낸 것인지(**창발, H1**), 배운 걸 그대로 재생한 것인지(**암송, H2**) 겉으로는 구분이 안 됩니다.

VIDRAFT의 **CIVOS**는 이걸 가르기 위해 실험 조건을 4개로 나눴습니다. 문제의 구조는 똑같이 두고 **사전지식만** 바꾼 겁니다 — ①지식 온전 ②지식 제거 ③지식 오염(일부러 틀리게) ④LLM 없는 무작위 바닥. 조건당 **40개 시드**로 짝지어 비교하고, **20만 번 리샘플링** 순열검정에 다중비교 보정까지 했습니다. 결과는 이렇습니다. 지식을 없애면 발견이 눈에 띄게 무너졌고, **틀린 지식은 아예 모르는 것보다 더 나빴습니다**(40시드 중 40개, 37개에서 각각 성립). 그리고 지식이 온전한 판은 시드를 바꿔도 결과가 거의 흔들리지 않았습니다. 진짜 탐색이라면 매번 달라져야 하는데 말이죠. 이건 "매번 같은 걸 꺼내온다", 즉 **회상(recall)의 흔적**입니다.

## 활용 방법

- **직접 돌려보세요.** 허깅페이스 Space [VIDraft/ai-world](https://huggingface.co/spaces/VIDraft/ai-world)는 로그인 없이 공유 월드를 구경할 수 있습니다. 로그인하면 사용자명에서 뽑은 시드로 **나만의 행성**이 열리고, 도달 단계가 기록표에 오릅니다. 시간은 지구일 1일 = 2.4실초로 흐릅니다.
- **AI 실험 설계에 그대로 가져다 쓰세요.** "성능이 올랐다"를 주장하기 전에 **사전지식을 제거한 대조군**을 반드시 만드세요. 조건 하나만 바꾸는 통제 실험이 핵심입니다.
- **표본 수를 먼저 정하세요.** 이 팀은 6시드로 시작했다가 검정력이 **0.20**에 불과해(효과가 있어도 5번 중 4번 놓침) 없는 문제를 고치려 헛수고했습니다. 효과크기 dz≈0.48을 기준으로 40시드(검정력 ≈0.85)를 **사전 고정**한 뒤 다시 측정했습니다.

## 전문가 의견 (사실 기반)

이 연구의 진짜 가치는 화려한 시뮬레이션이 아니라 **실패를 기록했다는 점**에 있습니다. 팀은 두 번 틀렸고 그걸 다 공개했습니다. 한 번은 표본이 작아 **있는 효과를 없다고** 했고, 한 번은 보정을 안 해서 **없는 효과를 있다고** 했습니다(단독 p≈0.04였지만 4개 비교에 대한 Bonferroni α=0.0125를 넘지 못함). 방향은 반대지만 원인은 하나 — 이 분야의 통상 표본 크기로는 이 정도 효과를 분해할 수 없다는 것입니다.

설계 규율도 엄격합니다. **기술트리는 에이전트에게 절대 노출하지 않습니다**("사다리를 쥐어주는 순간 발견이 암송이 된다"). 단계는 재료가 아닌 **능력**으로 판정하고, 리더보드는 도달 단계와 함께 **행성 난이도를 반드시 병기**합니다 — 난이도 46.9의 험한 행성에서의 단계 4와 난이도 0에서의 단계 4는 같은 성취가 아니니까요. 물리는 유도값(중력 10.79 m/s²는 g=GM/R²에서 계산)과 가정값(생태 계수)을 명확히 구분하고, 가정값은 인과사슬이 도는지만 검증합니다.

한계도 스스로 밝힙니다. 결과는 **단일 모델 패밀리**에서만 나왔고, 과제 토폴로지와 프롬프트도 각각 하나뿐입니다. 두 번째 모델 패밀리 재현은 진행 중입니다. 지식제거 조건이 무작위 바닥을 이기는지는 양의 경향이 있으나 보정을 넘지 못해 **주장하지 않는다**고 명시했습니다. 조건 구성·판정 파이프라인·세계 생성은 특허 출원 관계로 비공개라, 외부 완전 재현은 아직 불가능하다는 점은 감안해야 합니다.

## Bottom Line

"AI가 창발했다"는 말이 나오면 이제 딱 한 가지만 물으세요 — **대조군은 어디 있습니까?** 창발이라 불린 것의 상당 부분은 회상일 수 있고, 그걸 가르는 순간 숫자가 바뀝니다. 지금 당장 [ai-world](https://huggingface.co/spaces/VIDraft/ai-world)에서 행성 하나를 열어보고, 진행 중인 여러분의 AI 실험에 사전지식 제거 조건과 표본 수 사전 고정을 오늘 안에 추가하십시오.

---

*정리: 다비(davi.kr)*
