---
원제: "WikiSkill: 에이전트의 실행 경험을 위키에 쌓아 스킬을 진화시키는 3계층 구조에 대한 연구"
창작 제목: "AI의 오답노트: 스킬은 지우고 배움은 남긴다"
출처: https://discuss.pytorch.kr/t/wikiskill-3/11772
논문: https://arxiv.org/abs/2608.27454 (Google Research · Virginia Tech, 2026-08-27)
정리: 다비(davi.kr)
정리일: 2026-09-01
문서의 목적: WikiSkill 논문의 핵심 구조와 실측 수치를 중학생 수준의 언어로 정리하고, 실무에 바로 적용할 방법을 제시한다.
---

> 🔗 원문: <https://discuss.pytorch.kr/t/wikiskill-3/11772>

# AI의 오답노트: 스킬은 지우고 배움은 남긴다

## 쉬운 설명

AI 에이전트에게 요령을 알려줘도, 그 요령이 어디에도 적혀 있지 않으면 내일 또 알려줘야 합니다. **WikiSkill**은 이 문제를 작업 공간을 **3계층으로 쪼개서** 풉니다. 맨 아래 **원본 계층(raw)** 은 실행 기록을 손대지 않고 그대로 보관하고, 가운데 **위키 계층(wiki)** 은 그 기록에서 "무엇이 왜 실패했고 어떻게 고쳤는지"를 패턴 문서로 뽑아 쌓으며, 맨 위 **스킬 계층(skills)** 은 실제로 실행되는 절차 문서(`SKILL.md`)를 담습니다.

핵심은 **되돌리기 규칙**입니다. 새로 만든 스킬은 검증 점수가 오르지 않으면 즉시 취소(롤백)되지만, **위키는 절대 지우지 않습니다.** 그래서 실패한 시도조차 "이 방향은 이미 해봤고 안 됐다"는 기록으로 남아 다음 제안이 같은 실수를 반복하지 않습니다. 결과는 분명했습니다. 5개 모델 전부에서 기존 방식(EvoSkill·Trace2Skill·SkillOpt)을 앞섰고, Gemini-3.5-Flash는 평균 정확도가 **49.5% → 68.1%**, Qwen-3.6-27B는 스프레드시트 과제에서 **40.8% → 81.7%** 로 두 배 넘게 올랐습니다.

## 활용 방법

지금 쓰는 AI 도구 폴더 옆에 **`wiki/` 폴더 하나를 더 만드는 것**부터 시작하십시오. 별도 프레임워크 없이 오늘 바로 됩니다.

- `wiki/patterns/`에 실패 사례를 **10~30줄**로 기록하십시오. 문제 → 근본 원인 → 정확한 명령어 → 해법 순서를 지키십시오.
- `wiki/index.md`에 패턴당 **한 줄**로 색인하십시오. 형식은 `- [패턴명](경로): 문제 + 원인 + 해법`. 이 한 줄이 전체 문서를 열어볼지를 결정하므로 가장 공들여 쓰십시오.
- `wiki/skill-impact.md`에 **거절된 수정안까지 전부** 남기십시오. 실패 기록이 다음 제안의 나침반이 됩니다.
- 규칙을 고칠 때는 새로 쓰지 말고 **기존 문서를 패치**하십시오. 논문은 `append`/`replace`/`insert_after` 세 연산만 허용합니다.
- `SKILL.md`에는 "언제 쓸지"뿐 아니라 **"언제 쓰지 말지"** 를 반드시 함께 적으십시오.

## 전문가 의견 (사실 기반)

제거 실험이 위키의 값어치를 정확히 증명합니다. 스킬 제안자가 위키를 못 보게 하면 평균이 **63.7% → 45.3%/48.7%** 로 **15.0~18.4점** 떨어집니다. 성능의 대부분이 지식 계층에서 나온다는 뜻입니다. 반대로 실행 에이전트에게 위키를 열어주면 오히려 **63.7% → 60.9%** 로 손해입니다. 학습 실행은 "스킬만으로 얼마나 되는지" 재는 자리여야 하기 때문입니다.

더 흥미로운 건 **교차 모델 전이**입니다. 자기가 만든 스킬이 단독 1위인 칸은 24개 중 **9개뿐**이고, **13개 칸에서 남의 모델이 만든 스킬이 더 나았습니다.** Qwen-3.5-4B가 만든 스킬은 자기 OfficeQA 점수를 30.2%→28.5%로 떨어뜨리면서 Qwen-3.6-27B는 42.1%→52.9%로 올렸습니다. **지식을 발견하는 능력과 실행하는 능력은 별개**라는 증거입니다.

다만 냉정하게 볼 지점도 있습니다. 25개 모델-벤치마크 조합 중 WikiSkill이 진 칸이 5개이고 그중 3개가 OfficeQA입니다. Gemini-3.5-Flash의 스프레드시트 과제에 Qwen-3.5-4B 스킬을 넣자 50.5% → **18.1%** 로 폭락한 음의 전이(negative transfer)도 있습니다. 작은 모델이 만든 저수준 우회책이 큰 모델의 발목을 잡은 것입니다. 여기에 **구현 코드는 미공개**이고, 위키를 정리(pruning)하는 장치도 아직 없습니다.

## Bottom Line

프레임워크를 기다리지 마십시오. **오늘 `wiki/patterns/` 폴더를 만들고 이번 주 실패 사례 세 건을 10~30줄로 기록하는 것**이 이 논문의 63.7% 대 45.3%를 재현하는 첫걸음입니다. 규칙은 실패하면 지우되, 배운 것은 절대 지우지 마십시오. 지금 시작하십시오.

---

*정리: 다비(davi.kr)*
