---
title: "구글, AI 문제 해결에 '재귀적 자기개선' 도입...탐색 비용 162배 절감"
creative_title: "실패한 길은 다시 걷지 않는다: 구글 AI가 '꿈'으로 연습하는 법"
source: "AI타임스, 박찬 기자 (2026-09-18)"
url: https://www.aitimes.com/news/articleView.html?idxno=215459
paper: https://arxiv.org/abs/2609.14858
curator: "다비(davi.kr)"
created: 2026-09-19
purpose: "구글 드림-RSI 기사를 중학생 눈높이로 요약하고, 기사 수치를 원 논문 저장소와 대조해 바로 쓸 수 있는 활용법을 정리"
tags: [드림-RSI, 재귀적자기개선, 발견트리, 리플레이시뮬레이터, AI에이전트, 구글딥마인드]
---

원문: https://www.aitimes.com/news/articleView.html?idxno=215459

<sub>정리 [다비(davi.kr)](https://davi.kr/)</sub>

# 실패한 길은 다시 걷지 않는다: 구글 AI가 '꿈'으로 연습하는 법

## Core Message

구글의 드림-RSI는 AI가 지나온 시행착오 기록을 '연습장'으로 재사용해, 코드를 다시 돌리지 않고 수천 개의 새 전략을 미리 시험합니다. 모델을 재학습하지 않고 탐색 전략만 고쳐 연산 비용을 줄이는 방식입니다.

## Core Keywords

#드림-RSI #재귀적자기개선 #발견트리 #리플레이시뮬레이터 #AI에이전트 #탐색비용

## 쉬운 설명

AI 코딩 에이전트는 어려운 문제를 풀 때 "이렇게 해볼까?"를 수천 번 시도합니다. 그런데 이미 실패했던 길도 확인할 때마다 코드를 새로 돌려야 해서 컴퓨터 비용이 많이 듭니다. 구글, 구글 딥마인드, 메릴랜드대, 버지니아대 연구진 17명이 이 문제를 풀려고 드림-RSI(Dream-RSI)를 공개했습니다. RSI(재귀적 자기개선)는 AI가 자기 결과를 보고 다음 방법을 스스로 고치는 반복 구조를 뜻합니다.

비유하면 '미로 지도'입니다. AI는 지나온 선택과 실행 결과를 전부 발견 트리(Discovery Tree)라는 나무 모양 기록에 남깁니다. 새 전략을 시험할 때는 미로를 다시 걷지 않고 지도만 보며 "이 길로 갔다면?"을 계산합니다. 연구진은 이 단계를 '꿈(Dreaming)'이라 부릅니다. 꿈에서 가장 좋았던 전략만 실제로 실행하고, 그 결과가 다시 새 지도가 됩니다. AI 모델 자체는 한 번도 재학습하지 않습니다.

## 주요 수치 (기사 기준)

| 실험 | 결과 |
|---|---|
| 라쏘(Lasso) 탐색, 제미나이-3.1-프로 | 실행 시간 3587.1ms → 2931.0ms, 호출 550회 → 317회 |
| 라쏘 탐색, 제미나이-3.7-플래시 | 실행 시간 2516.7ms → 2350.6ms, 호출 3200회 → 1879회 |
| SimpleTES와 비교 | 비슷한 성과를 최대 162배 적은 호출로 달성 |
| GPU 커널 (같은 성능) | VGG16 2.43배, LayerNorm 1.79배 적은 생성 |
| GPU 커널 (같은 예산) | ConvDiv 2.09배, ConvMax 1.44배 높은 성능 |

평가 과제는 알고리즘 엔지니어링, 수학 최적화, GPU 커널 엔지니어링 등 8개입니다.

## 활용 방법

가장 쉬운 방법은 드림-RSI의 원리를 내 AI 작업에 그대로 옮기는 것입니다. 코드가 공개되지 않았으므로 원리부터 쓰십시오.

1. **시도 기록을 파일 하나로 모으십시오.** Claude Code, Codex 같은 에이전트에 시킨 작업의 프롬프트, 결과, 실패 이유를 날짜별로 `attempts.md`에 한 줄씩 남기십시오. 이것이 나만의 '발견 트리'입니다.
2. 새 방법을 돌리기 전에 기록부터 확인하십시오. 에이전트에게 "attempts.md에서 이미 실패한 방법은 제외하고 계획을 세워라"라고 지시하면 같은 실패에 드는 토큰과 시간을 줄일 수 있습니다.
3. 전략 A와 B를 비교할 때는 과거 결과 표 위에서 먼저 따져 보고, 가장 나은 하나만 실제로 실행하십시오.
4. 수업에서는 '미로 지도' 비유로 RSI를 설명하십시오. 과거 기록을 프롬프트에 넣는 방식과 시뮬레이터로 쓰는 방식의 차이를 보여 주기 좋은 사례입니다.
5. [GitHub 저장소](https://github.com/zhengkid/Dream-RSI)를 Watch로 등록해 두십시오. 전체 코드와 재현 스크립트가 공개되면 직접 검증할 수 있습니다.

## 전문가 의견 (사실 기반)

강점
- 모델 가중치를 바꾸지 않고(경사 하강 0회) 탐색 전략만 개선합니다. 재학습 비용이 들지 않아 기존 에이전트에 얹기 쉽습니다.
- 과거 경험을 요약 텍스트나 학습 데이터가 아닌 '실행 가능한 시뮬레이터'로 쓰는 발상이 새롭습니다. 이미 비용을 치른 결과를 다시 쓰는 구조라 논리가 명확합니다.

한계
- 제목의 '162배 절감'은 과장 소지가 있습니다. 라쏘 과제 하나에서 다른 시스템(SimpleTES)과 비교한 최대값입니다. 연구진 자체 기준선(고정 탐색) 대비로는 탐색 연산 1.74배 절감, 실행 속도 1.22배 개선입니다(GitHub README). 기사 본문의 550회 → 317회도 약 1.7배입니다.
- 발견 트리에 없는 영역은 시뮬레이션할 수 없습니다. 한 번도 가 보지 않은 길은 여전히 실제 실행이 필요합니다.
- 수학 최적화는 3개 과제 중 2개만 기준선 이상이었습니다. 모든 과제에서 앞선 것은 아닙니다.
- 2026-09-19 확인 기준 전체 코드와 재현 스크립트는 "준비 중"이며, 동료 심사 전 프리프린트입니다. 독립 재현 결과는 아직 없습니다.

## Bottom Line

드림-RSI는 "AI가 스스로 똑똑해진다"는 선언이 아니라 "실패 기록을 버리지 말고 다시 써라"는 비용 절감 기법입니다. 오늘 쓰는 AI 에이전트의 시도와 실패를 `attempts.md` 한 파일에 모으십시오. 지금 당장 시작하십시오.

## 참고
- 논문: [arXiv 2609.14858](https://arxiv.org/abs/2609.14858)
- 프로젝트 페이지: [dream-rsi.com](https://www.dream-rsi.com/)
- GitHub: [zhengkid/Dream-RSI](https://github.com/zhengkid/Dream-RSI)
