쉬운 설명
학교 성적을 올리는 방법을 한번 떠올려 보세요. 공부 도구나 계획표를 바꿀 수도 있고, 머릿속 실력 자체를 키울 수도 있죠. 채점 기준을 더 깐깐하고 정확하게 만들 수도 있고, 공부하는 방식 전체를 완전히 새로 짤 수도 있습니다.
'AI가 스스로 발전한다'는 말도 똑같습니다. 겉보기엔 다 같은 말처럼 들려도, 실제로는 이 네 가지 중 무엇이 좋아졌느냐에 따라 의미가 완전히 달라지거든요. 그래서 "스스로 좋아졌나요?"라고 묻기보다는 "구체적으로 무엇이 좋아졌나요?"라고 따져보는 것이 훨씬 중요합니다.

요약
원문에서는 '재귀적 자기개선(RSI)', 즉 AI가 자신의 일부를 스스로 개선하고 그렇게 나아진 버전이 다시 다음 개선을 이끄는 순환 과정을 네 개 층으로 나누어 설명합니다.
첫째는 모델을 둘러싼 '작업 틀'(프롬프트, 도구, 메모리, 작업 흐름)입니다. 둘째는 모델의 '가중치 자체'이고, 셋째는 모델의 결과물을 채점하는 '채점기'입니다. 마지막 넷째는 모델을 만들어내는 '연구 과정' 전체예요. 2026년 RSI 논문 약 1,250편을 정리한 한 서베이 논문은 이 분야를 '무엇을 개선하는가'와 '그 순환 고리가 얼마나 닫혀 있는가'라는 두 가지 축으로 나눈다고 하는데요, 원문은 그중 첫 번째 축을 비교표로 알기 쉽게 풀었습니다.
대표적인 사례로는 구글의 RRSI가 꼽힙니다. 모델 가중치는 그대로 둔 채 작업 틀만 진화시켰는데도, Terminal-Bench 2.1 점수가 74.2점에서 80.2점으로 껑충 뛰었습니다. 심지어 개선안을 고를 때 쓰지 않았던 다른 벤치마크에서도 점수가 2~5점 올랐다고 보고했죠.
원문은 개선 고리 자체보다 과적합을 막아주는 규제 장치가 더 흥미롭다고 짚습니다. 이런 장치가 없으면 단순한 잡음(노이즈)을 성능 향상으로 착각하기 쉽기 때문입니다. 결국 층마다 만들어내는 결과물도, 실패하는 방식도, 이를 증명하는 데 필요한 증거도 모두 다르다는 점이 핵심입니다.
활용 포인트
'스스로 발전하는 AI'라는 기사나 제품 출시 소식을 볼 때 좋은 체크리스트로 활용할 수 있습니다.
우선 어느 층이 바뀐 것인지 확인해 보세요. 모델 파일 자체가 바뀐 것인지, 아니면 프롬프트나 도구 구성만 바뀐 것인지 구분하는 식입니다. 예를 들어 팀에서 코딩 에이전트를 쓰고 계신다면, 모델은 그대로 두고 프롬프트나 도구 설정을 바꿔보며 성능을 비교하는 '작업 틀 개선'을 직접 시도해 볼 수 있습니다. 이때 개선안을 고를 때 썼던 테스트와는 다른, 별도의 테스트로도 결과를 꼭 확인해 보세요. 원문에서 말하는 '선택에 쓰지 않은 벤치마크'로 검증하는 방법입니다.
기획자나 학습자분들도 유용하게 응용할 수 있어요. AI로 글을 자동 채점하는 기능을 만든다면, 채점기를 개선한 뒤 학습에 쓰지 않았던 별도 샘플 50개를 골라 사람의 정답과 얼마나 일치하는지 비교해 보는 겁니다. 만약 더 잘 맞지 않는다면 실력이 늘어난 게 아니라 꼼수를 부리는 '보상 해킹' 위험이 있다는 뜻인데요, 이것이 바로 원문에서 제시하는 실무 검증법입니다. 아울러 성능 향상 폭이 평가 잡음 범위 안에 머문다면 그냥 '개선 없음(0)'으로 보는 습관을 들여보세요. 과장된 성능 마케팅에 휘둘리지 않는 좋은 방법이 됩니다.
주의 사항
이 글은 원문 한 편을 바탕으로 정리한 내용이며, 제시된 수치는 해당 논문 저자들이 직접 보고한 값입니다. 제3자에 의한 독립적인 재현 검증을 거친 결과는 아닙니다.
특히 연구 과정 자체를 개선하는 RSI는 가장 야심 찬 시도인 만큼 검증도 까다로워서, 독립적인 재현 결과가 나와야 믿을 만하다고 원문에서도 밝히고 있습니다. 또한 모델 자체를 개선하는 RSI는 한 바퀴 돌 때마다 얻는 향상 폭이 그리 크지 않은 편입니다. 만약 검증 절차가 헐거우면 AI가 스스로 만든 오류를 학습하면서 오히려 성능이 떨어질 수도 있습니다.
벤치마크 점수는 버전이나 평가 환경에 따라 달라질 수 있으니, 숫자 하나만 따로 떼어내 단순 비교하지 않도록 유의해 주세요.
자체 검증
네 개 층의 구분, RRSI 점수의 상승(74.2점에서 80.2점), 선택에 쓰지 않은 벤치마크에서의 +2~5점 상승, 모델 자체 RSI의 한계(나쁜 선생 문제), 채점기 개선을 확인하는 실무 검증법은 모두 원문에 명시된 내용입니다.
활용 포인트에서 언급한 구체적인 사례(샘플 50개 검증, 팀 내 코딩 에이전트 설정 비교)는 원문의 원칙을 알기 쉽게 돕고자 제가 덧붙인 예시이며 원문에 나온 내용은 아닙니다. 또한 원문에서도 과적합을 막는 규제 장치의 구체적인 목록은 생략되어 있어, 본문에서도 자세히 다루지 않았습니다.
태그
#AI #재귀적자기개선 #RSI #에이전트 #AI평가 #구글RRSI #LLM