---
url: https://github.com/vectorize-io/hindsight
title: "Hindsight: Agent Memory That Learns"
creative_title: "기억만 하는 AI에서 되돌아보고 배우는 AI로, Hindsight"
source: vectorize-io/hindsight (GitHub, MIT 라이선스)
curated_by: "다비(https://davi.kr/)"
date: 2026-09-23
purpose: AI 에이전트용 오픈소스 기억 시스템 Hindsight의 개념, 성능, 한계를 쉽게 정리하고 바로 써볼 수 있는 방법을 제시
---

# 기억만 하는 AI에서 되돌아보고 배우는 AI로, Hindsight

원문: https://github.com/vectorize-io/hindsight
정리: [다비(davi.kr)](https://davi.kr/)

> 이 문서는 AI 에이전트에 "배우는 기억"을 붙이는 오픈소스 Hindsight를 중학생도 이해할 수 있게 요약하고, 강의와 업무에 바로 적용할 방법을 정리한 자료입니다.

## 쉬운 설명

ChatGPT 같은 AI는 대화창을 닫으면 앞에서 한 이야기를 잊어버립니다. Hindsight는 AI에게 "공책"을 달아주는 도구입니다. 그런데 단순히 적어두는 공책이 아니라, 적어둔 내용을 다시 읽고 "아, 이 사람은 이런 걸 좋아하는구나" 하고 생각을 정리하는 공책입니다. Vectorize.io가 만들었고, 누구나 무료로 쓸 수 있는 MIT 라이선스 오픈소스이며, GitHub 별(Star)이 22.1k개입니다.

기억은 4종류로 나눠 저장합니다. 세상에 대한 사실(World facts), AI 자신의 경험(Experiences), 여러 기억을 모아 만든 믿음(Observations), 그리고 이를 종합한 이해(Mental models)입니다. 사용법은 동작 3개가 전부입니다. `retain`(저장하기), `recall`(찾아오기), `reflect`(곰곰이 생각하기)입니다. recall은 뜻으로 찾기, 단어로 찾기, 관계로 찾기, 시간으로 찾기를 동시에 4가지 방식으로 돌린 뒤 가장 알맞은 답을 고릅니다. 긴 대화 기억력 시험인 LongMemEval에서 91.4%를 기록했다고 발표했습니다(Gemini 3 Pro Preview 사용 시).

## 핵심 메시지

AI 에이전트의 성능 병목은 모델이 아니라 기억입니다. Hindsight는 기억을 쌓는 데서 멈추지 않고 되돌아보며 믿음을 고쳐 나가게 만들어, 여러 세션에 걸친 질문 정답률을 21.1%에서 79.7%로 끌어올렸다고 보고했습니다.

## 핵심 키워드

Hindsight, Agent Memory, retain / recall / reflect, LongMemEval 91.4%, Mental Models, MCP, RAG 대안, MIT 오픈소스

## 활용 방법

가장 쉬운 방법부터 순서대로 적었습니다.

1. **Claude Code에 기억 붙이기 (5분)**
   터미널에서 `npx @vectorize-io/hindsight-coding-agents install claude-code`를 실행하십시오. git 기록과 지난 작업을 자동으로 기억해, 매번 프로젝트 설명을 반복하지 않아도 됩니다.
2. **Docker로 내 PC에 서버 띄우기 (10분)**
   OpenAI API 키를 넣고 README의 `docker run` 한 줄을 실행하십시오. 화면은 `localhost:9999`, API는 `localhost:8888`입니다. Claude Pro/Max 구독이 있으면 `claude-code` 제공자로 API 키 없이 연결됩니다.
3. **기존 챗봇에 2줄로 기억 추가하기**
   `pip install hindsight-litellm` 후 `wrap_openai()`로 기존 OpenAI 클라이언트를 감싸십시오. 질문 전에 기억을 찾고, 답변 후 대화를 저장하는 과정이 자동으로 붙습니다.
4. **MCP로 여러 도구에서 같은 기억 쓰기**
   `http://localhost:8888/mcp/{bank_id}/` 주소를 MCP 클라이언트에 등록하십시오. retain, recall, reflect가 도구로 나타납니다.
5. **수업 시연용 비교 실습 만들기**
   같은 질문을 "기억 없는 챗봇"과 "Hindsight 붙인 챗봇"에 3회 세션에 나눠 던지고 답을 비교하게 하십시오. 수강생이 RAG와 에이전트 메모리의 차이를 눈으로 확인합니다.

쓰지 말아야 할 경우도 있습니다. README가 직접 밝히듯 n8n으로 만든 단순 자동화에는 과한 도구입니다. 기억 저장에도 LLM 호출이 들어가므로 비용이 늘어납니다.

## 전문가 의견 (사실 기반)

### 강점

- 4가지 검색 방식을 병렬로 돌리고 재정렬(reranking)하는 구조라 "언제 무슨 일이 있었나" 같은 시간 질문에 강합니다. 보고된 시간 추론 정답률은 31.6%에서 79.7%로 올랐습니다.
- 통합 범위가 넓습니다. LLM 제공자 25개 이상, 통합 60개 이상(Claude Code, Cursor, LangGraph, n8n, Dify 등)을 지원합니다.
- 기억 은행(bank)끼리 완전히 분리되고, 비밀번호와 개인정보를 45개 패턴으로 걸러내는 Memory Defense 옵션이 있습니다.
- 작은 오픈 모델에서도 성능이 유지된다고 보고했습니다. GPT-OSS 120B 85.67%, 20B 83.18%입니다.

### 한계와 주의점

- "독립 검증"이라는 표현을 그대로 믿지 마십시오. 검증에 참여한 Virginia Tech와 The Washington Post는 보도자료상 공동 연구 협력자입니다. 제3자 검증으로 보기 어렵습니다.
- 경쟁 제품 점수(Supermemory 81.6%, Zep 63.8%, Mem0 49.0%)는 Vectorize 블로그가 인용한 수치이며, README도 다른 점수는 각 업체 자체 발표라고 밝힙니다.
- 공식 블로그 한 글 안에서 LongMemEval 점수가 94.6%와 91.4%로 다르게 적혀 있습니다. 인용할 때는 91.4%만 쓰십시오.
- 더 어려운 벤치마크에서는 점수가 크게 떨어집니다. 2026년 LifeBench 논문에서 Hindsight는 40.99%로 2위였고, 1위 MemOS는 55.22%였습니다. 기존 벤치마크가 이미 쉬워졌다는 뜻입니다.
- 최고 점수는 Gemini 3 Pro Preview라는 고가 모델 기준입니다. 저렴한 모델로 바꾸면 5~8%p 낮아집니다.

## Bottom Line

여러 번 대화하며 사용자를 기억해야 하는 에이전트를 만든다면 Hindsight는 현재 가장 먼저 시험해볼 오픈소스입니다. 다만 91.4%는 회사 측 발표 수치로 보고, 내 데이터로 직접 재보셔야 합니다. 오늘 Claude Code에 설치 명령 한 줄을 실행하고, 지금 당장 시작하십시오.

---

참고 자료
- GitHub: https://github.com/vectorize-io/hindsight
- 공식 문서: https://hindsight.vectorize.io
- 논문: https://arxiv.org/abs/2512.12818
- LifeBench 논문: https://arxiv.org/pdf/2603.03781

정리 [다비(davi.kr)](https://davi.kr/)
