---
url: https://discuss.pytorch.kr/t/clm-contrastive-lm-jev/12013
title: "CLM(Contrastive LM), 대조 학습을 통해 Jev와 같은 형식으로, 상태에 맞는 행동을 빠르게 선택하는 언어 모델"
creative_title: "쓰지 않고 고르기만 한다: Jev보다 최대 9배 빠른 오픈소스 판단 모델 CLM"
source: PyTorchKR (박정환, 2026-09-28)
curated_by: "다비(davi.kr) https://davi.kr/"
date: 2026-09-29
purpose: 오픈소스 System One 모델 CLM의 구조, 성능, 한계를 쉽게 정리하고 바로 써볼 방법을 제시
---

원문: https://discuss.pytorch.kr/t/clm-contrastive-lm-jev/12013

# 쓰지 않고 고르기만 한다: Jev보다 최대 9배 빠른 오픈소스 판단 모델 CLM

> 정리: [다비(davi.kr)](https://davi.kr/)

## 쉬운 설명

ChatGPT 같은 AI는 글자를 한 자씩 써서 답을 만듭니다. 그런데 AI 비서가 하는 일의 상당수는 "보기 중에 하나 고르기"입니다. 어떤 도구를 쓸지, 다음에 어떤 행동을 할지, 여러 답안 중 무엇이 맞는지 같은 일입니다. CLM(대조 언어 모델)은 글을 쓰지 않고 지금 상황과 각 보기가 얼마나 어울리는지 점수만 매겨 순위와 확률을 돌려주는 모델입니다. 상황과 보기를 각각 숫자 묶음(벡터)으로 바꾼 뒤 얼마나 가까운지 비교하는 방식입니다.

공개된 CLM-v0.1-8B는 Qwen3-8B를 그대로 두고 작은 부품(투영 헤드, 약 2,000만 파라미터, 다운로드 75MB)만 새로 학습했습니다. 학습은 질문과 답 6,000만 쌍, 그럴듯한 오답 3,000만 개, AI 에이전트 행동 기록 100만 개 순서로 진행했습니다. 보기가 자주 바뀌지 않으면 보기 쪽 계산을 미리 저장해 두고 다시 쓸 수 있어 빠릅니다. 코드와 가중치는 Apache 2.0으로 무료 공개되어 있습니다.

## 핵심 요약

CLM은 "생성" 대신 "선택"만 하는 오픈소스 모델로, TypeSafe AI의 Jev와 같은 질문 형식(Noul, Choice, Score)을 지원하면서 선택 속도를 크게 줄였습니다. 단, 모든 과제에서 Jev만큼 정확하지는 않습니다.

| 과제 | CLM-8B | Jev |
| --- | --- | --- |
| T-Rex 게임 지연 시간 | 16.5ms | 149.8ms |
| 도구 호출(BFCL v4) 성공률 | 95.2% | 99.2% |
| WikiRacing 성공 | 26/30 | 30/30 |
| 코딩 검증기 DeepSWE (미세 조정) | 81.6% | 71.1% |
| 코딩 검증기 Terminal-Bench 2.1 (미세 조정) | 87.6% | 83.1% |

키워드: #CLM #대조학습 #SystemOne #Jev #Qwen3 #에이전트 #검증기 #오픈소스

## 활용 방법

가장 쉬운 시작은 공식 플레이그라운드입니다.

1. `pip install contrastive-lm`으로 설치합니다.
2. vLLM으로 Qwen3-8B 임베딩 서버를 띄우고 `clm-serve`를 실행합니다.
3. 브라우저에서 `http://localhost:8700/`에 접속해 고객 문의 한 줄을 넣고 "어느 부서로 보낼지"를 Choice 질문으로 만들어 확률을 확인합니다.
4. Rank 탭에서 LLM이 만든 답변 3~5개를 넣고 순위를 비교해 봅니다.

GPU가 없는 교실이라면 저장소의 `tools/playground_mock.py`로 가짜 인코더 기반 화면만 띄워 사용법을 먼저 보여 주십시오. 실제 판단 품질은 GPU 환경에서 따로 확인해야 합니다.

## 전문가 의견 (사실 기반)

강점

- 코드와 가중치가 Apache 2.0이라 Jev(TypeSafe AI 제공)의 대안으로 직접 설치해 쓸 수 있습니다.
- 상태와 보기를 따로 계산해 캐시가 잘 먹힙니다. README 측정(RTX 4090)에서 이미 본 상태를 다시 물으면 약 1.7ms에서 0.6ms로 줄었습니다.
- 코딩 검증기 지연 시간은 CLM 79ms 대 Jev 449ms(DeepSWE), 32ms 대 131ms(Terminal-Bench)로 4.1~5.7배 빠릅니다.

한계

- "Jev와 대등"은 연구팀 표현입니다. 표를 보면 도구 호출은 4.0%포인트 낮고 WikiRacing은 4개 더 실패했습니다.
- 게임 성공률은 각각 5회뿐이라 일반화 근거로 약합니다.
- 코딩 검증기 수치는 기본 모델이 아니라 과제별로 미세 조정한 헤드의 결과이며, 평가 과제도 38개, 30개로 적습니다. 모두 연구팀 자체 측정입니다.
- 매번 새로운 상태를 넣으면 캐시 이득이 거의 없습니다(README 기준 28.6ms에서 28.0ms).
- PyTorchKR 글의 "후보 1,000개에서 약 13배"는 GitHub README에서 확인되지 않았습니다.
- 출력 확률은 보기끼리의 상대값입니다. 정답이 보기에 없으면 CLM은 새 답을 만들지 못합니다.
- 기본 입력 한도는 2,048토큰이며, 넘으면 잘립니다.
- CLM-35B 멀티모달 2026년 10월 초 공개는 예고 단계입니다.

관련 정리: 트렌드 T의 Jev 관련 항목들(Jev 소개, Jev 생태계 1,142개 저장소)과 함께 보면 비교가 쉽습니다.

## Bottom Line

분류, 도구 선택, 답안 고르기처럼 보기가 정해진 작업이 있다면 LLM 앞단에 CLM을 붙여 보십시오. 본인 데이터로 50~100건만 먼저 돌려 정확도와 속도를 Jev 또는 LLM과 비교하면 도입 여부를 하루 안에 판단할 수 있습니다. 지금 당장 플레이그라운드부터 띄워 시작하십시오.

---

참고: [GitHub](https://github.com/Contrastive-LM/CLM) | [Hugging Face 모델 카드](https://huggingface.co/Contrastive-LM/CLM-v0.1-8B) | 정리 [다비(davi.kr)](https://davi.kr/)
