RAG 정확도 높이는 Ettin 리랭커 패밀리 공개
Hugging Face가 RAG(검색 증강 생성) 파이프라인의 검색 정확도를 높이는 Ettin 리랭커 6종을 공개했습니다. 17M~1B 파라미터 규모로, 기존 모델 대비 최대 8배 빠른 속도와 더 높은 정확도를 동시에 달성했습니다.
RAG 파이프라인의 '마지막 한 단계'가 달라졌다
AI 기반 검색 시스템을 만들 때 가장 흔히 쓰이는 구조가 RAG(Retrieval-Augmented Generation, 검색 증강 생성)입니다. 그런데 이 구조에서 검색 결과의 순서를 다시 정리해 주는 리랭커(Reranker, 재순위화 모델) 는 종종 간과됩니다. Sentence Transformers 팀이 2026년 5월 19일 공개한 Ettin 리랭커 패밀리는 이 빈틈을 정면으로 공략합니다.
17M(1,700만), 32M, 68M, 150M, 400M, 1B(10억) 파라미터 등 총 6가지 크기로 출시되었으며, 모두 Apache 2.0 라이선스로 무료 사용이 가능합니다.
리랭커가 왜 필요한가?
RAG 파이프라인은 크게 두 단계로 구성됩니다.
- Retrieval(검색): 임베딩(Embedding, 수치 벡터 표현) 모델이 수백만 개의 문서 중 유사한 후보 100개를 빠르게 뽑습니다.
- Reranking(재순위화): 크로스 인코더(Cross-Encoder) 모델이 질문과 문서를 함께 읽으며 가장 관련 있는 순서로 재정렬합니다.
임베딩 모델은 질문과 문서를 따로 처리하기 때문에 빠르지만 정밀도가 낮습니다. 반면 리랭커는 두 텍스트를 함께 처리해 관계를 정확히 파악하지만, 모든 문서에 적용하기엔 비용이 큽니다. 두 방식을 조합하면 속도와 정확도를 모두 얻을 수 있습니다.
Ettin 리랭커의 핵심 성과
기존 모델을 압도하는 성능 대 크기 비율
MTEB(Massive Text Embedding Benchmark, 대규모 텍스트 임베딩 벤치마크) 기준으로 Ettin 리랭커는 같은 크기 혹은 훨씬 큰 기존 모델들을 앞섭니다.
- 17M 모델이 33M짜리
ms-marco-MiniLM-L12-v2보다 정확도 +0.051 우위 (파라미터 절반) - 32M 모델이 568M짜리
BAAI/bge-reranker-v2-m3보다 정확도 +0.025 우위 (파라미터 1/17) - 1B 모델이 1.54B짜리 교사 모델과 MTEB 점수 차이 0.0001 이내
Flash Attention 2로 구현한 속도 우위
Ettin 리랭커는 FA2(Flash Attention 2, 플래시 어텐션 2)와 언패딩(unpadding, 패딩 토큰 제거) 기술을 결합해 동일 아키텍처 기반 경쟁 모델 대비 최대 2.3배 빠른 처리 속도를 달성했습니다. H100 GPU에서 17M 모델은 초당 7,517쌍을 처리할 수 있어 실시간 검색 서비스에도 적용 가능합니다.
증류(Distillation) 학습 방식
기존 리랭커 학습은 사람이 직접 레이블링한 데이터가 필요했습니다. Ettin 팀은 강력한 교사 모델(mixedbread-ai/mxbai-rerank-large-v2)이 생성한 점수를 약 1억 4,300만 쌍의 데이터에 적용해 MSE(평균 제곱 오차) 손실로 학습하는 지식 증류(Knowledge Distillation) 방식을 사용했습니다. 이 방식은 레이블링 비용을 줄이면서도 이진 판단의 한계를 극복합니다.
코드 3줄로 시작하기
Sentence Transformers 라이브러리로 즉시 사용할 수 있습니다.
from sentence_transformers import CrossEncoder
model = CrossEncoder("cross-encoder/ettin-reranker-32m-v1")
scores = model.predict([
("파이썬이란 무엇인가?", "파이썬은 귀도 반 로섬이 만든 인터프리터 언어입니다."),
("파이썬이란 무엇인가?", "비단뱀은 열대 지방에 사는 대형 뱀입니다."),
])
print(scores) # 첫 번째 문서가 훨씬 높은 점수
전체 검색-재순위화 파이프라인을 구성하면 임베딩 모델로 상위 100개를 뽑은 뒤 리랭커로 최종 5~10개를 선별하는 구조가 됩니다.
교육 분야 시사점
학생 프로젝트에서의 활용
RAG 기반 AI 튜터, 강의 자료 검색 시스템, 논문 추천 엔진 등을 개발하는 학생들에게 Ettin 리랭커는 GPU 없이도 CPU에서 충분히 작동하는 17M·32M 모델을 제공합니다. 노트북 환경에서도 실험이 가능합니다.
오픈 모델 생태계의 확장
Anthropics의 Claude, OpenAI의 GPT처럼 API 호출로만 쓸 수 있는 상용 모델과 달리, Ettin 리랭커는 완전한 오픈소스입니다. 학생이 직접 파인튜닝(Fine-tuning, 미세 조정)하거나 특정 도메인(법률, 의학, 교육)에 맞게 최적화할 수 있습니다.
부록: OlmoEarth v1.1 — 위성 이미지 AI도 효율화
같은 날 Allen AI 팀도 위성 이미지 분석 모델 OlmoEarth v1.1을 공개했습니다. 트랜스포머(Transformer) 기반 원격 탐사 모델로, 토큰(token) 시퀀스 길이를 줄여 기존 v1 대비 컴퓨팅 비용을 최대 3배 절감했습니다. 맹그로브 변화 추적, 산림 훼손 분류, 국가 단위 농작물 지도 제작 등에 활용됩니다. 지구과학·환경공학 전공 학생이라면 오픈소스로 공개된 가중치를 이용해 실제 위성 데이터 분석 프로젝트에 도전해 볼 수 있습니다.
정리
Ettin 리랭커는 RAG 시스템의 핵심 병목인 재순위화 단계를 더 빠르고 정확하게 해결합니다. 작은 모델도 기존 대형 모델을 압도하는 성능을 보여, 리소스가 제한된 학생 프로젝트 환경에서 특히 유용합니다. AI 검색 시스템 구축에 관심 있다면 cross-encoder/ettin-reranker-17m-v1부터 시작해 보세요.
출처
- Introducing the Ettin Reranker Family(2026-05-19)
- OlmoEarth v1.1: A more efficient family of models(2026-05-19)
관련 글
구글 Gemma 4 12B: 노트북으로 돌리는 멀티모달 AI 시대
구글 DeepMind가 16GB VRAM 노트북에서 실행 가능한 오픈소스 멀티모달 AI 모델 Gemma 4...
구글 Gemini 3.5 실시간 통번역 출시와 이번 주 AI 핵심 동향
구글이 70개 이상 언어를 거의 실시간으로 번역하는 Gemini 3.5 Live Translate를 출시했습...
AI 저작권 최대 합의·무료 중국 AI·채용 편향의 3중 충격
Anthropic이 AI 저작권 소송에서 역대 최대 규모인 15억 달러 합의를 이끌어냈고, 중국 오픈소스 A...
AI가 채용 심사관 됐다: 인간보다 65% 더 편향적
프린스턴·시카고 대학 공동 연구에서 ChatGPT·Claude·Gemini 등 주요 AI가 가상 채용 시뮬레...
AI 가치 측정 새 기준: GPT-5.6과 임베딩 모델 혁신
OpenAI가 GPT-5.6을 출시하며 AI 성과를 '토큰 비용'이 아닌 '달러당 유용 지능(Useful I...
댓글
불러오는 중...