🤖 기술·AI4분 읽기

AI 에이전트가 스스로 배운다: 이번 주 AI 오픈소스 3대 변화

IBM의 ALTK-Evolve가 AI 에이전트에 '현장 학습' 능력을 부여하고, Safetensors가 PyTorch 재단에 합류하며, Sentence Transformers가 멀티모달 검색을 통합 API로 지원하기 시작했습니다.

GSEEK AI조회 2

AI 에이전트, 드디어 '경험'에서 배운다

IBM Research와 Agent Toolkit 팀이 공개한 ALTK-Evolve는 AI 에이전트에게 장기 기억(Long-term Memory)을 부여하는 오픈소스 프레임워크입니다. 기존 AI 에이전트의 가장 큰 한계는 매번 대화가 초기화되어 같은 실수를 반복하는 '영원한 인턴' 문제였습니다. MIT 연구에 따르면 AI 파일럿 프로그램의 95%가 이 적응 실패 때문에 중단된다고 합니다.

ALTK-Evolve는 에이전트의 작업 이력(trajectory)을 분석해 재사용 가능한 가이드라인과 원칙으로 자동 변환합니다. 단순히 과거 대화를 다시 읽는 것이 아니라, 경험에서 '판단력'을 추출하는 방식입니다.

핵심 구조: 양방향 학습 루프

  • 하향 흐름(Observation): 에이전트의 발화, 도구 호출, 결과를 캡처하고 구조적 패턴을 추출
  • 상향 흐름(Refinement): 중복 제거, 약한 규칙 가지치기, 검증된 전략 가중치 상향

AppWorld 벤치마크에서 어려운 과제의 성공률이 19.1%에서 33.3%로 74% 상대 개선을 보였습니다. 특히 학습한 원칙이 처음 보는 과제에도 적용되어 단순 암기가 아닌 일반화 능력을 입증했습니다.

학생 활용법: Claude Code나 Codex에 플러그인으로 설치해 코딩 에이전트의 반복 실수를 자동으로 줄일 수 있습니다. AI 에이전트 개발에 관심 있는 학생이라면 GitHub 저장소의 튜토리얼로 직접 실습해 볼 수 있습니다.


Safetensors(세이프텐서), PyTorch 재단 합류

Hugging Face가 만든 ML 모델 저장 포맷 Safetensors가 PyTorch Foundation에 공식 합류했습니다. Safetensors는 기존 pickle 기반 포맷의 보안 취약점(임의 코드 실행 위험)을 해결하기 위해 탄생한 포맷으로, 현재 Hugging Face Hub의 수만 개 모델이 이 형식을 사용하고 있습니다.

왜 중요한가

  • 제로카피 로딩(Zero-copy Loading): 디스크에서 텐서를 직접 메모리에 매핑해 로딩 속도 대폭 향상
  • 레이지 로딩(Lazy Loading): 전체 체크포인트를 역직렬화하지 않고 개별 가중치만 읽기 가능
  • 보안: 임의 코드 실행 위험 제거

PyTorch 재단 합류로 거버넌스가 Linux Foundation으로 이전되며, 향후 PyTorch 코어에 직접 통합, GPU 직접 로딩, 분산 로딩 API, FP8·GPTQ 등 양자화(Quantization) 포맷 지원이 계획되어 있습니다.

학생 활용법: 모델을 저장·배포할 때 model.save_pretrained()가 이미 safetensors를 기본 사용합니다. 딥러닝 프로젝트에서 pickle 대신 safetensors를 쓰면 보안과 성능 모두 개선됩니다.


Sentence Transformers v5.4: 멀티모달 검색의 대중화

Sentence Transformers가 v5.4 업데이트로 텍스트·이미지·오디오·영상을 하나의 임베딩 공간에서 통합 검색하는 기능을 정식 지원합니다. 기존에는 각 모달리티별로 별도 파이프라인을 구축해야 했지만, 이제 encode() 하나로 모든 입력을 처리합니다.

주요 기능

  • 통합 API: 텍스트 쿼리로 이미지·영상 검색, 이미지 쿼리로 텍스트 검색 등 교차 모달 검색
  • Retrieve & Rerank 패턴: 임베딩으로 빠른 1차 검색 → Reranker(재순위 모델)로 정밀 2차 정렬
  • 다양한 모델 지원: Qwen3-VL(2B/8B), NVIDIA Nemotron, Jina Reranker 등
from sentence_transformers import SentenceTransformer

model = SentenceTransformer("Qwen/Qwen3-VL-Embedding-2B")

# 텍스트와 이미지를 같은 공간에 임베딩
text_emb = model.encode(["초록색 자동차"])
img_emb = model.encode(["car_photo.jpg"])
similarity = model.similarity(text_emb, img_emb)

이 기능은 멀티모달 RAG(검색 증강 생성) 파이프라인 구축의 진입 장벽을 크게 낮춥니다. 문서 스크린샷, 슬라이드 이미지, 영상 클립을 텍스트 쿼리로 검색하는 시스템을 몇 줄의 코드로 만들 수 있습니다.

학생 활용법: pip install sentence-transformers[image]로 설치 후, 자신의 학습 자료(강의 슬라이드, 교재 사진)를 텍스트로 검색하는 개인 RAG 시스템을 구축해 보세요. 포트폴리오 프로젝트로도 훌륭합니다.


이번 주의 시사점

이번 주 세 가지 변화는 하나의 흐름을 보여줍니다: AI 도구의 성숙과 대중화. 모델 저장 포맷이 표준화되고, 검색이 멀티모달로 확장되며, 에이전트가 스스로 학습하는 시대가 본격적으로 열리고 있습니다. 특히 이 모든 도구가 오픈소스로 공개되어 학생과 개발자 누구나 즉시 실습할 수 있다는 점이 가장 큰 의미입니다.

#AI 에이전트#오픈소스#멀티모달#PyTorch#RAG

출처

공유

관련 글

댓글

댓글은 관리자 승인 후 공개됩니다. 닉네임과 비밀번호를 입력해주세요. 비밀번호는 수정/삭제 시 필요합니다 (10자 이내).

불러오는 중...

0/500