GPT-Rosalind 공개, AI가 신약 개발을 앞당긴다
OpenAI가 생명과학 특화 추론 모델 GPT-Rosalind를 공개했다. 단백질 공학부터 신약 후보 탐색까지, 과학 연구 워크플로우 전반을 가속하는 도메인 전용 AI 시대가 열린다.
OpenAI, 생명과학 전용 AI 모델 GPT-Rosalind 발표
OpenAI가 생물학·약물 발견·중개 의학 연구를 위한 프론티어 추론 모델 GPT-Rosalind를 공개했다. DNA 구조 규명에 핵심 기여를 한 로잘린드 프랭클린의 이름을 딴 이 모델은, 화학 반응 메커니즘·단백질 구조·유전체 분석 등 과학 하위 영역 전반에서 최고 수준의 추론 성능을 보여준다.
미국에서 신약 하나가 타겟 발견부터 규제 승인까지 걸리는 시간은 평균 10~15년이다. GPT-Rosalind는 이 초기 발견 단계를 가속하는 데 초점을 맞춘다. 문헌 합성(Literature Synthesis), 가설 생성, 실험 설계 등 다단계 연구 과제를 지원하며, 50개 이상의 과학 도구·데이터베이스에 연결되는 Life Sciences Research Plugin도 함께 출시됐다.
벤치마크 성과가 말해주는 것
- BixBench(생물정보학·데이터 분석 벤치마크): 공개 점수 기준 최고 성능
- LABBench2: GPT-5.4 대비 11개 과제 중 6개에서 우위, 특히 분자 클로닝 프로토콜 설계(CloningQA)에서 가장 큰 격차
- Dyno Therapeutics 비공개 RNA 평가: 예측 과제에서 인간 전문가 상위 5% 이상, 서열 생성 과제에서 상위 16%
현재 Amgen, Moderna, Allen Institute, Thermo Fisher Scientific 등이 초기 고객으로 참여하고 있으며, Los Alamos 국립연구소와는 AI 기반 단백질·촉매 설계를 공동 탐색 중이다.
학생·교육자에게 주는 시사점
도메인 특화 AI 모델의 등장은 "범용 LLM만 잘 쓰면 된다"는 인식에 전환을 요구한다. 생명과학 전공 학생이라면 AI가 연구 워크플로우에 어떻게 통합되는지 이해하는 것이 곧 경쟁력이 된다. Codex에 공개된 Life Sciences Research Plugin은 무료로 사용할 수 있으므로, 유전체 데이터 검색·단백질 구조 조회 같은 실습에 직접 활용해 볼 수 있다.
오픈소스 기여의 새 패러다임: transformers-to-MLX Skill
Hugging Face가 transformers 라이브러리의 언어 모델을 Apple MLX로 자동 포팅하는 Skill(코드 에이전트용 레시피)을 공개했다. Claude Code와 함께 사용하도록 설계된 이 도구는, transformers에 새 모델이 추가되면 곧바로 MLX에서도 쓸 수 있도록 포팅 과정을 체계화한다.
흥미로운 점은 이 프로젝트가 단순 자동화가 아니라 **"에이전트 시대의 오픈소스 기여란 무엇인가"**라는 질문에 답하려는 시도라는 것이다. Hugging Face 팀은 코드 에이전트가 PR(Pull Request)을 쏟아내는 현실을 직시하면서도, 메인테이너의 리뷰 부담을 줄이는 방향으로 에이전트를 설계했다. RoPE(Rotary Position Embedding, 회전 위치 임베딩) 버그 탐지, 레이어별 수치 비교, dtype 검증 등 경험 많은 포터만 수행하는 점검을 자동화하되, 최종 판단은 사람이 내린다.
학생 활용법: Apple Silicon Mac을 쓰는 개발자 지망생이라면, 이 Skill을 포크한 mlx-lm 저장소에 돌려보며 모델 아키텍처와 프레임워크 간 차이를 학습할 수 있다. 실제 PR을 제출하지 않더라도, transformers·MLX·언어 모델 구조에 대한 실전 감각을 기를 수 있는 좋은 교재다.
NVIDIA Nemotron OCR v2: 합성 데이터로 다국어 OCR 정복
NVIDIA가 Nemotron OCR v2를 발표했다. 1,220만 장의 합성 학습 이미지로 훈련된 이 모델은 영어·일본어·한국어·러시아어·중국어(간체/번체) 6개 언어를 단일 모델로 처리한다.
핵심 수치
| 지표 | 결과 |
|---|---|
| 한국어 NED(정규화 편집 거리) | 0.923 → 0.047 (v1 대비) |
| 처리 속도 | A100 GPU 1장에서 34.7페이지/초 |
| PaddleOCR v5 대비 속도 | 28배 이상 빠름 |
| 모델 파라미터 | 84M (다국어 버전) |
비결은 아키텍처보다 데이터에 있다. mOSCAR(163개 언어 웹 코퍼스)에서 텍스트를 추출하고, 수정된 SynthDoG 파이프라인으로 단어·줄·문단 수준의 바운딩 박스와 읽기 순서 그래프까지 완벽한 레이블을 자동 생성했다. 합성 데이터 파이프라인(Synthetic Data Pipeline)은 폰트와 소스 텍스트만 있으면 어떤 언어든 확장 가능하다.
학생 활용법: 모델(nvidia/nemotron-ocr-v2)과 데이터셋(nvidia/OCR-Synthetic-Multilingual-v1) 모두 Hugging Face에 공개되어 있다. 논문·교재 스캔본의 텍스트 추출, 다국어 문서 디지털화 프로젝트에 바로 적용해 볼 수 있으며, 합성 데이터 생성 파이프라인 자체가 CV(컴퓨터 비전) 학습의 좋은 사례 연구다.
이번 주의 흐름: 도메인 특화 AI의 가속
이번 주 세 가지 발표에서 공통적으로 읽히는 흐름은 **"범용에서 전문으로"**의 전환이다. GPT-Rosalind는 생명과학, Nemotron OCR v2는 다국어 문서 인식, transformers-to-MLX Skill은 모델 포팅이라는 각자의 도메인에서 범용 도구의 한계를 넘어선다. AI를 공부하는 학생에게 시사하는 바는 명확하다 — 범용 모델을 "쓰는" 능력만큼, 특정 도메인에 "맞추는" 능력이 점점 더 중요해지고 있다.
출처
관련 글
AI 모델이 샌드박스를 탈출했다: OpenAI·Hugging Face 보안 사고가 남긴 질문
2026년 7월, OpenAI가 보안 능력을 테스트하던 AI 모델들이 격리 환경을 스스로 뚫고 Hugging...
Gemini 3.6 Flash·AI 보안 사고·오픈소스 100억: 이번 주 핵심
Google이 Gemini 3.6 Flash를 출시해 출력 토큰을 17% 절감하고 비용을 낮췄으며, Open...
OpenAI 5% 지분 제안: AI 거버넌스 시대가 열린다
미국 정부가 OpenAI 지분 5%를 받는 방안이 협상 테이블에 올랐습니다. AI 산업에 정부가 직접 참여하...
Cosmos 3 오픈소스·오픈AI 학생 크레딧: AI 빅위크
NVIDIA가 물리 AI(Physical AI) 전용 세계 기반 모델 Cosmos 3를 오픈소스로 공개했고,...
AI 유통 구조가 바뀐다: PE 자본·음성 AI·오픈소스 격변의 한 주
OpenAI와 Anthropic이 사모펀드(PE) 컨소시엄으로부터 총 115억 달러를 유치하며 AI 유통 구...
댓글
불러오는 중...