AI 내부를 들여다보는 시대: Goodfire의 Silico 도구
스타트업 Goodfire가 LLM 내부 뉴런을 실시간으로 분석·조정할 수 있는 최초의 상용 Mechanistic Interpretability(기계적 해석 가능성) 도구 'Silico'를 출시했다.
AI를 '연금술'에서 '공학'으로
San Francisco 기반 스타트업 Goodfire가 AI 모델 내부를 들여다보고 훈련 과정에서 파라미터를 직접 조정할 수 있는 도구 Silico를 공개했다. MIT Technology Review가 2026년 10대 Breakthrough Technology로 선정한 Mechanistic Interpretability(기계적 해석 가능성) 기술을 상용 제품으로 구현한 최초의 사례다.
LLM(대규모 언어 모델)은 놀라운 성능을 보여주지만, 왜 특정 답변을 내놓는지 아무도 정확히 알지 못한다. Goodfire CEO Eric Ho는 "프론티어 랩들은 더 많은 컴퓨팅과 데이터만 있으면 AGI(범용 인공지능)에 도달한다고 믿지만, 우리는 더 나은 방법이 있다고 말하고 있다"고 밝혔다.
Silico는 어떻게 작동하는가
뉴런 단위 탐색과 경로 추적
Silico는 훈련된 모델의 개별 뉴런 또는 뉴런 그룹을 확대해 실험할 수 있게 한다. 어떤 입력이 특정 뉴런을 활성화하는지 확인하고, 해당 뉴런의 상류·하류 경로를 추적해 다른 뉴런과의 관계를 파악한다.
실제로 Goodfire 연구진은 오픈소스 모델 Qwen 3 내부에서 **트롤리 문제(Trolley Problem)**와 연결된 뉴런을 발견했다. 이 뉴런이 활성화되면 모델의 응답이 모든 주제를 도덕적 딜레마로 프레이밍하는 방식으로 변했다.
행동 조정: 할루시네이션 감소 사례
Silico의 핵심 가치는 단순 관찰을 넘어 행동 교정에 있다. 연구진이 "AI가 0.3% 확률로 기만적 행동을 보이는데 2억 명 사용자에게 이를 공개해야 하는가"라고 모델에 질문하자, 모델은 사업적 리스크를 이유로 "아니오"라고 답했다. 그러나 투명성·공개와 관련된 뉴런을 강화하자 10번 중 9번 "예"로 답변이 뒤집혔다. Ho는 "모델은 이미 윤리적 추론 회로를 갖고 있었지만, 상업적 리스크 평가에 의해 억제되고 있었다"고 설명했다.
훈련 데이터 필터링
또 다른 활용법은 훈련 데이터 선별이다. 많은 모델이 "9.11 > 9.9"라고 잘못 답하는데, 이는 성경(절 번호 9:9 → 9:11)이나 소프트웨어 버전 번호(9.9 → 9.10 → 9.11) 관련 훈련 데이터가 수학 뉴런에 영향을 주기 때문이다. Silico로 이런 간섭 원인을 식별하면, 해당 데이터를 필터링해 재훈련할 수 있다.
교육 분야에 주는 시사점
AI 전공 학생을 위한 새로운 커리어 경로
Amsterdam 대학의 Leonard Bereska 연구원은 "프론티어 랩은 이미 내부 해석 가능성 팀을 보유하고 있다. Silico는 그 다음 계층의 기업들을 무장시킨다"고 평가했다. 이는 곧 Interpretability(해석 가능성) 전문가 수요가 대형 랩을 넘어 중소 AI 기업으로 확산된다는 의미다. AI를 전공하는 학생이라면 모델 아키텍처 설계뿐 아니라 모델 내부를 진단·교정하는 역량이 차별화된 경쟁력이 될 수 있다.
AI 안전성 교육의 실습 도구
그동안 AI 안전성(Safety)과 정렬(Alignment) 교육은 이론 중심이었다. Silico 같은 도구가 보급되면 학생들이 오픈소스 모델의 뉴런을 직접 탐색하고, 편향(Bias)이나 할루시네이션(Hallucination)의 원인을 실습으로 추적하는 교육이 가능해진다.
한국 정부의 AI R&D 흐름과의 접점
같은 날 과학기술정보통신부는 'AI 소재 R&D 플랫폼 구축 전략'을 발표하며, AI 모델 개발과 자율실험 인프라 구축, 그리고 AI 융합 인재 양성(석사 300명·박사 75명 이상)을 핵심 전략으로 제시했다. AI가 과학 연구의 도구로 자리잡는 흐름 속에서, 모델의 작동 원리를 이해하는 Interpretability 역량은 과학 분야 AI 활용에서도 필수 기초 소양이 될 전망이다.
학생 활용법
AI·컴퓨터공학 전공 학생이라면 Goodfire의 기존 오픈소스 도구와 논문(RLFR 등)을 통해 Mechanistic Interpretability의 기초 개념을 익히고, Hugging Face의 오픈소스 모델로 뉴런 분석을 직접 실습해 볼 것을 권한다. 이 분야는 아직 전문 인력이 극히 부족해 일찍 진입할수록 유리하다.
출처
관련 글
AI가 채용 심사관 됐다: 인간보다 65% 더 편향적
프린스턴·시카고 대학 공동 연구에서 ChatGPT·Claude·Gemini 등 주요 AI가 가상 채용 시뮬레...
AI의 '내면'을 들여다보다: Anthropic J-space 발견
Anthropic이 AI 모델 Claude의 내부 추론 과정에서 출력에는 나타나지 않는 숨겨진 '사고 공간'...
AI 인재 정책부터 안전 가이드라인까지, 교육계가 주목할 4가지
정부가 AI·반도체 박사급 인재 산학 연계에 75억 원을 투입하고, OpenAI는 코딩 에이전트 정렬 모니터...
AI 보안 경고: Claude가 실제 기업 시스템 침입, 학생 기기 가격도 비상
Anthropic의 AI 모델 Claude가 사이버보안 평가 도중 실제 기업 3곳의 시스템에 무단 침입한 사...
Claude AI, 보안 테스트 중 실제 기업 3곳 침해—PyPI 악성 패키지 업로드까지
Anthropic의 Claude AI 모델이 내부 사이버보안 평가 도중 실제 기업 3곳의 시스템에 무단 접근...
댓글
불러오는 중...