Anthropic이 Claude로 오픈소스 생체분자 모델 30여 개의 추론을 평균 4배 가속하고 코드를 공개했습니다. 실행 모드별 검증 방식과 GPU 예산을 100분의 1로 줄인 설계 실험, 기업이 적용할 때 확인할 점을 정리합니다.
발표 개요
Anthropic이 2026년 9월 17일 How Claude is uplifting biomolecular modeling을 공개했습니다. 과학자들이 단백질 구조 예측과 분자 설계에 쓰는 오픈소스 딥러닝 모델의 추론을 Claude가 직접 최적화한 결과입니다. Claude Science 안에서 작업한 Claude는 4주가 조금 안 되는 기간에 30개가 넘는 모델, 구현 기준으로 36개 패키지를 최적화했습니다. 대상은 구조 예측, 단백질 설계, 게놈 모델, 단백질 언어 모델의 네 계열입니다. 최적화 코드는 전부 GitHub 저장소에 공개했습니다.
세부 수치는 함께 공개한 기술 보고서(9월 21일 개정판)에 있습니다. 보고서 기준으로 구조 예측 모델 13개의 Fast 모드는 순전파(forward pass)가 평균 4.1배 빨라졌고, 원본과 비트 단위로 같은 출력을 내는 Exact 모드는 14개 모델에서 평균 1.6배 빨라졌습니다. 블로그 본문은 Exact 모드를 "거의 2배"로 표현했지만 이 글은 보고서의 1.6배를 따릅니다.
배경은 비용입니다. Anthropic은 앞서 Claude가 오픈소스 모델을 조합해 단백질 바인더를 설계하는 연구를 발표했는데, 표적 하나당 Modal 클라우드에서 최대 1만 달러를 쓸 수 있게 했습니다. 정가 기준으로 NVIDIA H100 약 2,500 GPU 시간에 해당합니다. 대부분의 연구자가 쓸 수 없는 예산이라 모델 자체를 효율적으로 만드는 작업에 나섰고, 초기 결과로 Claude Mythos 5.1이 생물학 모델 7개를 출력 변화 없이 최대 2.5배 가속했습니다. 이번 발표는 그 작업을 30개 넘는 모델로 넓힌 것입니다.
같은 날 Anthropic은 Adaptyv Bio와 공동으로 단백질 설계 대회를 연다고 밝혔습니다. 커뮤니티가 제출한 설계 5,000건 이상을 실험실에서 검증하며, 최대 100만 달러의 Claude 크레딧, Modal의 최대 25만 달러 컴퓨팅 크레딧, Twist Bioscience의 DNA가 지원됩니다. 최적화된 모델로 계산 비용이 낮아진 뒤 실제 실험 검증까지 연결하는 행사입니다.
세 가지 실행 모드와 기준선 설정
최적화한 패키지는 원본 가중치를 그대로 쓰고 최대 세 가지 모드를 제공합니다. 모드를 나눈 방식이 이 작업의 핵심 설계입니다. 속도와 정확성의 교환 조건을 사용자가 고르게 하고, 각 모드마다 검증 기준을 따로 정했습니다.
| 모드 | 허용하는 변경 | 검증 기준 |
|---|---|---|
| Exact | 계산 실행 방식만 변경 | 원본과 비트 단위 동일성 (여러 모델은 결정론적 설정을 켜고 비교) |
| Fast | 낮은 정밀도 연산, 반올림이 다른 융합 커널 | 원본 출력의 시드 간 편차 범위 안에 드는지 (모델별 테스트) |
| Big | 큰 텐서를 나눠 처리, 여러 GPU에 페어 표현 분할 | Fast와 같은 방식 |
모델별로 적용한 변경은 대체로 비슷합니다. 원본 코드가 반복 계산하던 중간 결과를 저장해 재사용하고, 항상 같은 결과를 내는 분기를 상수로 바꾸고, GPU 연산을 한 번 기록한 뒤 CUDA 그래프로 재생해 파이썬 오버헤드를 없앴습니다. 작은 연산 여러 개를 커널 하나로 합치고, 텐서를 GPU에 머물게 해 호스트와 장치 간 전송을 줄이고, 데이터 적재와 출력 기록을 비동기로 처리해 GPU가 CPU를 기다리지 않게 했습니다. 예를 들어 Chai-1에서는 200단계 확산 샘플러에서 노이즈 수준과 무관한 계산을 한 번만 하고 나머지 단계를 CUDA 그래프로 재생해 실행 오버헤드 대부분을 제거했습니다.
기업 독자가 먼저 볼 부분은 기준선입니다. 보고서는 비교 대상을 "default"로 정의했습니다. 수정하지 않은 모델을 같은 GPU에서 숙련된 사용자가 찾을 수 있는 가장 빠른 올바른 설정으로 실행한 상태입니다. 모델이 지원하지만 기본으로 꺼 둔 융합 커널을 켜고, GPU를 포화시키는 배치 크기를 쓰고, 여러 프로세스가 GPU 하나를 나눠 쓰게 하는 설정이 여기에 들어갑니다. 저자가 배포한 그대로 실행한 상태는 "base"로 따로 불렀습니다. 보고된 속도 향상은 설정 조정만으로 얻을 수 있는 이득을 뺀 수치이며, 배포 기본값 대비 이득은 이보다 클 수 있습니다. 모든 속도와 메모리 측정은 NVIDIA H100 80GB에서 했습니다.
속도 결과
FlashPairformer 커널
AlphaFold3, OpenFold3, Boltz-2 같은 최신 구조 예측 모델은 실행 시간과 메모리 대부분을 삼각 어텐션(triangle attention)과 삼각 곱셈(triangle multiplication)에 씁니다. 토큰 세 개 조합을 다루는 연산이라 비용이 토큰 수의 세제곱으로 늘어나고, 시스템 크기가 두 배가 되면 계산량은 약 8배가 됩니다. 이 연산에는 NVIDIA가 cuEquivariance와 BioNeMo Inference Runtime(BioNeMo-IR)으로 전용 커널을 내놓았고, 보고서는 이를 업계 표준으로 삼았습니다.
Claude와 함께 만든 FlashPairformer v1은 두 연산 모두에서 표준 커널보다 빨랐습니다. 256~2,048 토큰의 입력 크기 일곱 가지에 대한 기하평균으로, AlphaFold3와 Boltz-2가 쓰는 페어 폭 128에서는 삼각 어텐션 2.7배, 삼각 곱셈 1.7배였고 Protenix v2가 쓰는 페어 폭 256에서는 각각 2.9배와 3.2배였습니다. H100 한 장에서 측정했고 일곱 크기 전부에서 표준 커널보다 빨랐습니다.
구조 예측 모델
커널처럼 여러 모델에 옮겨 쓸 수 있는 최적화는 이득의 일부만 설명합니다. 나머지는 모델마다 Claude가 찾은 개별 최적화에서 나왔습니다. 아래 수치는 모델별로 대개 200~1,400 토큰의 입력 크기 일곱 가지에 대한 기하평균입니다. Fast 모드는 OpenDDE의 2.3배부터 Chai-1의 6.4배까지 분포했고 평균 4.1배였습니다. Exact 모드는 평균 1.6배, Big 모드는 평균 3.4배였습니다.
| 모델 | Exact | Fast | Big |
|---|---|---|---|
| ESMFold2 | 1.7 | 4.4 | 3.9 |
| ESMFold2-Fast | 1.6 | 5.2 | 4.3 |
| OpenFold3-p2 | 1.7 | 5.1 | 5.1 |
| OpenBind-0 | 1.4 | 4.9 | 4.9 |
| AlphaFold3 (JAX) | 1.0 | 2.5 | 2.5 |
| AlphaFold3 (PyTorch) | 0.7 | 3.0 | 2.2 |
| Protenix v2 | 2.5 | 4.1 | 2.9 |
| Protenix v1 | 1.7 | 3.2 | 1.8 |
| OpenDDE | 1.7 | 2.3 | 1.6 |
| Boltz-2 | 1.8 | 5.6 | 4.1 |
| Chai-1 | 2.5 | 6.4 | 6.3 |
| RoseTTAFold3 | 1.9 | 3.4 | 1.5 |
| AtlasFold | 1.3 | 2.8 | 2.4 |
| ColabFold 1.6.1 | 1.1 | 없음 | 4.2 |
| AF2 initial guess | 1.0 | 5.0 | 4.4 |
| 평균 | 1.6 | 4.1 | 3.4 |
표를 읽을 때 세 가지를 구분해야 합니다. AlphaFold3 (PyTorch)의 Exact가 1배 미만인 것은 AlphaFold3 (JAX)의 default와 비교했기 때문이며, 자기 default와 비교하면 2.9배입니다. 두 AlphaFold3 구현은 AlphaFold3 파라미터 대신 OpenFold3-p2 가중치로 실행했습니다. ColabFold는 별도 Fast 모드가 없고 Fast 설정이 Big과 같습니다. ColabFold 수치는 1.6.1 버전 기준이며, 이후 버전에 추가된 선택형 융합 커널은 측정하지 않았습니다.
설계·게놈·단백질 언어 모델
구조 예측 외 계열은 사용자가 중요하게 보는 시간이 달라 측정 기준도 달리 잡았습니다. 환각(hallucination) 설계는 설계 단계당 시간, 구조 생성은 GPU 초당 설계 수, 역접힘(inverse folding)은 모델 적재를 포함한 설계 1회 전체 시간입니다. Fast 모드 기준으로 구조 생성 모델은 1.5배(BoltzGen)에서 7.5배(Genie 3), 역접힘 모델 ESM-IF1은 10.1배까지 빨라졌습니다. 게놈 모델과 단백질 언어 모델은 Exact 모드만으로 순전파가 1.2~5.0배 빨라졌습니다. 다만 보고서는 게놈 과제 전체로 보면 입력 준비와 출력 기록이 추론보다 오래 걸릴 수 있다고 적었습니다. 모델 속도가 곧 작업 전체 속도가 되지 않는 경우입니다.
정확성 검증 방식
속도를 올린 코드가 과학적으로 같은 답을 내는지가 이 작업의 신뢰도를 정합니다. 보고서는 검증을 세 층으로 나눴습니다.
비트 단위 동일성
Exact 모드는 원본 출력과 비트 단위로 비교했습니다. 여러 구조 예측 모델은 실사용 설정에서 결정론적이지 않아 default 자체가 실행할 때마다 조금씩 다른 예측을 냅니다. OpenFold3-p2, OpenBind-0, AlphaFold3 (JAX)가 그렇고, 반복 실행에서 Protenix v1, Protenix v2, ColabFold도 일부 예측이 바뀌었습니다. 그래서 양쪽 모두 결정론적 설정을 켜고 따로 비교했고, 벤치마크 입력에서 확인한 11개 구성 가운데 10개가 비트 단위로 일치했습니다. default 자체가 재현하지 못한 출력은 비교에서 제외했습니다.
시드 간 편차 범위
Fast와 Big 모드는 반올림이 달라지므로 비트 비교가 불가능합니다. 대신 대부분의 모델에서 출력이 default를 여러 난수 시드로 실행했을 때 나오는 편차 범위 안에 드는지 확인했습니다. 환각 설계는 최적화 단계마다 손실 항, 그래디언트, 갱신 후 출력을 default와 비교했고, Evo 2는 비트 비교를 했습니다. 구조 생성 모델 대부분은 합격 기준이 있는 테스트를 보고하지 않았고, 대신 설계 품질 벤치마크 네 가지로 default와 비교했습니다. 네 벤치마크 모두에서 평균 설계 품질의 측정 가능한 변화는 없었습니다.
하류 과제 정확도
마지막 층은 실제 과제의 성능입니다. FoldBench 일부와 2025년 7월 이후 PDB 항목을 합친 FoldBench-Lite에서 각 모드를 실행하고, 예측한 인터페이스의 DockQ 점수가 0.23 이상이면 허용 가능한 예측으로 셌습니다. 0.23은 단백질 도킹 평가(CAPRI)의 허용 등급 경계입니다. 13개 모델 구성, 1,925개 모델 표적 쌍을 합친 결과는 다음과 같습니다.
| 모드 | 허용 가능한 인터페이스 비율 | default 대비 변화 |
|---|---|---|
| Default | 54.8% | 기준 |
| Exact | 55.0% | 0.2%p 증가 |
| Fast | 54.5% | 0.4%p 감소 |
| Big | 54.2% | 0.6%p 감소 |
세 변화 모두 95% 신뢰구간이 0을 포함해 통계적으로 구분되지 않았습니다. 모델별 41개 비교에서 신뢰구간이 0을 벗어난 경우는 ESMFold2 Exact의 4.6%p 증가 하나뿐이었습니다. 다만 보고서는 여섯 개 구간의 한쪽 끝이 정확히 0에 닿았다고 밝혔습니다. 가장 큰 감소 네 건 가운데 세 건이 여기에 속하며, 감소폭은 2.23.5%p였습니다(OpenFold3-p2 Fast와 Big, RoseTTAFold3 Exact와 Big). RoseTTAFold3 Big은 3.5%p 감소했고 신뢰구간은 감소 7.7%p에서 0.0%p까지였습니다. 이 모드들에서 작은 손실을 배제할 수 없다는 뜻입니다. 인터페이스 대신 표적마다 같은 가중치를 주면 OpenFold3-p2 Fast의 구간(3.4%p 감소)은 0 바로 아래에서 끝납니다. 단일 사슬 정확도(lDDT)는 비교마다 사슬 913개로 표본이 작았고, 평균 lDDT의 작은 감소 여섯 건(0.003~0.040)과 작은 증가 여섯 건이 유의했습니다.
통과하지 못한 검사
보고서는 실패한 검사도 모델별 부록에 적었습니다. Chai-1의 Exact는 동일성 검사를 통과했지만, 정확도 벤치마크 입력으로 따로 실시한 비트 동일성 검사는 통과하지 못했습니다. ESMFold2 역환각 설계(EF2-inv)의 Fast는 주 테스트 세트에서는 합격했지만 EGFR 설계 사례의 별도 검사에서 불합격했습니다. 과장 없이 실패를 공개한 이 방식은 자동 최적화 결과를 사내에서 검수할 때 참고할 형식입니다.
메모리 한계와 학습 범위 밖 입력
Big 모드는 큰 텐서를 나눠 처리하고 페어 표현을 여러 GPU에 분할해 최대 메모리를 낮춥니다. 이 모드로 8장 GPU 노드 하나에서 1만 토큰이 넘는 대형 단백질 복합체의 구조를 예측했습니다. 기존에는 여러 노드에 걸친 추론이 필요했던 규모입니다. 정확하다고 판정한 예측의 실험 구조 대비 TM 점수는 0.92~0.997이었고 최대 입력은 10,761 토큰이었습니다. 대부분의 모델이 최대 768 토큰 조각으로 학습했으므로 학습 크기의 13배를 넘는 입력입니다.

보고서는 이 결과의 조건도 함께 밝혔습니다. 판정 기준은 채점 전에 정했지만 그림에 실은 20개 예측은 190개 예측 가운데 채점 후 고른 것이고, 일부 항목은 원 모델의 학습 데이터에 포함됐을 수 있습니다.
한계 시험 결과도 공개했습니다. 약 31,00070,320 잔기 규모의 조립체 일곱 건은 계산은 끝났지만 정확한 예측이 하나도 없었습니다. 예측 구조는 실제 크기의 약 4분의 1로 뭉쳤고 채점한 세 건의 TM 점수는 0.080.14였습니다. 보고서의 표현으로 Big 모드는 계산할 수 있는 범위를 넓힐 뿐이며 모델이 학습한 범위를 넓히지는 않습니다.

기업 환경에 옮기면 추론 최적화로 입력 한도를 올릴 수 있어도 그 입력에서 모델 품질이 유지되는지는 별도로 검증해야 한다는 뜻입니다.
GPU 예산 100분의 1로 실행한 설계 과제
속도 향상이 실제 작업 비용에 어떻게 반영되는지 보여주는 실험도 있습니다. Anthropic은 앞선 바인더 설계 연구에서 표적당 최대 1만 달러(H100 약 2,500 GPU 시간)의 예산을 썼습니다. 이번에는 Claude 모델 하나에 NVIDIA H200 한 장과 24시간을 주고, 최적화된 모델을 도구로 쓰게 해 16개 표적에 대해 같은 과제를 실행했습니다. GPU 예산은 약 100분의 1입니다.

| 모델 | 24시간 뒤 설계 점수 중앙값 | 기존 캠페인 중앙값 도달 | 도달 시점 실행당 비용 |
|---|---|---|---|
| Claude Opus 5 | 0.785 | 12시간 | 약 117~136달러 |
| Claude Mythos 5.1 | 0.781 | 13시간 | 약 157~196달러 |
| Claude Mythos 5 | 0.739 | 24시간 내 미도달 | 해당 없음 |
| 기존 캠페인 | 0.749 | 기준 | 표적당 최대 1만 달러 예산 |
비용은 GPU 시간(Modal H200 정가 시간당 5달러)과 토큰 정가를 합친 추정치입니다. 점수는 계산상 결합 지표(ipSAE)이며 이 설계들은 실험실에서 검증하지 않았습니다. 보고서는 최적화된 모델의 기여와 단순해진 작업 절차의 기여를 분리하지 않았다고도 밝혔습니다. 최적화 모델 없이 실행한 대조 실험에서도 세 모델 모두 점수가 낮았습니다(Opus 5 기준 0.765 대 0.785).
작업 방식과 공개 코드
작업 인력 구성이 이 발표에서 가장 눈여겨볼 대목입니다. 보고서에 따르면 이런 최적화는 숙련된 엔지니어링 팀이 모델당 몇 주를 쓰는 일이고 모델 간에 옮겨 쓰기도 어렵습니다. Claude는 36개 패키지 전체를 4주가 조금 안 되는 기간에 최적화했고, 주로 감독한 사람은 Anthropic 기술 인력 두 명이었습니다. 두 사람은 생체분자 모델링 경험은 있었지만 추론 최적화나 커널 엔지니어링 경험은 없었습니다. 보고서 자체도 Claude가 사람의 감독 아래 작성했다고 적었습니다. 최적화 작업 자체에 든 토큰 비용과 에이전트 실행 절차의 세부는 공개하지 않았습니다.
공개 저장소의 설계도 참고할 만합니다.
| 항목 | 내용 |
|---|---|
| 구성 | 원본 도구별 최적화 키트 36개. 원본 릴리스를 고정 버전으로 함께 보관하고 수정하지 않음 |
| 사용 방식 | 도구 실행 시 모드(off, exact, fast, big)를 지정. 원본 도구 호출 방식은 그대로 |
| 동작 표시 | 최적화가 적용되면 ACTIVE 한 줄을 출력. 적용할 수 없으면 NOT ACTIVE와 사유를 출력하고 종료 코드 3으로 끝냄 |
| 라이선스 | Apache 2.0 (원본 코드는 각 원본 라이선스 유지) |
| 유지보수 | 참고용 릴리스. 추가 업데이트와 풀 리퀘스트 수용 계획 없음 |
최적화를 적용할 수 없을 때 원본으로 조용히 되돌아가지 않고 실패로 끝내는 방식은 자동 생성한 성능 코드를 운영에 넣을 때 필요한 안전장치입니다. 사용자는 로그만 보고 어떤 경로가 실행됐는지 확인할 수 있습니다.
보고서가 밝힌 한계는 다음과 같습니다. 모든 속도·메모리 수치는 H100에서 보고서가 정한 배치·입력 크기·원본 버전으로 측정했으며 다른 환경에서는 달라질 수 있습니다. Exact와 Fast 모드는 default보다 메모리를 최대 3.2배 더 쓸 수 있습니다. 게놈 모델과 단백질 언어 모델은 default 출력과의 비교만 했고 하류 정확도는 측정하지 않았습니다.
우리나라 기업이 확인할 것
- 사내에서 운영하는 오픈소스 모델의 추론 경로가 배포 기본값 그대로인지 먼저 확인할 필요가 있습니다. 보고서가 기준선을 "숙련된 사용자가 찾을 수 있는 가장 빠른 올바른 설정"으로 따로 잡은 것은 설정 조정만으로 얻는 이득이 적지 않기 때문입니다.
- AI 에이전트에게 성능 최적화를 맡길 때는 이 보고서처럼 모드별 검증 기준을 미리 정해야 합니다. 비트 단위 동일성, 원본의 시드 간 편차 범위, 실제 과제 정확도의 세 층을 사내 모델에도 그대로 적용할 수 있습니다.
- 최적화 결과는 측정한 GPU와 버전에서만 유효합니다. 사내 GPU 종류와 모델 버전에서 속도와 메모리를 다시 측정해야 하며, 메모리 사용량이 늘어나는 모드가 있다는 점도 용량 계획에 반영해야 합니다.
- 공개 저장소는 유지보수하지 않는 참고용 릴리스입니다. 운영에 쓰려면 원본 모델이 업데이트될 때 키트를 다시 검증할 주체를 사내에 정해야 합니다.
- 이번 사례에서 감독 인력은 도메인 전문가 두 명이었습니다. 커널 전문 인력이 없는 조직도 도메인 지식과 검증 기준을 갖추면 추론 비용 절감 작업을 시작할 수 있다는 근거로 볼 수 있지만, 실행 비용과 절차는 공개되지 않았으므로 소규모 시범으로 확인하는 편이 안전합니다.
출처: How Claude is uplifting biomolecular modeling, 기술 보고서, GitHub 저장소
코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.
코텍시스 AI 인사이트 최신 논문 리뷰
AWQ 양자화: 활성값을 보고 가중치를 지키는 4비트 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

