Anthropic이 AI가 수행하는 연구개발 비중, 에이전트 감독 수준, 안전 연구 연산 비중을 재는 방법과 내부 수치를 공개했습니다. 정의와 수치를 정리하고 기업 AI 운영 지표로 옮기는 방법을 살펴봅니다.
연구소 내부의 개발 속도를 재는 세 가지 측정
Anthropic이 2026년 9월 17일 Measurements for understanding the pace of AI development inside frontier labs를 공개했습니다. 프런티어 AI 연구소 안에서 AI 개발이 얼마나 빨리 진행되는지 외부에서 확인할 수 있도록 세 가지 측정을 제안하고 Anthropic 내부의 현재 값을 함께 실었습니다. 세 측정은 AI 연구개발 가운데 AI가 수행하는 비중, AI 에이전트의 행동을 얼마나 잘 감독하는지, 연산 자원을 어디에 배분하는지입니다.
원문은 이 측정들이 모델을 만드는 과정을 다룬다고 설명합니다. 모델이 무엇을 할 수 있는지 재는 역량 평가는 Responsible Scaling Policy에 따른 위험 보고서로 따로 공개하고, 이번 측정은 연산 같은 투입과 역량 같은 산출을 연결해 보기 위한 보완 지표라는 위치입니다. Anthropic은 2026년 6월 정책 제안 Advanced AI Framework에서 정부가 요구할 수 있는 투명성 의무로 위험 보고서를 제시했고, 이번 측정도 연구소 밖에서 개발 속도를 감시하는 출발점으로 소개합니다.
두 가지 전제가 붙어 있습니다. 첫째, CEO Dario Amodei가 제안한 프런티어 개발 속도 조율이 이뤄지면 이 수치도 달라질 것으로 예상합니다. 둘째, Anthropic은 여러 기관의 독립 제3자 평가자를 사내에 두고 내부 위험 평가팀과 비슷한 수준으로 절차·시스템·데이터에 접근하게 할 계획이며, 이들이 안전 관행을 검증하고 사고를 보고하고 이런 지표를 모니터링하게 됩니다. 원문은 각 측정마다 무엇을 쟀는지, 결과가 무엇인지, 정기적으로 검증 가능한 형태로 공개하려면 무엇이 필요한지를 나눠 설명합니다. 이 글도 같은 순서를 따르고, 기업 관점의 해석은 마지막 두 섹션에 따로 모았습니다.
측정 1: AI가 수행하는 AI 연구개발의 비중
원문은 AI가 다음 모델 개발을 가속하면 민주주의 국가의 연구소가 더 빨리 개발하고 출시 전 안전 시험을 더 많이 할 수 있지만, 사람이 시스템을 이해하고 통제하기는 어려워질 수 있다고 봅니다. 이 지표는 모델이 후속 모델을 완전히 자율적으로 만드는 재귀적 자기개선에 세계가 얼마나 가까운지 보려는 것입니다.
Anthropic은 사내 AI 연구개발 가운데 Claude가 수행하는 비중을 보여주는 시제품 지수 Anthropic R&D Automation Index를 만들었습니다. 사내의 모든 AI 연구개발 업무를 목록으로 만들고 업무별 자동화 수준을 평가한 뒤 합산하는 방식입니다. 자동화 수준은 Epoch AI가 제안한 척도를 씁니다.
| 수준 | 원문 명칭 | 의미 |
|---|---|---|
| AL0 | No AI | AI 관여 없음 |
| AL1 | Minimal AI | 최소한의 AI 관여 |
| AL2 | AI assists | AI가 보조 |
| AL3 | AI collaborates | 사람의 긴밀한 지시 아래 AI가 큰 덩어리의 작업을 수행 |
| AL4 | AI leads | 높은 수준의 지시만으로 AI가 과업 대부분을 처음부터 끝까지 완료하고 사람은 감독 |
| AL5 | Fully automated | 사람의 개입 없이 AI가 완전히 자율적으로 수행 |
2026년 8월 기준 결과는 세 줄입니다. Claude가 완전 자율(AL5)로 수행하는 업무 영역은 측정된 범위 안에 없었습니다. Claude가 주도(AL4)하는 업무는 전체 AI 연구개발의 26%였습니다. 협업(AL3) 이상인 업무의 비중은 90%를 넘었습니다.

그래프에 표시된 AL4 비중의 월별 값은 다음과 같습니다. 이미지 설명에 따르면 2026년 2월에는 1% 미만이었습니다.
| 월 | Claude가 주도(AL4)하는 업무 비중 |
|---|---|
| 2026년 2월 | 1% 미만 |
| 2026년 3월 | 1% |
| 2026년 4월 | 3% |
| 2026년 5월 | 12% |
| 2026년 6월 | 14% |
| 2026년 7월 | 22% |
| 2026년 8월 | 26% |
원문 각주는 야간 데이터 파이프라인이 고장 나 다음 실행 전에 고쳐야 하는 상황으로 수준 차이를 설명합니다. AL3에서는 엔지니어가 실패 로그와 가설을 들고 와 Claude와 세부를 맞추고, 작업 중 새 문제가 나오면 Claude가 멈추고 엔지니어가 결정하며, 변경을 한 줄씩 검토하고 직접 배포합니다. AL4에서는 엔지니어가 장애 알림만 넘기면 Claude가 원인을 찾고 수정과 시험을 하고 데이터 사본으로 재실행해 직전 정상 결과와 비교하고 경위를 정리합니다. 배포는 하지 않고 엔지니어를 호출하며, 엔지니어가 정리본을 읽고 배포 시점을 정합니다. AL5에서는 Claude가 장애 감시부터 배포까지 맡고 사람은 원할 때만 관여하며, 원문은 이 수준에 아직 도달하지 않았다고 밝혔습니다.
자동화 지수의 산출 방법과 검증
지수에는 사내 AI 연구개발 업무의 전체 지도, 자동화 수준 평가 방법, 업무별 가중치가 필요합니다. 업무 목록은 Slack과 내부 문서 같은 업무 기록에서 아래로부터 쌓았습니다. 2026년 7월 매주 모델 연구개발에 참여하는 부서별로 직원 20%를 무작위 추출했고, Claude 연구 에이전트가 표본 직원의 한 주를 살펴 수행한 업무를 적었습니다. 이렇게 모은 세부 업무 약 15,000건을 Claude가 계층 트리로 정리했습니다.
완성된 트리는 노드 542개로 이뤄졌고 그중 말단 노드는 378개입니다. 말단 노드의 예로는 평가 플랫폼 결함 진단과 수정, RL 샌드박스 외부 통신과 네트워크 정책, 서빙 장애 사후 분석이 있습니다.
트리는 고정합니다. 이후 모든 측정을 같은 업무 바구니에 대해 하기 위해서입니다. 노드마다 Claude 에이전트가 사내에서 그 일을 누가 어떤 도구로 하고 AI가 얼마나 수행하는지 조사하고, 별도의 Claude 판정 모델이 증거를 읽고 여섯 단계 중 하나를 매깁니다. 특정 달을 평가할 때는 그달 이전의 증거만 보게 제한했습니다. 가중치는 투입된 인력 시간으로 정했습니다. 한 사람이 한 주에 1단위를 가지고 그 주에 한 업무 수만큼 나눕니다. 네 가지 업무를 했으면 각각 0.25, 열 가지를 했으면 각각 0.10입니다. 원문은 거친 근사지만 많은 사람이 투입된 범주에 더 큰 가중치가 가는 합리적인 동작을 보인다고 설명합니다.
검증은 해당 업무 영역을 담당하는 직원에게 모델이 모은 증거를 보여주지 않은 채 자기 영역의 자동화 수준을 매기게 해 비교했습니다. 판정 모델은 사람끼리 일치하는 만큼 사람과 일치했습니다. 판정 모델과 담당 직원이 같은 수준을 매긴 비율은 59%로 직원 사이의 정확 일치율 35%보다 높았고, 두 판정이 한 단계 이내로 맞은 비율은 97%였습니다. 다만 협업과 주도의 경계 같은 애매한 사례에서는 판단이 갈릴 여지가 있다고 인정합니다.
고정 바구니의 한계도 밝혔습니다. 2026년 7월 기준 지수가 오르면 당시 사람이 하던 일이 자동화되고 있다는 뜻이지만, 사람이 새로 옮겨 간 일이 생기는지는 따로 봐야 합니다. Anthropic은 2026년 1월 데이터로 별도 트리를 만들고 2월부터 7월까지 매달 새로 나타난 업무를 비교했는데, 새로운 업무의 수는 늘지 않았습니다. 그래도 바구니를 주기적으로 다시 만들고 공개 수치의 버전을 갱신할 계획입니다.
원문은 연구소 간 비교를 막는 장애물 두 가지를 꼽습니다. 공통 방법론이 없다는 점과 자사 모델로 자사 시스템을 평가해 판정 모델이 평가 대상과 같은 종류의 오류를 낼 수 있다는 점입니다. 해법으로 제3자 검증이나 다른 개발사 모델을 이용한 검증을 제시하고, 경쟁상 민감한 데이터 교환은 제한하는 장치를 두자고 합니다. 이 지표가 새 모델을 후속 AI 연구개발에 쓰기 전 고정된 시험 기간을 두는 것 같은 더 강한 요건의 발동 조건이 될 수 있다는 제안도 있습니다.
측정 2: AI 에이전트의 감독 수준
Anthropic 직원들은 오랜 시간 반자율로 일하고 서로 작업을 위임하는 에이전트에게 점점 더 많은 일을 맡기고 있습니다. 자동화가 협업에서 주도로 옮겨 가면 에이전트가 다음 연구 방향 같은 중요한 결정을 내릴 수 있습니다. 원문은 지금까지의 모니터링 데이터에서 개별 에이전트의 이상 행동은 드물었지만 경제 전체에서 수백만, 수십억 개의 에이전트가 움직이면 드문 사건도 정기적으로 일어날 수 있다고 봅니다.
지표는 세 가지입니다. 커버리지는 에이전트 행동 가운데 실행 전후에 모니터를 거치는 비율입니다. 검토 지연은 행동이 일어난 뒤 자동 모니터와 사람이 검토하기까지 걸리는 시간입니다. 에스컬레이션 비율은 에이전트 활동 가운데 차단되거나 방향이 바뀌거나(온라인 모니터) 추가 검토 대상으로 표시되는(오프라인 모니터) 비율입니다.
2026년 8월 기준 Anthropic에서 가장 많이 쓰는 내부 플랫폼에서는 연구와 엔지니어링 업무를 하는 에이전트 약 30,000개가 동시에 작동했습니다. 아래 수치는 이 플랫폼만 대상으로 합니다.
| 구분 | 온라인 모니터 | 오프라인 모니터 |
|---|---|---|
| 역할 | 실시간으로 행동을 검사해 위험한 행동을 차단하거나 방향을 바꿈. 모델 가중치 반출처럼 빠르게 일어나고 되돌릴 수 없는 피해 대상 | 사후에 활동을 읽음. 정렬 실패 징후처럼 천천히 진행되고 되돌릴 수 있는 위험 대상. 표시된 활동으로 분류기와 결정적 통제를 개선 |
| 커버리지 | 행동의 100%가 실행 전에 모니터를 거침. 보통 수 초 이내 | 행동의 100%가 실행 뒤 모니터에 수집됨 |
| 검토 지연 | 자동 검토는 실행 전. 차단된 행동은 1주 이내에 사람이 검토 | 주당 약 100,000건의 대화 기록을 표시하고 여러 분류기가 오탐과 1차 검토를 처리. 우선순위가 가장 높은 약 50건이 매주 사람 검토로 올라감 |
| 차단·에스컬레이션 비율 | 2026년 8월 10억 건 이상의 결정 중 0.002%(약 47,000건에 1건) 차단 | 대화 기록 1,000건에 1~2건을 추가 검토 대상으로 표시 |
오프라인 모니터의 단계별 규모를 로그 축으로 나타내면 다음과 같습니다.
| 단계 | 주당 규모 |
|---|---|
| 오프라인 모니터가 표시한 대화 기록 | 약 100,000건 |
| 분류기 검토 후 사람에게 올라간 기록 | 약 50건 |
원문은 자기 연구와 엔지니어링 업무에 에이전트를 쓰는 개발사라면 누구나 커버리지, 검토 지연, 에스컬레이션 비율을 공개할 수 있다고 봅니다. 여기에 더해 알려진 이상 행동을 모니터가 얼마나 잡아내는지 공개하고 제3자가 독립적으로 시험해야 한다고 권합니다.
감독을 가능하게 한 설계와 외부 레드팀
부록은 가장 많이 쓰는 내부 에이전트 실행 환경의 두 가지 설계를 소개합니다. 첫째는 개별 식별자입니다. 에이전트마다 고유한 정체성을 주고 그 에이전트가 만든 모든 데이터를 식별자에 연결합니다. 에이전트는 다른 에이전트에게서 온 내용을 확인할 주장으로 다루게 되고, 각자의 경험으로 판단해 여러 에이전트가 같은 방향으로 움직이는 위험이 줄어듭니다. 식별자는 모델과 묶이지 않아 모델이 업그레이드돼도 기록이 이어집니다. 감독 측면에서는 모든 행동을 에이전트별로 시간에 걸쳐 감사할 수 있습니다.
둘째는 공개 메시징입니다. 에이전트는 공유된 공개 메시징 시스템으로 소통하고, 모든 메시지는 작성한 에이전트의 식별자에 묶이며 원본 자료를 링크로 공유합니다. 전달 과정에서 내용이 변형되는 일을 막고 서로의 오류를 바로잡을 수 있습니다. 모든 메시지는 에이전트 대화 기록과 교차 참조돼 행동 모니터링이 에이전트 간 소통까지 따라갑니다.
원문은 이 규모의 에이전트 활동에서 가능한 행동 유형을 모두 파악했다고 확신하기 어렵고, 이런 모니터링을 시작한 지 수개월밖에 되지 않았다고 밝힙니다. 외부 검증 사례로는 METR의 레드팀을 언급합니다. 2026년 8월 위험 보고서(편집본)에 따르면 METR 직원 한 명이 2026년 2~3월 3주 동안 자동 오프라인 모니터링 파이프라인을 공격했고, 새로운 취약점 여러 개를 찾았습니다. 일부는 수정됐고 이미 알던 취약점보다 심각한 것은 없었습니다. 같은 보고서는 모니터링이 모든 에이전트 사용을 다루지는 못하고 모니터링을 끄는 단순한 방법도 있다고 적었으며, 세부 내용은 편집본에서 가렸습니다.
측정 3: 연산 자원의 배분
AI 개발사는 연산을 더 강력한 모델 개발, 고객 서비스, 안전 연구에 씁니다. 안전 연구에는 모델의 내부 사고 감사, 정렬 실패를 연구하기 위한 모델 유기체 학습, 배포 안전성 평가가 들어갑니다. 원문은 연산이 AI 연구개발 투입 요소 가운데 검증하기 가장 쉬운 편이라 향후 속도 조율에서 중요한 수단이 될 수 있다고 봅니다.
Anthropic은 2026년 7월 13일부터 20일까지 한 주 동안의 전체 연산 사용을 분석했습니다. 모든 작업을 소수의 범주로 나누고, AI 연구개발에 쓰인 연산 가운데 안전 연구가 차지한 비중을 계산했습니다.
| 기준 | 안전 연구에 배분된 비중 |
|---|---|
| AI 연구개발에 쓰인 연산 | 약 6% |
| AI가 수행한 AI 연구개발에 쓰인 연산 | 약 12% |
원문은 의도적으로 보수적인 추정이라고 설명합니다. 역량 향상과 안전 향상에 같은 정도로 기여한 연산은 안전으로 세지 않았습니다. 안전장치 분류기가 쓰는 연산은 이 수치에 들어가지 않았는데, 원문은 그 규모가 이와 비슷한 수준이라고 밝혔습니다. 안전 연구는 연구자가 실험을 설계하는 데 시간이 많이 들고 실험 실행 자체는 연산을 많이 쓰지 않아 원래 대규모 학습보다 연산이 적게 듭니다. 그래서 원문은 절대값보다 개발사 사이와 시점 사이를 같은 기준으로 비교하는 데 이 지표의 가치가 있다고 봅니다. 연산은 하나의 풀로 관리되며 생산성이 높은 곳에 동적으로 배분되므로 이 수치는 해당 주에 배분된 결과를 보여주는 스냅샷입니다. 회계상 비용 분류와도 일치하지 않습니다.
산출 과정은 기존 용량 계획용 모니터링 도구에서 시작했습니다. 가속기 사용량을 주기적으로 샘플링하고 메타데이터로 작업에 꼬리표를 붙이는 도구이며, 외부 클라우드 사용량은 제공사 보고를 합쳤습니다. 작업의 대부분은 이 기존 자료를 이어 붙이는 일이었습니다. 이어서 Claude 기반 분류기가 작업마다 안전 연구와 AI 연구개발 중 하나로 분류했습니다. 안전 연구는 AI 시스템을 더 안전하고 이해하기 쉽고 보안이 강하도록 만드는 것이 주된 목적인 일로 정의했고, 역량 연구, 생산 모델 학습, 제품 개발, 개발자 도구는 모두 AI 연구개발로 셌습니다.
연구용 학습·평가 실행은 분류기가 실행 메타데이터와 사용 코드를 읽고 분류, 근거, 확신도를 반환했습니다. 해당 주의 실행 약 10,000건을 모두 분류하지 않고 약 14%를 표본으로 뽑았으며, 실행 건수보다 연산이 실제로 쓰인 곳을 반영하도록 연산 사용량이 큰 실행에 가중을 뒀습니다. 연구 에이전트의 추론은 같은 분류기의 변형이 세션 기록을 읽어 분류했습니다. 업무 구획 때문에 기록에 접근할 수 없는 경우에는 사용자 소속 팀으로 분류하거나 보수적으로 AI 연구개발로 분류했습니다. Anthropic은 독립 제3자가 작업과 기록의 무작위 표본에 분류기를 다시 실행해 분류와 합계를 확인할 수 있도록 파이프라인을 다듬을 계획입니다.
경계 사례를 담은 상세한 서면 정의를 주자 분류기와 사람 검토자의 결과 차이가 1~2%포인트 이내로 줄었습니다. 그래도 몇 시간의 사람 검토로도 판정하지 못한 사례가 있었습니다. 원문은 확장 가능한 감독 연구처럼 미래 모델의 정렬에 도움이 되면서 현재 모델의 상업적 가치도 높이는 연구를 예로 듭니다. 추가 한계는 세 가지입니다. 기반 꼬리표가 자동 규칙이나 사용자가 붙인 것이라 검증되지 않았다는 점, 한 주 측정으로는 추세를 보일 수 없다는 점, 연산 비중은 지출만 잰다는 점입니다. 더 효율적인 안전 분류기나 더 빠른 생산 추론 환경은 안전 비중을 낮추지만 안전 작업이 줄었다는 뜻은 아닙니다.
원문은 안전 연구와 역량 연구의 구분이 어려워 개발사마다 선을 후하게 긋고 싶어질 것이므로 입증 책임을 개발사에 둬야 한다고 주장합니다. 개발사와 정부와 연구계가 공통 정의를 미리 합의하면 안전 연구 연산 비중에 대한 약속이나 AI 연구 에이전트에 가는 연산 비중의 상한 같은 조치에 쓸 수 있다고 봅니다.
코텍시스의 해석: 기업 AI 운영에 옮겨 볼 세 지표
이 섹션은 코텍시스의 해석입니다. 원문은 프런티어 연구소의 개발 속도를 다루지만, 세 질문은 AI 에이전트를 업무에 넣는 기업이 스스로 물어야 할 질문과 구조가 같습니다. 필자는 원문의 정의와 산출 방법을 기업 규모에 맞게 옮기면 다음과 같이 쓸 수 있다고 봅니다.
첫째, AI 연구개발 자동화 지수는 우리 업무 가운데 에이전트가 주도하는 비중이 얼마인지 묻는 지표로 옮길 수 있습니다. 업무 기록에서 과업 목록을 만들어 고정하고 AL0~AL5로 평가한 뒤 인력 시간으로 가중하는 방법을 그대로 가져옵니다. 둘째, 에이전트 감독 지표는 에이전트 행동을 얼마나 보고 있고 얼마나 빨리 확인하는지 묻는 지표가 됩니다. 커버리지, 검토 지연, 에스컬레이션 비율에 사람 검토 건수를 더해 잽니다. 셋째, 연산 배분은 AI 지출이 어떤 목적에 쓰이는지 묻는 지표로 바뀝니다. 목적 범주와 경계 사례를 먼저 문서로 정의하고 애매한 항목은 보수적으로 분류합니다.
자동화 비중에서 참고할 점은 판정 기준입니다. Anthropic에서도 직원끼리 자동화 수준을 정확히 같게 매긴 비율은 35%였습니다. 기업이 같은 척도를 쓰려면 파이프라인 수리 각주처럼 자기 업무로 된 수준별 예시를 먼저 만들어 두는 편이 판정 차이를 줄일 것입니다. 바구니를 고정하는 방식도 유용합니다. 도입 초기의 업무 목록을 고정해 두면 지수 변화가 자동화 진전인지 업무 구성 변화인지 구분할 수 있습니다.
감독 지표에서 눈여겨볼 수치는 주당 약 100,000건의 표시가 약 50건의 사람 검토로 줄어드는 구조입니다. 에이전트 수가 늘어나도 사람이 볼 수 있는 양은 거의 늘지 않으므로, 에이전트를 도입하는 조직은 자동 검토 단계와 사람 검토 단계를 나누고 사람 검토 건수를 감당 가능한 수준으로 유지하는지 따로 재야 합니다. 에이전트별 식별자와 기록 연결은 이 측정의 전제 조건입니다. 공용 계정 하나로 여러 에이전트를 운영하면 커버리지를 계산할 단위부터 사라집니다.
지출 배분에서는 원문이 밝힌 한계가 그대로 적용됩니다. 한 주 스냅샷은 추세가 아니고, 효율이 좋아지면 비중이 내려가도 실제 활동량은 줄지 않았을 수 있습니다. 검증이나 보안 같은 목적의 지출 비중을 볼 때는 정의를 먼저 문서화하고 분류 결과를 사람이 표본 검토하는 절차를 함께 두는 편이 안전합니다.
우리나라 기업이 확인할 것
- 사내 AI 활용도를 도입률이나 사용자 수로만 보고 있다면 업무 단위 자동화 수준을 함께 재는지 확인합니다. Anthropic은 업무 기록에서 과업 약 15,000건을 모아 AL0~AL5로 평가하고 인력 시간으로 가중했습니다. 같은 틀을 핵심 부서 한두 곳에 먼저 적용해 볼 수 있습니다.
- 에이전트를 운영한다면 커버리지, 검토 지연, 에스컬레이션 비율을 정의했는지 확인합니다. 되돌릴 수 없는 행동에는 실행 전 차단을, 되돌릴 수 있는 위험에는 사후 검토를 두는 온라인·오프라인 구분은 권한 설계에 그대로 쓸 수 있는 기준입니다.
- 에이전트마다 고유 식별자가 있고 모든 행동과 산출물이 그 식별자에 연결되는지 확인합니다. 원문은 이 설계가 에이전트별 감사와 에이전트 간 소통 추적의 바탕이라고 설명합니다.
- AI 지출을 목적별로 나눌 정의와 경계 사례가 문서로 있는지 확인합니다. 원문처럼 애매한 항목은 보수적으로 분류하고 한 번의 스냅샷을 추세로 해석하지 않는 원칙을 함께 정해 두면 좋습니다.
- 자동 판정 결과를 사람의 판정과 비교해 본 적이 있는지 확인합니다. Anthropic은 판정 모델과 담당 직원의 일치율, 분류기와 사람 검토자의 차이를 공개했고 외부 레드팀도 받았습니다. AI로 AI를 평가하는 구조라면 이 비교가 지표의 신뢰도를 정합니다.
출처: Measurements for understanding the pace of AI development inside frontier labs, Redacted Risk Report August 2026, Anthropic's Advanced AI Framework, Epoch AI 자동화 척도
코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.
코텍시스 AI 인사이트 최신 논문 리뷰
AWQ 양자화: 활성값을 보고 가중치를 지키는 4비트 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

