Anthropic이 AI 에이전트가 실험·제조 장비를 조작하는 공통 규격 MHS의 연구 프리뷰를 열었습니다. 표준 드라이버 구조와 Genentech·CMU·QuEra 등 파트너 여섯 곳의 사례 수치, 남은 한계를 정리하고 우리나라 기업이 확인할 지점을 짚습니다.
연구 프리뷰로 공개된 MHS의 범위
Anthropic이 2026년 8월 27일 Previewing the Model Hardware Standard를 공개했습니다. Model Hardware Standard(MHS)는 AI 에이전트가 물리 장비를 안전하게 조작하기 위한 공유 규격입니다. 연구 프리뷰는 과학 연구 실험실과 첨단 제조사로 구성된 1차 그룹에 먼저 열렸습니다. 개발은 Anthropic과 HHMI Janelia Research Campus의 협업에서 시작됐습니다.
MHS가 겨냥하는 장비는 현미경, 액체 취급 장비(liquid handler), 로봇 팔 같은 실험실과 제조 현장의 기기입니다. 에이전트가 여러 장비를 병렬로 조작하면서 일상적인 신약 탐색 실험부터 양자 컴퓨터의 레이저 보정까지 수행하도록 설계했습니다. Anthropic은 실험실이나 제조 시설이 하드웨어를 설정하고 통합하는 데 보통 수 주에서 수 개월이 걸리고, MHS가 이 작업을 몇 시간이나 몇 분으로 줄인다고 설명합니다. 에이전트가 실험 단계를 추론하고 파라미터를 실시간으로 바꾸며, 일부 경우에는 사람 개입 없이 하드웨어 오류에서 복구하는 24시간 실험도 목표로 둡니다.
적용 조건은 세 가지로 요약됩니다. 프로그래밍 인터페이스가 있는 장비라면 어떤 장비든 쓸 수 있습니다. 규격은 특정 모델에 묶이지 않습니다. 에이전트 하네스는 Model Context Protocol 같은 표준 프로토콜로 접근합니다. Anthropic은 과학·로보틱스·전자·제조 분야 파트너와 안전성 평가와 운영 모범 사례를 먼저 만든 뒤 규격을 오픈소스로 공개할 계획입니다.
표준 드라이버와 참조 파일의 구조
실험실이나 공장에서 여러 장비를 연결하기 어려운 이유는 장비마다 프로그래밍 인터페이스가 다르고 통합하는 표준 방식이 없었기 때문입니다. 연결한 뒤에도 장비 데이터를 AI 에이전트와 공유하거나 에이전트가 장비를 안전하게 조작하게 하는 공통 방식이 없었습니다.
MHS는 이 문제를 표준 드라이버로 풉니다. 드라이버는 컴퓨터 운영체제와 하드웨어 사이를 번역하는 소프트웨어입니다. MHS 드라이버는 "read"(예: 온도 읽기)와 "write"(예: 온도 설정) 같은 단순한 프리미티브만 사용합니다. 각 장비를 표준 형식으로 발견 가능하게 만들기 때문에 장비와 에이전트가 별도의 번역 프로그램 없이 네트워크에서 서로를 찾고 통신합니다.
| 구성 요소 | 원문 설명 |
|---|---|
| 표준 드라이버 | read와 write 프리미티브로 명령을 통일하고 장비를 표준 형식으로 노출 |
| 자연어 태그 | 로봇 팔 무게처럼 코드만으로 알 수 없는 장비 특성을 사용자가 직접 기록하거나 에이전트 인터뷰로 작성 |
| 참조 파일 | 태그 정보로 자동 생성하며 측정 항목, 조정 항목, 적용될 안전 한계를 담음 |
| 제어 경로 | MCP, 커맨드라인 인터페이스, 코드 파일(API) 세 가지를 조합해 코드 한 줄로 여러 장비를 오케스트레이션 |
| 코드 파일 실행 | 긴 작업이나 에이전트 추론보다 빠른 조작이 필요할 때 드라이버 명령을 묶어 장비가 스스로 실행 |
그동안 장비 정보는 종이 매뉴얼이나 사용자의 컴퓨터, 담당자의 암묵지로 흩어져 있었습니다. MHS는 이 정보를 드라이버 안의 태그에 자연어로 적게 하고, 참조 파일로 정리해 처음 보는 장비라도 에이전트가 사용법을 알게 합니다.
Anthropic은 테스트 중 Claude가 과학자처럼 탐색적으로 장비를 다뤘다고 기록했습니다. Claude는 레이저를 조정하고 카메라로 빔이 어떻게 움직였는지 확인하는 과정을 반복하며 인과 관계를 파악했습니다. 이어서 학습한 내용을 결정론적 스크립트로 정리해 정렬 작업 전체가 명령 하나로 실행되게 했습니다.
규격의 출발점도 원문에 나옵니다. Anthropic Beneficial Deployments 팀의 Alek Kemeny와 HHMI Janelia 박사후 연구원 Arco Bast의 협업이었습니다. Bast는 서로 다른 벤더의 레이저·전동 초점기·특수 카메라를 조합한 뇌 영상 장비를 운영하면서 장비들이 메모리 속도로 통신하는 공유 메모리 딕셔너리를 만들었고, 두 사람이 여기에 AI 모델을 통합했습니다.
초기 파트너 사례 요약
원문은 바이오, 로보틱스, 양자 컴퓨팅 분야의 파트너 여섯 곳이 직접 쓴 사례를 싣고 있습니다.
| 기관 | 과제 | 원문이 밝힌 결과 |
|---|---|---|
| Genentech | BCA 단백질 정량 분석 자동화 | 물 약 140 µL/s, BSA 10 µL/s 유량을 스스로 도출하고 전문가가 타당성 확인 |
| University of Washington Baker·Pinglay 연구실 | 원격 감시, qPCR 감독, 플레이트 인계 | 장비 6대 연결에 드라이버 작성 포함 1주 미만 |
| Carnegie Mellon University | 연속 희석 용량 반응 실험 | 통합부터 곡선 완성까지 8시간, 실험 속도 약 3배 |
| HHMI Janelia | 2광자 현미경 장비 통합 | 프로그램 7개를 순서대로 띄우던 시작 절차를 대시보드 클릭 한 번으로 단축 |
| QuEra Computing | 양자 컴퓨터 레이저 락 복구와 튜닝 | 블라인드 테스트 700회 중 695회 복구(99.3%) |
| Tetsuwan Scientific | qPCR 워크플로와 컴파일러 개선 | 다중 분주 정밀도 예측이 제조사 사양보다 약 12% 정확 |
Genentech 사례: BCA 분석 자동화와 물리 추론의 한계
Genentech 연구진은 BCA(bicinchoninic acid) 단백질 분석을 개념 증명 과제로 골랐습니다. 시료의 총 단백질 농도를 재는 표준 절차이며 액체 취급 장비, 실험 기구를 옮기는 로봇 팔, 흡광도를 읽는 마이크로플레이트 리더 세 장비의 협업이 필요합니다. 세 장비 모두에 MHS를 배포했고 Claude가 프로토콜을 조율하는 중앙 통신 허브 역할을 맡았습니다. 실험은 표준 96웰 마이크로플레이트에서 진행했습니다.

첫 시험에서 Claude는 표준 프로토콜을 실행했지만 수용액과 점성 용액에 같은 유량을 적용했습니다. 그 결과 점성 용액에 거품이 생겨 이송량이 부정확해졌습니다. 연구진은 이어서 전문가가 정한 유량 범위 안에서 염색 액체로 시험 이송을 하고 흡광도를 읽어 액체별 최적 유량을 찾게 했습니다. 같은 플레이트에는 전문가가 수행한 기준 이송이 있었고, Claude는 자신의 결과와 기준의 차이를 평균제곱근오차(RMSE)로 계산했습니다.
| 액체 | Claude가 도출한 유량 | RMSE |
|---|---|---|
| 물 | 약 140 µL/s | 0.016 |
| BSA(소 혈청 알부민) | 10 µL/s | 0.181 |
Genentech 자동화 전문가들은 이 값이 해당 설비에 타당하다고 확인했습니다. 원래는 자동화 전문가가 파라미터 조합마다 맞춤 로직을 짜고 데이터를 반복 분석해야 하는 작업입니다.
실험 도중 팁 집기 실패와 액체 감지 오류가 여러 번 발생했고 Claude는 스스로 복구했습니다. 한계도 분명했습니다. 혼합 중 거품으로 런타임 오류가 나자 Claude는 같은 웰에서 파라미터만 바꿔 재시도했고, 이 행동이 액체를 더 휘저어 거품을 늘렸습니다. 연구진이 오류 코드의 원인이 물리적 거품이며 깨끗한 웰로 옮기고 혼합 횟수를 줄여야 한다고 알려주자 Claude는 남은 실행 내내 그 맥락을 유지했습니다. 연구진은 이 교훈을 재사용 가능한 액체 취급 스킬로 정리해 오류 횟수를 줄였습니다. 다음 단계로는 원심분리기·자동 인큐베이터·분석 장비·센서로 MHS를 넓힐 계획입니다.
University of Washington 사례: 원격 감시와 장비 간 인계
Baker·Pinglay 연구실의 박사과정 Zihao Song은 신규 단백질 설계의 병목을 설명합니다. PETase 같은 단백질 설계 비용은 0.01달러까지 내려왔지만 실험대에서 후보 하나를 검증하는 데 약 100달러와 1주의 노동이 들고, 연구실은 후보 1,000개를 한 번에 검증합니다. PCR 장비는 한 번에 플레이트 하나만 처리해 90분마다 플레이트를 갈아야 했습니다. 서로 다른 벤더 장비를 연결하는 통합에는 수개월에서 수년, 수천에서 수백만 달러가 든다고 적었습니다.

첫 번째 시연은 원격 감시입니다. 장비 상태가 대시보드 하나로 모이면서 노트북이나 휴대전화의 AI 에이전트로 실험실 전체를 확인할 수 있게 됐습니다. qPCR은 증폭 곡선이 S자로 올라가다 평탄해지는데, 평탄 구간까지 반응을 두면 DNA 라이브러리가 왜곡됩니다. 에이전트는 곡선을 실시간으로 분석해 적절한 시점에 연구자에게 중단 여부를 묻고, 중단 지시를 받으면 DNA 분해를 막는 4 °C 유지 단계로 넘깁니다.
두 번째 시연은 장비 간 인계입니다. LeRobot 기반 오픈소스 로봇 팔에 MHS를 붙여 액체 취급 장비가 분주를 마치면 로봇 팔이 플레이트를 빼고 새 플레이트를 넣게 했습니다. Claude Code가 이전 단계가 끝난 뒤에만 다음 단계를 실행했고, 분주 완료 신호를 받은 뒤 약 10초 후 팔을 움직였습니다. 반복 시험에서 두 장비는 한 번도 충돌하지 않았습니다.
장비 6대를 MHS로 연결하는 데는 드라이버 작성 시간을 포함해 1주가 걸리지 않았습니다. 저자는 이 시연들이 아직 개념 증명이며, 복잡한 프로토콜은 상당한 최적화가 필요하고 에이전트를 긴 감시 시간 동안 돌리는 연산 비용을 연구자 시간 절감과 비교해야 한다고 덧붙였습니다.
Carnegie Mellon University 사례: 호환되지 않는 세 컴퓨터를 하나로
CMU 연구진은 약물 용량을 정하는 연속 희석 용량 반응 실험을 자동화했습니다. 최대 농도가 너무 높으면 신호가 포화되고, 희석 간격이 너무 좁거나 넓으면 반응이 바뀌는 구간을 놓치기 때문에 보통 여러 차례 반복이 필요합니다. 사람이 하면 몇 주가 걸리는 작업입니다.
설비는 Analytik Jena CyBio FeliX 액체 취급 장비와 Thermo Scientific Varioskan LUX 플레이트 리더, Thermo Scientific Spinnaker 로봇 팔과 감시 카메라로 구성됐고 세 대의 컴퓨터에 나뉘어 있었습니다.
| 컴퓨터 | 장비 | 원래 제어 방식 |
|---|---|---|
| 1 | 로봇 팔 | 제출 디렉터리에 작업 파일을 넣는 스케줄링 소프트웨어 |
| 2 | 액체 취급 장비, 감시 카메라 | 구형 Windows ActiveX/COM 스크립팅, 카메라는 USB |
| 3 | 플레이트 리더 | 프로그래밍 인터페이스 없이 화면 GUI만 존재 |
MHS는 세 방식을 상태(예: 3번 위치의 플레이트, 25°C 시료)와 절차(예: 흡인, 흔들기)로 이뤄진 매니페스트 하나로 바꿨습니다. 액체 취급 장비는 COM 스크립팅만 제공해 벤더 문서와 Claude Opus 4.8 에이전트의 인터페이스 탐색으로 드라이버를 만들었고, 플레이트 리더는 사람이 하듯 GUI를 조작했습니다. 분주 한 사이클은 4~5분이며 분주량 허용 오차는 5%입니다. 드라이버와 오케스트레이션 계층을 처음부터 만드는 데 약 8시간이 걸렸고, 벤더가 구축하는 설비는 보통 수 주가 걸린다고 비교했습니다.
안전성 검증을 위해 연구진은 플레이트 누락·플레이트 회전·리더 사용 중·카메라 분리·장비 연결 불가·비상 정지 활성화의 여섯 조건을 인위로 만들었고 시스템은 장비가 움직이기 전에 여섯 가지를 모두 차단했습니다. 이어진 실험에서 에이전트는 첫 실행의 적합도가 R² 0.9 미만이라 받아들일 수 없다고 판단했습니다. 상위 농도 구간의 포화가 원인이었고, 에이전트는 플레이트를 버리고 최대 농도를 200 µg/mL에서 100 µg/mL로 낮춰 새 플레이트로 다시 실행했습니다.


두 번째 실행은 R² 0.98을 넘는 적합도를 냈고 전 과정에 사람 입력은 없었습니다. 연구진은 장비별 드라이버를 표준화해 공개할 예정이며, 실제 약물 후보 검증과 qPCR, 현미경으로 확장하고 고위험 결정에서 사람 승인이 필요한 시점과 방식을 다듬겠다고 밝혔습니다.
HHMI Janelia 사례: 벤더 프로그램 일곱 개를 공유 메모리 하나로
Ahrens 연구실의 Virginie Ruetten은 수면이 스트레스 회복에 어떻게 기여하는지 연구합니다. 몸이 작고 투명한 어린 제브라피시를 대상으로 2광자 현미경을 쓰는 WHOLISTIC 영상 기법으로 뇌와 몸 전체의 세포 활동을 관찰합니다. 장비는 펨토초 레이저와 갈바노미터 거울, 광전자증배관 검출기와 정밀 이동 스테이지 두 개로 이뤄졌고 벤더가 모두 다릅니다. 검출기는 MATLAB, 카메라는 Python, 전기생리 장비는 C#으로 돌아 한 프로그램이 가진 값을 다른 프로그램이 알 수 없었습니다. 실험을 시작하려면 프로그램 일곱 개를 정해진 순서로 띄워야 했고 순서를 틀리면 세션 전체를 잃을 수 있었습니다.
MHS는 장비 간 1:1 연결을 공유 메모리의 상태 딕셔너리 하나로 대체했습니다. 이전에는 새 하드웨어 통합이 며칠짜리 프로젝트였지만, 레이저 빔을 찍는 카메라를 새로 추가하는 데 몇 분이면 충분했습니다. 실험 시작도 대시보드 클릭 한 번으로 줄었습니다. 모든 데이터 스트림이 같은 형식으로 저장되면서 장비별로 분석 코드를 새로 쓰던 부담이 사라졌고, 데이터 유형별 뷰어 하나로 어떤 스트림이든 수집 중에 볼 수 있게 됐습니다.
에이전트 활용은 다음 단계입니다. Ruetten은 수집과 분석을 오가는 결정론적 루프를 만들고, 에이전트가 판단 지점에서 촬영 영역과 분석 방식을 고르게 했습니다. MHS가 장비 수준에서 안전 한계를 강제하므로 에이전트가 과도한 레이저 출력으로 형광 분자를 탈색시킬 걱정을 덜었습니다. 이 방식으로 고정 설정이었다면 놓쳤을 진동 세포군을 찾아냈고, 같은 수의 유효 기록을 얻는 데 필요한 반복 실행과 실험 동물 수가 줄었습니다.
Janelia에서는 다른 프로젝트도 진행 중입니다. Spruston 연구실의 Arco Bast 팀은 가상 환경을 학습하는 생쥐의 뇌에서 뉴런을 촬영하며, Claude가 빔 정렬과 광학 조정을 맡아 반나절 걸리던 수동 설정을 한 단계로 줄였습니다. Magdalena Schneider와 Hari Shroff가 이끄는 팀은 광시트 현미경에서 Claude가 예쁜꼬마선충 배아 촬영 방식을 실시간으로 결정하게 합니다.
QuEra Computing 사례: 양자 컴퓨터 레이저 락 복구와 튜닝
중성 원자 방식 양자 컴퓨터를 만드는 QuEra는 원자를 레이저로 제어합니다. 레이저는 약 1조분의 1 정밀도로 주파수를 유지해야 하며, 이 상태를 락(lock)이라고 부릅니다. 온도, 진동, 기압 변화가 락을 풀면 양자 연산이 실패하기 시작합니다. 대상은 20년 넘게 원자물리 분야에서 쓰인 티타늄 사파이어 레이저이며, 드문 고장은 여전히 숙련 운영자가 5~10분에 걸쳐 복구해야 했습니다.

락 복구 컨트롤러
MHS 이전에 레이저 시스템 엔지니어·소프트웨어 엔지니어·알고리즘 전문가·테스터로 이뤄진 팀이 복구 스크립트를 만들었습니다. 사람의 절차를 그대로 따르는 선형 스크립트였고 성공률은 약 58%, 시도당 약 150초가 걸렸습니다. 중간에 문이 열려 기압이 바뀌는 식으로 이미 끝낸 단계가 흐트러지면 처음부터 다시 해야 했습니다.
QuEra는 같은 문제를 MHS로 Claude에 넘겼습니다. 목표는 레이저를 다시 락하는 독립 Python 스크립트였고, 성공 기준은 첫 시도에 락한 뒤 30초 유지였습니다. 빔 차단, 장비 전원 차단, 주파수 이탈 같은 교란을 일부러 만들었습니다. 에이전트 루프는 매번 새로 띄운 Claude 인스턴스 네 개가 역할을 나눴습니다. 첫 인스턴스는 가설을 세우고 둘째는 스크립트를 고쳤습니다. 셋째는 실제 레이저에서 스크립트를 실행하며 기록했고 넷째는 기록을 읽고 다음 변경을 정했습니다. 이 순환이 밤새 수백 번 반복됐고 아침에는 복구 시간이 약 6초, 성공률이 96%가 됐습니다.

개선의 핵심은 선형 절차를 결정 트리로 바꾼 것입니다. 스크립트는 각 장비 값을 읽고 교란 유형에 맞는 조정만 합니다. 주파수가 조금만 움직였다면 조정 장치 대부분을 건드리지 않고 한두 개만 조정합니다. 에이전트 없이 완성 스크립트만 돌린 블라인드 테스트 결과는 다음과 같습니다.
| 지표 | 기존 | MHS와 Claude 적용 후 |
|---|---|---|
| 복구 성공률 | 약 58%(수작업 스크립트) | 700회 중 695회, 99.3% |
| 복구 시간 | 시도당 약 150초, 사람은 5~10분 | 어려운 교란 10 |
| 운영 형태 | 숙련 운영자 대기 | 에이전트 없이 실행되는 결정론적 스크립트 |
QuEra 블로그 Holding the Light는 세부 조건을 더 밝힙니다. 검증은 교란 유형 7가지에 유형별 100회였고, 실패 5회는 모두 같은 장비 상태 원인이었으며 컨트롤러는 그때마다 성공을 주장하지 않았습니다. 시험 기간에 레이저가 자연 발생적으로 모드를 벗어난 43회도 모두 자동 복구했습니다. 에이전트는 사람이 정한 안전 범위 안에서 약 70만 달러 규모의 정밀 장비를 운용했고, MHS는 장비가 선언한 한계와 인터록, 비상 정지를 모델과 무관하게 하드웨어 인터페이스에서 강제합니다.
PID 파라미터 튜닝
락 품질은 서보 루프 안의 서로 얽힌 PID 파라미터 12개가 좌우합니다. 전문가는 보통 서보가 보고하는 RMS 오차를 기준으로 튜닝하는데, 변경마다 오실로스코프 파형을 받아 푸리에 변환으로 전체 스펙트럼을 계산하는 일은 사람이 하기 어렵습니다. Claude는 조정할 때마다 이 계산을 수행했습니다.

전문가가 맞춰 둔 기존 설정의 잔여 오차는 15.7 mV였고, Claude는 무인 16시간 동안 실험 363회를 거쳐 1.55 mV까지 낮췄습니다. RMS 기준으로 약 10배 조용해진 결과입니다. 독립 검증을 위해 전문가가 Claude의 결과를 보지 않고 같은 레이저를 평소 방식으로 다시 튜닝했고, 두 설정을 위상 잡음 분석기로 비교했습니다. 두 설정은 대역 전반에서 비슷했지만 약 220 kHz 공진에서 수동 설정이 Claude 설정보다 약 1,000배 많은 잡음을 남겼습니다. 19시간 연속 운전에서 Claude의 설정은 락을 한 번도 잃지 않았고 전문가 설정은 시간당 약 1.6회 풀렸습니다. QuEra 블로그에 따르면 약 12,500회 평가 중 레이저 모드를 벗어나게 한 설정은 없었고, 두 번째 운용 파장에서도 무인 하룻밤 실행으로 락을 약 10배 조용하게 만들었습니다.
한계도 기록됐습니다. 하드웨어에 물리적 문제가 생기면 Claude는 대처법을 몰랐습니다. 장비를 코드 수준으로만 이해했기 때문입니다. 조금이라도 위험하다고 판단한 동작 앞에서는 사람 확인을 기다렸고 그 때문에 실험이 밤새 멈춘 적도 있습니다. 원하는 결과와 수행 방식에 대한 맥락도 많이 제공해야 했습니다. 락 복구 컨트롤러는 AI가 실행 경로에서 빠진 운영용 스크립트이고, 튜닝 워크플로는 아직 에이전트가 루프 안에 있어 독립 도구로 만드는 작업이 다음 과제입니다.
Tetsuwan Scientific 사례: 하드웨어에 묶이지 않는 프로토콜
Tetsuwan은 연구자와 에이전트가 API로 쓰는 자동화 생물학 실험실을 만들고 있습니다. 실험 구성 하나를 자동화 워크플로로 옮기는 데 자동화 엔지니어가 수 주에서 수 개월을 쓰기 때문에, 자동화는 대규모 반복 실험에서만 수지가 맞았습니다. 자체 플랫폼 ResearchOS에서는 Claude가 자연어 프로토콜을 전용 문법의 스크립트로 옮기고 자체 컴파일러가 자동화 코드로 변환합니다. Tetsuwan 블로그에 따르면 최신 버전은 기존 스케줄러와 드라이버 스택을 MHS 명령으로 완전히 대체했고, 벤더 지원이 없는 장비에는 커넥터 역할의 싱글보드 컴퓨터를 달았습니다.
MHS가 준 변화는 세 가지입니다. 첫째, 오류 대응입니다. qPCR용 마스터 믹스는 점성이 높아 거품이 잘 생기는데, 카메라로 이송마다 사진을 찍고 컴퓨터 비전으로 거품을 잡아냅니다. 로봇 팔이 든 튜브에서 거품이 발견됐을 때 ResearchOS가 MHS에 연결된 장비를 찾았고, Claude가 Slack으로 튜브를 원심분리기에서 저속으로 잠깐 돌리자는 해결책을 제안한 뒤 원심분리기에 명령을 보냈습니다. 둘째, 하드웨어 독립성입니다. 프로토콜에 원심력만 적어 두면 ResearchOS가 네트워크에서 호환 원심분리기를 찾고, Claude가 그 장비가 받는 파라미터로 환산합니다. 셋째, 컴파일러 개선입니다. Claude가 MHS로 플레이트 리더의 정확도 데이터를 받아 분석하고 이송 정밀도 모델을 고치는 폐루프 실험을 진행했습니다.
| 컴파일러 실험 항목 | 원문 수치 |
|---|---|
| 개별 분주 | 9,143회 |
| 고유 이송 유형 | 300가지 |
| 측정 조건 | 액체 4종에 걸쳐 1,508개 |
| 정밀도 예측 개선 | 제조사 기술 사양 대비 약 12%, 반복이 가장 많은 데이터에서 약 17% |
시험 적용 대상은 캘리포니아 퍼시피카의 San Pedro Creek 분변 오염 조사였습니다. 예비 qPCR 결과에서 검출된 숙주 특이 표지는 사람 표지(HF183, BacH)뿐이었고, 사람이 주요 오염원이라는 San Pedro Creek Watershed Coalition의 기존 결론과 일치했습니다. Tetsuwan 블로그는 에이전트가 증발 같은 물리 효과를 추론하는 데 어려움을 겪었고 점검 시점마다 사람의 교정이 꽤 필요했다고 적었습니다.
장비 벤더 생태계와 남은 과제
하드웨어 벤더와 이를 지원하는 소프트웨어 기업들도 장비에 MHS 지원을 넣고 있습니다.
| 기업 | 원문에 적힌 참여 내용 |
|---|---|
| Amazon Web Services | 에이전트와 물리 장비를 잇는 라이브러리 Strands Robots로 MHS 지원, 프리뷰 기간 사전 배포판 제공 |
| Automata | 실험실 자동화 플랫폼 LINQ에 MHS 지원 추가 |
| Danaher | 스마트 장비와 자율 실험실에서의 MHS 활용을 Anthropic과 탐색 |
| Doosan Robotics | 로봇 팔로 자동 품질 검사와 다중 로봇 작업 조율 테스트 |
| MBF Bioscience | 레이저 주사 현미경 소프트웨어 ScanImage용 MHS 드라이버 개발 |
| QIAGEN | 핵산 정제 플랫폼 QIAsymphony Connect에서 개념 증명 |
| Tecan | Fluent 액체 취급 플랫폼에 MHS 지원 추가 |
| Universal Robots | 초기 접근을 받았고 로보틱스 플랫폼에 지원 추가 예정 |
| Hugging Face, Raspberry Pi | LeRobot에 MHS 지원 추가, Camera MHS Driver 시험 뒤 여러 제품으로 통합 확대 |
Anthropic은 오픈소스 공개 전에 남은 일을 네 가지로 정리합니다. Claude는 텍스트와 이미지로 물리 세계를 배웠기 때문에 공간과 물리 추론에 한계가 있어 전문가 감독이 필요합니다. 프로그래밍 인터페이스가 없는 하드웨어는 아직 지원하지 않아 해당 제조사와 드라이버 내장 작업을 하고 있습니다. 출시 파트너와 추가 안전성 평가를 만들고, 오용 위험에 대비한 물리 안전 로드맵으로 안전장치 정책과 집행 범위를 보강합니다. 오픈소스 공개 때는 프리뷰 결과를 안전한 배포 지침의 일부로 함께 내놓을 예정입니다. 프리뷰 참여는 신청을 받아 대기자 명단으로 운영합니다.
우리나라 기업이 확인할 것
첫째, 설비 목록을 제어 인터페이스 기준으로 다시 분류해 둘 필요가 있습니다. Anthropic은 프로그래밍 인터페이스가 있는 장비를 지원 대상으로 밝혔고, CMU는 GUI만 있는 플레이트 리더까지 붙였습니다. API나 SDK를 제공하는 장비, 구형 스크립팅만 있는 장비, 화면 조작만 가능한 장비를 나눠 두면 규격이 공개됐을 때 우선 적용 범위를 바로 정할 수 있습니다.
둘째, 현장 담당자의 암묵지를 문서로 옮기는 작업이 곧 도입 준비입니다. MHS 드라이버는 장비 특성과 안전 한계를 자연어 태그로 받아 참조 파일을 만듭니다. Genentech 사례에서 거품 대응 요령을 스킬로 정리한 뒤 오류가 줄었다는 점도 같은 방향을 가리킵니다.
셋째, 안전 한계는 모델 밖의 장비 계층에 두는 설계를 확인해야 합니다. Janelia는 장비 수준 한계 덕분에 레이저 과출력을 걱정하지 않았고, QuEra는 인터록과 비상 정지를 모델과 무관하게 강제했습니다. CMU는 장비가 움직이기 전에 이상 조건 여섯 가지를 차단하는지부터 시험했습니다. 도입 검토 때 같은 시험 항목을 요구하는 편이 안전합니다.
넷째, AI를 운영 경로에 둘지 개발 경로에 둘지 공정별로 정해야 합니다. QuEra의 락 복구는 Claude가 만든 결정론적 스크립트가 에이전트 없이 운영되고, 튜닝은 에이전트가 루프에 남아 있습니다. 검사 가능한 스크립트로 굳힐 수 있는 공정부터 적용하면 품질 감사와 변경 관리가 쉬워집니다.
다섯째, 결과 검증과 사람 승인 지점을 미리 설계해야 합니다. QuEra는 최적화 과정이 건드릴 수 없는 위상 잡음 분석기로 결과를 독립 검증했고, CMU는 고위험 결정에서 사람 승인 절차를 다듬을 계획입니다. 제조 현장에서 활용하려면 누가 어떤 기준으로 에이전트 결과를 채택하고 중단시키는지 정의하는 작업이 먼저입니다. Doosan Robotics가 로봇 팔 품질 검사로 MHS를 시험하고 있으므로 사용 중인 로봇과 장비 공급사의 지원 계획도 함께 확인해 둘 만합니다.
출처: Previewing the Model Hardware Standard, Holding the Light: Teaching an AI to Lock and Tune our Quantum Computer's Lasers, Integrating Anthropic's Model Hardware Standard (MHS), Model Hardware Standard
코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.
코텍시스 AI 인사이트 최신 논문 리뷰
AWQ 양자화: 활성값을 보고 가중치를 지키는 4비트 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

