Anthropic이 1년간 운영한 커머스 에이전트의 공통 구조를 정리했습니다. 서브에이전트 대신 스킬, 캐시 순서, 하네스가 강제하는 안전, 스냅샷 평가까지 구축 관점에서 판단 기준을 짚습니다.
Anthropic이 2026년 9월 2일 claude.com 블로그에 A guide to the anatomy of effective commerce agents를 실었습니다. 리테일·여행·통신 고객사와 1년간 운영한 커머스 에이전트의 공통 구조를 정리한 글입니다. 코텍시스는 구축 관점에서 읽었습니다. 품질과 비용을 가르는 것은 하네스 설계, 캐시 순서, 평가 방식이며 이 셋은 사내 업무 에이전트에도 그대로 적용됩니다.
서브에이전트 대신 스킬
모델 하나가 표준 에이전트 루프에서 도구와 스킬을 씁니다. 인텐트 라우터도 도메인별 서브에이전트도 없습니다. 핸드오프마다 장바구니·선호·이력 같은 상태가 유실되고 토큰과 지연이 늘기 때문입니다. 스킬은 전체 이력을 가진 본 에이전트에 로드되므로 핸드오프 비용 없이 모듈화를 얻습니다. 실제 배포 비교에서도 이 설계가 품질·비용·지연 모두 앞섰습니다.
출처: Anthropic, 원문
프롬프트와 스킬의 경계는 빈도로 정합니다. 트래픽의 3분의 1 이상이 쓰는 지시는 프롬프트에, 나머지는 스킬에 둡니다. 안전·법무·브랜드 규칙은 항상 프롬프트에 둡니다.
캐시 순서가 비용을 정한다
캐시 읽기는 신규 입력의 10분의 1 비용, 쓰기는 1.25배이므로 두 번째 사용부터 이득입니다. 잘 된 배포는 90~99% 히트율로 돕니다.
| 구분 | 상대 비용 |
|---|---|
| 신규 입력 | 1.0x |
| 캐시 쓰기 | 1.25x |
| 캐시 읽기 | 0.1x |
캐시는 접두사 기준이라 순서가 전부입니다. 요청을 전역(프롬프트·도구 정의), 세션(사용자 컨텍스트·이력), 휘발(현재 시각·페이지) 순으로 배치합니다. 가장 흔한 실수는 타임스탬프를 프롬프트 맨 위에 두는 것입니다.
출처: Anthropic, 원문
안전은 하네스가 강제한다
커머스의 실패는 금전적이고 되돌리기 어렵습니다. 그래서 모델은 제안만 하고 적용은 사람이나 정책이 합니다. 체크아웃 백엔드에는 결제 메서드 자체가 없고 머천트 쓰기 도구는 승인 대기 상태의 변경만 만듭니다. 쓰기와 렌더는 서버가 이번 세션에 발급한 ID만 받고, 구매 상한은 결과 상태에 걸며, 리뷰 같은 서드파티 텍스트는 새니타이저를 거쳐 울타리 안에 넣습니다.
스냅샷으로 평가한다
API는 무상태이므로 어떤 대화 상태든 직접 구성할 수 있습니다. 상태를 만들고 한 턴을 돌리고 결과만 채점합니다. 긍정 케이스마다 부정 케이스를 짝짓고 플로우당 50~100개를 현업 전문가와 실제 사고에서 뽑습니다.
출처: Anthropic, 원문
코텍시스의 판단은 이렇습니다. 이 가이드에서 모델에 관한 내용은 거의 없습니다. 도구는 운영 중인 시스템을 부르고 평가는 요구사항을 테스트로 옮긴 것입니다. 다음 모델이 나와도 설정 변경과 평가 스윕으로 갈아탑니다. 구축 프로젝트에서 먼저 확보할 것은 도구 경계와 평가 세트입니다. 원문은 A guide to the anatomy of effective commerce agents에서 볼 수 있습니다.
코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.
코텍시스 AI 인사이트 최신 논문 리뷰
AWQ 양자화: 활성값을 보고 가중치를 지키는 4비트 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

