Anthropic이 8월 7일 Fable 5의 생물학 안전장치 개선을 발표했습니다. 분류기가 요청을 거절하면 오류가 아니라 200 응답으로 돌아오기 때문에, 애플리케이션 코드가 이를 처리하지 않으면 조용히 깨집니다.
Anthropic이 2026년 8월 7일 Fable 5의 생물학 안전장치 개선을 발표했습니다. 안전성 발표는 보통 개발자 입장에서 흘려보내기 쉽지만, 이번 건은 API를 쓰는 쪽에서 반드시 알아야 할 동작이 하나 있습니다.
거절은 오류가 아니라 성공 응답으로 온다
Fable 5는 들어오는 요청에 안전 분류기를 돌립니다. 분류기가 요청을 거절하면 HTTP 오류가 아니라 정상 200 응답이 돌아옵니다. 대신 stop_reason이 refusal이 되고, stop_details에 정책 범주가 담깁니다.
이 차이가 중요한 이유는 실패 방식 때문입니다.
| 방식 | 결과 |
|---|---|
| try/except로 예외만 처리 | 거절을 잡지 못합니다. 예외가 발생하지 않습니다 |
| response.content[0]을 바로 읽음 | 거절 시 content가 비어 있어 인덱스 오류가 납니다 |
| stop_reason을 먼저 확인 | 정상 처리됩니다 |
거절은 출력이 시작되기 전에 발생할 수도 있고, 일부 출력이 나간 뒤 스트림 중간에 발생할 수도 있습니다. 앞의 경우 content 배열이 비어 있고 과금도 되지 않습니다. 뒤의 경우 이미 흘러나간 부분은 과금되며, 부분 출력을 완성된 답변으로 취급하지 않도록 버려야 합니다.
선의의 요청도 걸릴 수 있다
이번 강화의 대상은 연구 생물학과 대부분의 사이버보안 영역입니다. 문제는 인접한 정상 업무가 오탐에 걸리는 경우입니다. 보안 도구 개발이나 생명과학 업무가 여기 해당할 수 있습니다.
그래서 Anthropic은 fallback 파라미터를 제공합니다. 거절이 발생하면 같은 요청을 지정한 다른 모델로 서버 측에서 다시 돌려주는 기능입니다. 거절 범주에 따라 적절한 모델로 보내주는 자동 모드도 있습니다.
실무에서 정리해야 할 것
기업 서비스에 프론티어 모델을 붙일 때 체크할 항목은 세 가지입니다.
첫째, 응답 본문을 읽기 전에 stop_reason을 확인하는 코드가 들어가 있는지 봅니다. 이것이 없으면 거절이 발생하는 순간 애플리케이션이 예외 없이 잘못된 결과를 냅니다.
둘째, 거절 시 사용자에게 무엇을 보여줄지 정합니다. 빈 화면이나 로딩 스피너가 계속 도는 상태가 가장 나쁩니다.
셋째, 업무 성격상 오탐 가능성이 있다면 폴백을 기본값으로 켜둡니다. 폴백은 자동으로 켜지지 않으며, 지정하지 않으면 거절에서 그대로 멈춥니다.
코텍시스 AI 인사이트 최신 논문 리뷰
활성값을 보고 가중치를 지키는 AWQ 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.ai에서 맞춤 AI 개발 서비스를 확인하세요.



