AI 에이전트 글 목록
코텍시스 기술 블로그에서 AI 에이전트 태그가 붙은 글 14편을 모았습니다. 기업 AI 도입과 AX 현장에서 확인한 내용을 정리합니다.
글 14편
10월 1주 AI 동향: dots·Gemini 4·온프레미스·LLM 위키
OpenAI dots와 Gemini 4 Argon 발표에서 확인된 사실과 유출 수치의 차이, 9월에 늘어난 온프레미스 오픈 웨이트 모델, LLM 위키 운영 실측을 정리합니다. 우리나라 기업이 이번 주 결정에 적용할 기준 다섯 가지를 함께 제시합니다.
Airlock 제출: 시연 영상과 공개 데모와 에이전트 모드 최종 측정
Nebius × NVIDIA Global AI Hackathon에 Airlock을 제출했습니다. 3분 시연 영상과 공개 데모 주소, 그리고 GLiNER 앙상블을 켜고 다시 측정한 에이전트 모드 결과(연결 가능한 노출 81.2%에서 8.3%)를 세 번의 실행과 함께 정리했습니다.
소규모 조직의 AI 도입 순서와 교육 전달 구조
OpenAI가 America's SBDC와 어드바이저 150명 교육 파트너십을 발표하고 소규모 사업체 AI 사용 보고서를 공개했습니다. 재무·법무·마케팅처럼 전담 인력이 없는 기능에 에이전트가 먼저 들어가는 패턴과 AX 교육 전달 구조를 정리했습니다.
자율 에이전트가 샌드박스를 벗어난 경로
OpenAI가 Hugging Face 침해를 정렬 실패 관점에서 재검토한 보고서를 공개했습니다. 공유 자격증명과 내부 패키지 미러가 에이전트의 탈출 경로가 된 경위, 제3자 통보 기준, 기업이 설계에 반영할 감시 체계를 정리합니다.
GPT-6 Sol·Luna 출시, 전사 AI 단가 재계산으로 더 저렴해진 비용
OpenAI가 GPT-6 Sol과 Luna를 공개하며 API 가격을 GPT-5.6 프로모션 대비 50% 내렸습니다. 업무 자동화·코딩·컴퓨터 사용 벤치마크 결과와 캐싱 개선을 정리하고, 전사 배포 단가를 다시 계산할 기준을 짚습니다.
DeepSeek-V4.1-Flash 장문 에이전트 자체 호스팅 기준
DeepSeek-V4.1-Flash는 토큰당 전역 KV 캐시를 890바이트로 줄여 100만 토큰 문맥의 서빙 비용을 낮췄습니다. 구조 변화와 벤치마크, MIT 라이선스, 자체 호스팅 전 검증 항목을 정리합니다.
AI 에이전트가 오픈소스 모델 추론을 4배 가속한 방법과 검증 기준
Anthropic이 Claude로 오픈소스 생체분자 모델 30여 개의 추론을 평균 4배 가속하고 코드를 공개했습니다. 실행 모드별 검증 방식과 GPU 예산을 100분의 1로 줄인 설계 실험, 기업이 적용할 때 확인할 점을 정리합니다.
AI 업무 비중·에이전트 감독·연산 배분을 재는 세 지표
Anthropic이 AI가 수행하는 연구개발 비중, 에이전트 감독 수준, 안전 연구 연산 비중을 재는 방법과 내부 수치를 공개했습니다. 정의와 수치를 정리하고 기업 AI 운영 지표로 옮기는 방법을 살펴봅니다.
Airlock 연결 가능한 노출을 13.9%에서 7.5%로 줄인 과정
Airlock의 연결 가능한 노출이 13.9%에서 7.5%로 내려간 과정을 정리했습니다. GLiNER 앙상블과 준식별자 조합 일반화와 정규화 텍스트 탐지를 어떤 변형끼리 비교해 골랐는지 표로 담았습니다.
AI 에이전트용 이그레스 방화벽 Airlock 소개
AI 에이전트가 기기 밖으로 보내는 프롬프트와 도구 호출과 검색 질의를 지키는 Airlock을 소개합니다. 만든 이유와 동작 방식 그리고 측정 설계를 정리했습니다.
AI 에이전트 이그레스 방화벽 Airlock의 첫 측정 결과
AI 에이전트용 이그레스 방화벽 Airlock을 한국어와 영어 합성 케이스 243건으로 3회 독립 측정했습니다. 연결 가능한 노출은 84.7%에서 13.9%로 줄었고 측정 과정에서 저지른 실수도 함께 정리했습니다.

실제 시스템을 공격한 Claude, 정렬 실패에서 배우는 도입 기준
Anthropic이 Claude 모델이 사이버보안 평가 중 실제 시스템을 공격한 네 건을 정렬 관점에서 재분석했습니다. 편향된 추론과 무모함, 그리고 우리나라 기업의 AI 에이전트 도입 판단 기준을 정리합니다.
장비를 조작하는 AI 에이전트 표준 MHS와 AX 범위의 확장
Anthropic이 AI 에이전트가 실험·제조 장비를 조작하는 공통 규격 MHS의 연구 프리뷰를 열었습니다. 표준 드라이버 구조와 Genentech·CMU·QuEra 등 파트너 여섯 곳의 사례 수치, 남은 한계를 정리하고 우리나라 기업이 확인할 지점을 짚습니다.

Slack에 상주하는 에이전트, Claude Tag가 실제로 한 일
Anthropic 사내에서 Claude Tag가 처리한 세 가지 업무를 소요 시간과 산출물 기준으로 정리하고, 잘 작동한 지시의 공통 구조와 우리나라 기업 도입 시 확인할 항목을 덧붙였습니다.

