개발 글 목록
AI 서비스를 개발하고 운영하며 쓴 구현 방법과 도구, 인프라 기록을 정리합니다.
글 13편
Airlock 제출: 시연 영상과 공개 데모와 에이전트 모드 최종 측정
Nebius × NVIDIA Global AI Hackathon에 Airlock을 제출했습니다. 3분 시연 영상과 공개 데모 주소, 그리고 GLiNER 앙상블을 켜고 다시 측정한 에이전트 모드 결과(연결 가능한 노출 81.2%에서 8.3%)를 세 번의 실행과 함께 정리했습니다.
사내 문서 RAG 수집, D-RAC가 줄인 비용과 남은 검증 과제
Yellow.ai의 D-RAC는 문서를 PDF로 바꿔 멀티모달 LLM으로 한 번 변환하고 청크는 ID로만 묶어 청크 단계 비용을 77.8~85.6% 줄였습니다. 변환 비용과 충실도, 비PDF 형식은 측정되지 않아 도입 전 자체 검증이 필요합니다.
모델 성능에 따라 달라지는 코딩 에이전트 하네스 설정
Zoom 연구진이 176개 설정으로 코딩 에이전트 하네스의 계획, 도구, 컨텍스트 관리 효과를 측정했습니다. 약한 모델은 계획과 도구 집합으로 정확도가 올랐고 강한 모델은 계획과 bash 전용으로 비용이 줄었습니다.
Airlock 연결 가능한 노출을 13.9%에서 7.5%로 줄인 과정
Airlock의 연결 가능한 노출이 13.9%에서 7.5%로 내려간 과정을 정리했습니다. GLiNER 앙상블과 준식별자 조합 일반화와 정규화 텍스트 탐지를 어떤 변형끼리 비교해 골랐는지 표로 담았습니다.
AI 에이전트용 이그레스 방화벽 Airlock 소개
AI 에이전트가 기기 밖으로 보내는 프롬프트와 도구 호출과 검색 질의를 지키는 Airlock을 소개합니다. 만든 이유와 동작 방식 그리고 측정 설계를 정리했습니다.
AI 에이전트 이그레스 방화벽 Airlock의 첫 측정 결과
AI 에이전트용 이그레스 방화벽 Airlock을 한국어와 영어 합성 케이스 243건으로 3회 독립 측정했습니다. 연결 가능한 노출은 84.7%에서 13.9%로 줄었고 측정 과정에서 저지른 실수도 함께 정리했습니다.
[개발] GPT-6 Astra 벤치마크와 가격, GPT-5.x 전환 기준
OpenAI GPT-6 Astra의 API 가격과 결정에 필요한 벤치마크 여섯 줄을 정리하고, GPT-5.x에서 옮길 때 확인할 안전 모니터링 중단과 보안 작업 거부, 추론 감시 문제와 작업별 라우팅 기준을 제시합니다.
[개발] 장면 연장과 4K 출력, Gemini Omni 1.1 Flash
구글이 Gemini Omni 1.1 Flash에 장면 연장, 첫·마지막 프레임 지정, 360p 초안, 4K 업스케일을 넣었습니다. 해상도별 초당 요금을 표와 차트로 정리하고 초안과 최종본을 나누는 두 단계 파이프라인의 비용 계산을 담았습니다.
[개발] 토큰 88% 줄이는 Gemini 에이전틱 비디오 이해
구글이 Gemini 3.7·3.6 Flash와 3.5 Flash-Lite에 에이전틱 비디오 이해를 추가했습니다. 모델이 필요한 구간만 골라 보는 방식으로 토큰 최대 88%, 비용 66%를 줄이면서 정확도를 올린 수치와 구축 시 판단 기준을 정리했습니다.
Flash 모델로 미해결 수학 문제를 푼 Antigravity Teamwork
Google Antigravity의 멀티에이전트 프레임워크 Teamwork가 Gemini 3.7 Flash로 미해결 수학 문제 7개와 RISC-V 시뮬레이터, Eigen 최적화를 해냈다. 패턴 구조와 Long Proof 설계, 구축 시 판단 기준을 정리한다.
[구축] 커머스 에이전트 설계, 서브에이전트 대신 스킬과 캐시와 평가
Anthropic이 1년간 운영한 커머스 에이전트의 공통 구조를 정리했습니다. 서브에이전트 대신 스킬, 캐시 순서, 하네스가 강제하는 안전, 스냅샷 평가까지 구축 관점에서 판단 기준을 짚습니다.

AI 네이티브 SDLC 플레이북, 여섯 단계 중 먼저 바꿀 곳
코드 작성이 병목에서 빠지면 계획·리뷰·배포가 새 병목이 됩니다. Anthropic Applied AI 팀의 AI 네이티브 SDLC 플레이북을 여섯 단계 전환표, 통제 계층, 측정 지표로 정리하고 국내 도입 시 확인할 것을 덧붙였습니다.
![[사례] 피드백이 세션과 함께 사라지지 않게: Warp의 자기개선 에이전트](https://cortexys-blog-images.s3.ap-northeast-2.amazonaws.com/blog/w640/20260831-warp-self-improving-agent-skills-m1-94158c.webp)
[사례] 피드백이 세션과 함께 사라지지 않게: Warp의 자기개선 에이전트
Warp이 코드리뷰 에이전트의 소음 문제를 스킬 두 개짜리 자기개선 루프로 푼 과정을 정리하고, 코드리뷰와 도메인 문서가 얇은 조직에서 이 구조가 어디서 무너지는지 짚습니다.

