Airlock 제출: 시연 영상과 공개 데모와 에이전트 모드 최종 측정
개발

Airlock 제출: 시연 영상과 공개 데모와 에이전트 모드 최종 측정

블로그로 돌아가기

Nebius × NVIDIA Global AI Hackathon에 Airlock을 제출했습니다. 3분 시연 영상과 공개 데모 주소, 그리고 GLiNER 앙상블을 켜고 다시 측정한 에이전트 모드 결과(연결 가능한 노출 81.2%에서 8.3%)를 세 번의 실행과 함께 정리했습니다.

Tristan Kim · CortexysAirlockAI 에이전트프라이버시LLM 평가NVIDIA NemotronNebiusRead in English

AI 에이전트용 이그레스 방화벽 Airlock을 Nebius × NVIDIA Global AI Hackathon에 제출했습니다. 이 글은 제출물 세 가지와, 제출 직전에 다시 측정한 에이전트 모드 결과를 적은 기록입니다. 3편에서 약속한 전체 에이전트 재측정이 어떻게 나왔는지가 핵심이고, 그 과정에서 평가 구성 하나가 결과를 크게 좌우한다는 사실을 발견했습니다.

제출물

영상은 맥에서 로컬로 실행한 Airlock을 그대로 녹화한 것입니다. 로컬 Nemotron-3-Nano-4B가 탐지하고, Nebius Token Factory의 Nemotron 3 Ultra가 가려진 텍스트로 답하고, 게이트가 바깥으로 나가는 바이트를 검사해 막는 장면, 그리고 에이전트가 두 개의 비공개 문서를 읽고 Tavily 검색어를 기기 안에서 일반 질의로 바꾸는 장면이 들어 있습니다. 브라우저 조작은 Playwright로 실행하며 녹화했고 나레이션은 합성 음성입니다. 화면의 이름과 회사와 숫자와 문서는 전부 가상입니다.

에이전트 모드 최종 측정

에이전트 모드 평가는 16개 가상 시나리오(한국어 8, 영어 8)를 보호 없음과 Airlock 두 모드로 3회씩 실행하고, 기기 밖으로 나간 내용만 읽는 공격자 모델이 신원 항목을 알아내고 상황을 추론하는지를 측정합니다. 두 가지가 동시에 성립하면 연결 가능한 노출로 셉니다.

제출 직전 두 번 실행했습니다. 먼저 기본 설정(GLiNER 앙상블 끔)으로, 다음에 GLiNER 앙상블을 켜고. 각 행은 같은 실행 안의 두 모드를 비교한 값입니다.

실행GLiNER 앙상블연결 가능한 노출, 보호 없음 → Airlock신원 유출(스캐너), Airlock사실 복원, Airlock루브릭 유용성, 보호 없음 / Airlock답 없이 끝난 보호 실행
2026-10-02, 켬켬81.2% → 8.3% ± 3.616.7% ± 3.620.5% ± 2.64.38 / 4.5848회 중 1회
2026-10-02, 끔끔93.8% → 31.2% ± 6.243.8% ± 10.827.8% ± 3.34.62 / 4.3548회 중 3회
2026-09-15 (3편의 수치)끔83.3% → 17.2% ± 8.233.3% ± 9.523.6% ± 3.24.38 / 4.5048회 중 3회

세 가지를 배웠습니다.

첫째, 에이전트 모드는 GLiNER 앙상블을 켜고 돌려야 합니다. 앙상블이 꺼져 있으면 문서 속 영어 이름은 4B 모델 하나가 잡아야 하는데, 이것은 표본 추출에 따라 달라집니다. 한 시나리오의 채용 통지서 원문을 탐지기에 10번 넣어 보니 수신인 이름을 제안한 것은 2번뿐이었고 8번은 빈 목록을 돌려줬습니다. 앙상블을 끈 두 실행이 17.2%와 31.2%로 갈린 이유가 여기에 있습니다. 두 실행 사이에 로컬 모델의 스팬 제안 경로(프롬프트와 호출)는 바뀌지 않았고, 16개 시나리오 3회 측정으로는 두 수치를 구분할 수 없습니다. 앙상블을 켜면 스캐너가 신원 항목을 찾은 보호 실행은 48회 중 8회, 공격자가 누구의 일인지까지 연결한 실행은 4회였습니다.

둘째, 보호 없음 열도 실행마다 움직입니다. 탐지기가 전혀 없는 모드인데도 연결 가능한 노출이 81.2%와 93.8% 사이를 오갔습니다. 공격자와 채점자가 표본을 뽑는 LLM이기 때문입니다. 그래서 실행끼리 비교하지 않고 같은 실행 안의 두 열을 비교합니다.

셋째, 영어 차단은 사라졌고 남은 문제는 한국어입니다. 3편에서 답 없이 차단된 보호 실행 3건은 전부 영어였고, 검색 결과 페이지에 금고에 든 단어가 있어서 생긴 일이었습니다. 수정 후 두 실행 모두에서 영어 보호 실행 24회 중 차단은 0회이고 영어 루브릭 유용성은 두 모드 모두 5.00입니다. 앙상블을 켠 실행에서 답 없이 끝난 1회는 한국어 소송 시나리오입니다. 모델 자신의 검색어에 탐지기가 준식별자로 금고에 넣은 표현이 다시 나왔고, 모델 자신의 텍스트는 여전히 닫힌 쪽으로 실패합니다.

앙상블을 켜고도 새는 것은 두 M&A 메모의 프로젝트명입니다. 문서 제목에 들어 있어 매 회차 전송됐습니다. 한국어 이름 하나와 동 이름 하나가 각각 한 회차에 나갔습니다. 상황 사실(금액과 날짜와 상대방)은 보호 없음 74.8%에 비해 44.7%가 복원됩니다. 클라우드는 문제를 알아야 도울 수 있고, Airlock이 없애는 것은 신원입니다. 상황 추론은 보호 없음 85.4%, Airlock 79.2%였습니다.

유용성은 루브릭 채점 4.58 대 4.38로 보호 쪽이 높았고, 쌍대 판정의 유용성 비율은 1.08 ± 0.11, 왜곡은 16.7% 대 27.1%였습니다. 한국어 답변은 두 모드 모두 편차가 큽니다. 같은 조문을 수십 번 반복하거나 법조문이나 날짜를 틀리거나 문서를 무시하고 일반론을 답한 경우가 보호 없음 10건, 보호 모드 5건 있었습니다. 지연은 보호 실행 중앙값 388초, 보호 없음 18초입니다. 앙상블을 끄면 242초였습니다.

앙상블을 켠 실행은 중간에 노트북이 잠자기에 들어가 네트워크가 끊기는 일이 있었습니다. 연결 오류로 끝난 5건은 장애 기록이므로 지우고, 같은 출력 폴더에서 이어 실행해 2회차 나머지와 3회차를 채웠습니다. 회차마다 서비스를 새로 만들기 때문에 회차 독립성은 유지됩니다. 경위는 저장소의 eval/results/FINAL.md에 적어 두었습니다.

공개 데모

데모는 Fly.io의 머신 한 대에서 돌아갑니다. 방문자마다 메모리 안에 격리된 세션을 받고, 금고와 감사 기록은 디스크에 쓰지 않으며 30분 뒤 사라집니다. 호스팅 데모의 탐지기는 Token Factory의 Nemotron-3-Nano-30B-A3B입니다. 로컬 설치에서 쓰는 4B 모델과 다릅니다. 가려지기 전의 입력이 데모 서버에서 Token Factory로 가므로 화면 배너가 실제 개인정보를 넣지 말라고 안내하고, 실제 보호가 필요하면 로컬 설치를 권합니다. 데모 계정은 Zero Data Retention을 켜 두었습니다. 요청 수와 입력 길이와 하루 예산에 한도가 있고, 예산이 다하거나 실시간 실행이 실패하면 같은 입력의 녹화본을 녹화본이라고 표시해 보여줍니다.

다음

제출은 끝났고 심사는 11월 2일부터 12월 15일까지입니다. 그동안 데모를 유지하고, 문서 제목을 가리지 않는 문제와 한국어 일반 명사가 준식별자로 금고에 들어가 모델 자신의 검색어를 막는 문제를 다음 측정 대상으로 둡니다.

시리즈와 저장소

1편 AI 에이전트용 이그레스 방화벽 Airlock 소개, 2편 첫 측정 결과, 3편 수치가 개선된 과정. 모든 수치는 저장소 https://github.com/tristan-kkim/airlock 의 eval/results/FINAL.md와 README.md에서 다시 계산할 수 있습니다.

김지우 (Tristan Kim)

코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.

코텍시스 AI 인사이트 최신 논문 리뷰

AI 솔루션이 필요하신가요?

cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

컨설팅 신청하기