강화학습 글 목록
코텍시스 기술 블로그에서 강화학습 태그가 붙은 글 2편을 모았습니다. 기업 AI 도입과 AX 현장에서 확인한 내용을 정리합니다.
글 2편
AI
[논문] 긴 작업에서 결정적인 한 수를 찾아내는 법, AgentOPSD
여러 턴에 걸친 에이전트 작업에서 성패를 가른 결정을 어떻게 찾아낼 것인가. 8월 6일 공개된 AgentOPSD는 별도 크리틱 없이 턴 단위 기여도를 재귀적으로 추정합니다.
Cortexys2026.08.10
![[논문] 컴파일러 없이 스스로 코드를 고치는 ReflexiCoder](https://cortexys-blog-images.s3.ap-northeast-2.amazonaws.com/blog/w640/20260315-reflexicoder-self-repairing-code-without-compiler-m5-84492b.webp)
AIFeatured
[논문] 컴파일러 없이 스스로 코드를 고치는 ReflexiCoder
강화학습으로 외부 도구 없이 스스로 코드를 반성하고 수정하는 ReflexiCoder를 분석합니다. 8B 파라미터로 GPT-5.1과 경쟁하며 반성 과정이 오히려 토큰 사용량을 36% 줄이는 역설적인 결과까지 살펴봅니다.
Cortexys2026.03.15

