🥇 1. Automated Weak-to-Strong Researcher (Anthropic)

- Claude Opus 4.6 기반의 완전 자동화 정렬 연구 에이전트(AAR) 시스템 소개
- 약한 교사의 신호로 더 강한 모델을 학습시키는 Weak-to-Strong Supervision 문제를 다룸
- 인간 연구자 7일 결과(PGR 0.23) 대비, AI 에이전트 5일 만에 PGR 0.97 달성
- 9개의 병렬 에이전트, 총 비용 약 $18K
- 예상치 못한 보상 해킹(reward hacking) 사례도 실제로 발생 → 지표 설계의 중요성 강조
🧪 2. AiScientist

- 장기 연구 자동화 에이전트 설계의 핵심을 “추론”이 아닌 상태 관리(state management) 문제로 정의
- Thin control, Thick state 원칙
- File-as-Bus 방식: 대화가 아닌 파일 시스템을 중심으로 협업 및 기억 유지
- PaperBench +10.54점, MLE-Bench Lite에서 큰 성능 향상
- 긴 컨텍스트보다 지속 가능한 프로젝트 메모리가 중요하다는 주장
🧰 3. AlphaEval

- 기존 에이전트 벤치마크가 실제 프로덕션과 괴리되어 있음을 비판
- 실제 기업 7곳, 94개 과제로 구성된 프로덕션 기반 평가
- 모델 API가 아니라 완성된 에이전트 제품(Claude Code, Codex 등)을 평가
- 실제 업무에서 나타나는 6가지 실패 유형 정의
- 최고 점수도 64.41/100 → 연구-현업 간 격차 부각
🧠 4. Nemotron 3 Super (NVIDIA)

- 120B 파라미터 / 12B 활성 파라미터의 하이브리드 Mamba-Attention + MoE 모델
- 최대 1M 컨텍스트 지원, 에이전트용 장문 추론 최적화
- NVFP4 기반 25T 토큰 사전학습
- Multi-Token Prediction(MTP)으로 추론 지연 감소
- 데이터·모델 전부 오픈소스 공개
🧩 5. Memory Transfer Learning

- 코딩 에이전트의 경험이 과제 간 전이되지 않는 문제를 분석
- 6개 이질적 벤치마크 간 공동 메모리 풀 실험
- 평균 성능 +3.7% 향상
- 코드 자체보다 고수준 메타 지식(절차, 검증 패턴)이 전이에 효과적
- 저수준 실행 로그는 오히려 부정적 전이 유발 가능
🛠 6. Auto-Diagnose (Google)

- 대규모 통합 테스트 실패 로그를 자동 요약·진단하는 LLM 도구
- Google 내부 코드 리뷰 시스템 Critique에 직접 통합
- 실제 실패 사례 71건 중 90.14% 정확도로 원인 진단
- 사내 전체 배포 후 52,000+ 실패 테스트에서 사용
- “실제 워크플로 안에 LLM을 넣는 법”의 모범 사례 제시
🧬 7. Subliminal Learning (Nature 게재)

- LLM이 겉보기엔 무관한 데이터를 통해 성향·정렬 특성을 은밀히 전달 가능함을 입증
- 서로 다른 초기화 모델 간에도 전이 발생
- 코드·Chain-of-Thought를 통한 잠재적 오염 경로 확대
- 다수의 후속 연구들과 연결 → 모델 간 학습 전이의 안전성 문제 제기
✅ 8. LLM-as-a-Verifier
- 테스트 시 다수 응답 중 최적 결과 선별이 병목이라는 점에 주목
- LLM에게 순위(rank)를 매기게 하고 토큰 확률로 점수 계산
- 별도 보상 모델 없이 경량 검증기로 SOTA 성능 달성
- 에이전트 평가에 쉽게 추가 가능한 방식
🌐 9. WebXSkill
- 웹 에이전트가 과거에 수행한 작업을 재사용하지 못하는 문제 해결
- 웹 행동을 재사용 가능한 스킬로 추출
- 자동 실행(grounded) / 단계 안내(guided) 두 모드 제공
- WebArena, WebVoyager에서 최대 +14.2% 성능 향상
- 환경 간 스킬 전이 가능성 확인
👥 10. Muses-Bench
- 다수 사용자·다중 권한 환경에서의 에이전트 의사결정 평가
- 상충 지시, 접근 제어, 회의 조정 등 현실적 시나리오 포함
- 최고 모델(Gemini-3-Pro)도 평균 85.6%
- 프라이버시-유용성 트레이드오프가 매우 큼을 확인
'AI > Agent' 카테고리의 다른 글
| NLP paper review (4/26~5/3) (0) | 2026.05.04 |
|---|---|
| NLP paper review (4/19~4/26) (0) | 2026.04.27 |
| NLP paper review (4/6~4/12) (0) | 2026.04.13 |
| NLP paper review (3/30~4/5) (0) | 2026.04.06 |
| NLP paper review (3/23~3/29) (0) | 2026.03.30 |