AI paper review (8/17~8/23)
·
AI/Paper Review
1. Judges as a Lifecycle (Netflix)핵심 아이디어LLM Judge를 한 번 검증한 후 배포하는 것이 아니라 지속적으로 관리해야 하는 시스템으로 접근해야 한다는 주장.주요 내용Judge 개발 과정을 4단계로 정의Birth: 평가 기준 및 인간 라벨 데이터 구축Training: Rubric 개선Deployment: 실제 서비스 적용Monitoring: Drift 감지 및 재튜닝 수행Reasoning-Aligned Rubric TuningJudge의 추론(reasoning)을 또 다른 meta-judge가 평가사람과 Judge 간 불일치 원인을 rubric 수준에서 수정Judge가 두 역할 수행품질 게이트(Quality Gate)생성 결과를 개선하는 피드백 제공자결과 및 의미수천만 사..
AI paper review (8/17~8/23)
·
AI/Paper Review
핵심 트렌드에이전트 연구의 초점이 모델 자체에서 하네스(Harness: 툴, 메모리, 라우팅, 실행 환경) 로 이동하고 있음.RL(강화학습)을 이용해 실제 운영 중인 에이전트를 직접 개선하려는 연구가 급증.에이전트의 성능 문제 상당수가 모델보다:스킬 선택메모리 관리실행 인프라자기개선 루프 에서 발생한다는 분석이 많음.1. Agent Lightning v1.0 (Microsoft)문제 의식현재 에이전트는 별도의 하니스가:툴 관리컨텍스트 관리워크플로우 제어 를 담당함.따라서 RL 학습기는 실제 환경을 보지 못하고 단순히 LLM 입출력만 보게 됨.핵심 아이디어모델 경계에 프록시(proxy)를 두어 기존 에이전트를 수정하지 않고 RL 학습 가능하게 함.하네스 내부 코드를 고치는 게 아닌, LLM과 하네스가 만나..
AI paper review (8/10~8/16)
·
AI/Paper Review
LLM 스케일링 법칙, 추론(Reasoning) 및 Agent 최적화, AI 보안, 멀티에이전트 시스템, 장문맥(Long Context), 에이전트 평가특히 추론 토큰 비용 절감, Tool Calling 인터페이스, 에이전트 메모리 관리, Chain-of-Thought 보안 취약점 등 실무적 영향이 큰 연구가 다수 포함1. Skaling핵심 아이디어기존 Chinchilla Scaling Law는 모델 크기(Model Size)와 데이터 양(Data Size)을 독립 변수로 취급하지만, 실제로는 둘 사이의 상호작용이 존재한다고 주장합니다.이를 반영하기 위해 모델 규모와 데이터 규모 간 상호작용(interaction term)을 추가한 새로운 Scaling Law를 제안합니다.주요 결과예측 오차(MAPE)를..
AI paper review (8/3~8/9)
·
AI/Paper Review
핵심 트렌드 한눈에 보기.에이전트 성능 향상의 핵심이 모델 자체보다 Harness(에이전트 실행 환경 및 도구 체계) 에 있다는 점에이전트 메모리, 평가, 비용 최적화에 대한 연구 증가자기반성(Self-reflection)보다 단순 샘플링이 더 효과적일 수 있다는 실증 결과장기 계획(Long-horizon) 및 실제 업무 환경에 가까운 벤치마크 등장실제 운영 환경에서의 효율성(토큰, 지연시간, 비용)에 대한 관심 확대 1. Model or Harness문제의식현재 에이전트 벤치마크는 최종 성공/실패만 측정함실패가 발생했을 때 원인이:모델 자체 문제인지프롬프트 및 Harness 문제인지툴 문제인지환경 문제인지평가 시스템 문제인지 구분하기 어려움주요 기여41개의 실패 유형(failure mode)을 정의다음..
AI paper review (7/27~8/2)
·
AI/Paper Review
핵심 트렌드 한눈에 보기에이전트 개발 프레임워크 단순화 (NOOA, Molt)에이전트 학습 효율 향상 (ReOPD, Self-Speculating Agent)에이전트 메모리 및 컨텍스트 관리 (ACM, Filesystem Memory Audited)LLM 추론 및 정렬(alignment) 문제 분석 (Invisible Reasoning, Role Drift)대규모 모델 학습 인프라 개선 (JAXBench, Beyond AdamW) 1. NOOA (NVIDIA Object-Oriented Agents)핵심 아이디어현재 AI 에이전트는 프롬프트, 툴 스키마, 콜백 코드, 워크플로 그래프 등 여러 표현 방식이 섞여 있어 유지보수가 어렵다.이를 하나의 객체지향 프로그래밍 모델로 통합하자는 접근이다.주요 특징에이..
The new rules of context engineering for Claude 5 generation models
·
Others/Insight
https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models The new rules of context engineering for Claude 5 generation models | Claude by AnthropicWe removed over 80% of Claude Code's system prompt for more advanced models. How to apply the lessons we learned to your own context engineering in Claude Code and with your own agents.claude.com📌 개요Anthropic은 Claude..
AI paper review (7/20~7/26)
·
AI/Paper Review
에이전트 장기 기억(Long-term Memory)과 스킬 학습Harness HandbookFrom Memory to Skills (MSCE)PRO-LONGBad Memory in Agents에이전트/코딩 시스템 설계Progressive DisclosureHarness HandbookLLM 내부 메커니즘 및 평가Global Workspace in LLMsGAMUTStructured Output Collapses DiversityCopying and 2D-RoPE로보틱스 기반 모델RoboTTT1. Harness Handbook무엇을 해결하나?에이전트의 실행 환경(harness)이 커질수록 특정 행동이 어떤 코드에 의해 구현되는지 찾기 어려워지는 문제를 해결하려는 연구.핵심 아이디어코드베이스를 분석하여 행동..
Agentic World Models
·
AI/Paper Review
한 줄 요약최신 LLM 에이전트 연구는 강화학습(RL)만으로 에이전트를 훈련하는 것을 넘어, 에이전트가 자신의 행동이 환경에 어떤 결과를 낳는지 예측하는 "월드 모델(World Model)"을 함께 학습시키는 방향으로 발전하고 있다. 이렇게 하면 학습 효율, 성능, 일반화 능력이 향상된다.문제의식: 기존 Agent RL의 한계현재 에이전트 RL은 보통 최종 성공/실패 결과만 보상으로 사용한다.따라서 학습 신호가 매우 희소(sparse)하다.그러나 실제 에이전트 실행 과정에는 다음과 같은 풍부한 정보가 존재한다.실행한 명령툴 호출터미널 결과API 응답환경 변화 정보기존 RL은 이런 환경 관측(observation)을 학습에 거의 활용하지 않는다.핵심 아이디어: World Modeling에이전트는 단순히 행..
jaehee831
Neural Notes