AI paper review (9/21~9/27)
·
AI/Paper Review
Agent, Long-term Memory, Evaluation, Multi-Agent 관련 연구를 중심으로 정리1. HySparse2무엇인가?샤오미 MiMo 팀이 개발한 차세대 장문맥(Long Context) Transformer 아키텍처.핵심 아이디어KV Cache를 여러 레이어에서 공유Prefill 과정을 조기에 종료Sparse Attention 효율 개선결과100만 토큰 문맥에서기존 Hybrid SWA 대비 연산량 5배 감소KV Cache 사용량12.09GB → 2.69GB의미장기간 실행되는 Agent는 매 턴마다 긴 검색 결과나 실행 로그를 저장한다.HySparse2는Agent 운영 비용 절감Retrieval 정확도 향상을 동시에 달성.2. SIFT무엇인가?Agent가 자기 자신을 수정(Self..
AI paper review (9/14~9/20)
·
AI/Paper Review
Byte Model Scaling 바이트(Byte) 기반 언어 모델의 재평가Meta 연구진은 토크나이저 없이 원시 바이트를 직접 처리하는 모델이 충분한 연산량에서는 토큰 기반 모델을 능가할 수 있음을 보여줌.대규모 학습 시 데이터 효율성과 성능 모두에서 장점이 나타남. Agora Agora: Git 기반 다중 에이전트 협업NVIDIA는 여러 AI 에이전트가 연구 문제를 해결할 때 Git 저장소를 공유 기억장치로 사용하는 방식을 제안.중앙 관리자 없이도 13개의 에이전트가 수천 건의 기여를 통해 협업 가능함을 입증. Stellar Colosseum Stellar Colosseum: 복잡한 수학 증명용 다중 에이전트 시스템Google Research가 여러 에이전트를 활용해 장문의 수학 증명과 알고리즘..
AI paper review (9/7~9/13)
·
AI/Paper Review
장기 작업(Long-horizon) 에이전트의 구조화소형 모델 기반 코딩 에이전트의 RL 학습초장문 컨텍스트 처리 및 검색(Retrieval)AI 에이전트 조직(Multi-Agent)의 구조 최적화자기개선(Self-Improvement) 및 에이전트 거버넌스1. Procedural Graphs (Google) 장기 작업 에이전트가 "무엇을 해야 하는지" 절차적 지식을 명시적으로 저장하는 방법을 제안.핵심 아이디어기존 에이전트는 행동 순서를 암묵적으로 Transformer 내부에 저장작업이 길어질수록:목표를 잊음순서를 틀림실패한 행동을 반복이를 해결하기 위해 절차 그래프(Procedural Graph)를 구축기술적 특징기존 KG:Entity → Relation → EntityProcedural Graph:..
AI paper review (8/31~9/6)
·
AI/Paper Review
핵심 트렌드 요약장기 실행(Long-Horizon) 에이전트, 에이전트 메모리 관리, 지속적 학습, 장기 평가 벤치마크, 추론 비용 절감특히 "에이전트가 수일~수개월 동안 지속적으로 동작하는 방법"과 "긴 컨텍스트를 더 저렴하게 처리하는 방법"이 주요 연구 주제로 나타남.1. Declarative Attention문제긴 컨텍스트 모델은 토큰 하나를 생성할 때마다 전체 KV Cache를 다시 읽음.실제로는 극히 일부 정보만 참조하는데도 전체 문맥을 반복적으로 탐색해야 함.핵심 아이디어모델이 Chain-of-Thought 내부에서 직접:Global (전체 문맥 탐색)Focus (특정 영역 탐색)Local (최근 출력만 확인)모드를 선언하게 함.결과Gemma-4-31B: 디코딩 시 attention 토큰 52..
AI paper review (8/24~8/30)
·
AI/Paper Review
1. Judges as a Lifecycle (Netflix)핵심 아이디어LLM Judge를 한 번 검증한 후 배포하는 것이 아니라 지속적으로 관리해야 하는 시스템으로 접근해야 한다는 주장.주요 내용Judge 개발 과정을 4단계로 정의Birth: 평가 기준 및 인간 라벨 데이터 구축Training: Rubric 개선Deployment: 실제 서비스 적용Monitoring: Drift 감지 및 재튜닝 수행Reasoning-Aligned Rubric TuningJudge의 추론(reasoning)을 또 다른 meta-judge가 평가사람과 Judge 간 불일치 원인을 rubric 수준에서 수정Judge가 두 역할 수행품질 게이트(Quality Gate)생성 결과를 개선하는 피드백 제공자결과 및 의미수천만 사..
AI paper review (8/17~8/23)
·
AI/Paper Review
핵심 트렌드에이전트 연구의 초점이 모델 자체에서 하네스(Harness: 툴, 메모리, 라우팅, 실행 환경) 로 이동하고 있음.RL(강화학습)을 이용해 실제 운영 중인 에이전트를 직접 개선하려는 연구가 급증.에이전트의 성능 문제 상당수가 모델보다:스킬 선택메모리 관리실행 인프라자기개선 루프 에서 발생한다는 분석이 많음.1. Agent Lightning v1.0 (Microsoft)문제 의식현재 에이전트는 별도의 하니스가:툴 관리컨텍스트 관리워크플로우 제어 를 담당함.따라서 RL 학습기는 실제 환경을 보지 못하고 단순히 LLM 입출력만 보게 됨.핵심 아이디어모델 경계에 프록시(proxy)를 두어 기존 에이전트를 수정하지 않고 RL 학습 가능하게 함.하네스 내부 코드를 고치는 게 아닌, LLM과 하네스가 만나..
AI paper review (8/10~8/16)
·
AI/Paper Review
LLM 스케일링 법칙, 추론(Reasoning) 및 Agent 최적화, AI 보안, 멀티에이전트 시스템, 장문맥(Long Context), 에이전트 평가특히 추론 토큰 비용 절감, Tool Calling 인터페이스, 에이전트 메모리 관리, Chain-of-Thought 보안 취약점 등 실무적 영향이 큰 연구가 다수 포함1. Skaling핵심 아이디어기존 Chinchilla Scaling Law는 모델 크기(Model Size)와 데이터 양(Data Size)을 독립 변수로 취급하지만, 실제로는 둘 사이의 상호작용이 존재한다고 주장합니다.이를 반영하기 위해 모델 규모와 데이터 규모 간 상호작용(interaction term)을 추가한 새로운 Scaling Law를 제안합니다.주요 결과예측 오차(MAPE)를..
AI paper review (8/3~8/9)
·
AI/Paper Review
핵심 트렌드 한눈에 보기.에이전트 성능 향상의 핵심이 모델 자체보다 Harness(에이전트 실행 환경 및 도구 체계) 에 있다는 점에이전트 메모리, 평가, 비용 최적화에 대한 연구 증가자기반성(Self-reflection)보다 단순 샘플링이 더 효과적일 수 있다는 실증 결과장기 계획(Long-horizon) 및 실제 업무 환경에 가까운 벤치마크 등장실제 운영 환경에서의 효율성(토큰, 지연시간, 비용)에 대한 관심 확대 1. Model or Harness문제의식현재 에이전트 벤치마크는 최종 성공/실패만 측정함실패가 발생했을 때 원인이:모델 자체 문제인지프롬프트 및 Harness 문제인지툴 문제인지환경 문제인지평가 시스템 문제인지 구분하기 어려움주요 기여41개의 실패 유형(failure mode)을 정의다음..
jaehee831
Neural Notes