-
에이전트란 무엇인가: 지능형 에이전트의 고전 정의부터 LLM 에이전트까지
agent 벤치마크 시리즈의 도입부 — Russell & Norvig의 지능형 에이전트 정의(합리성, 기대효용, PEAS, MDP/POMDP, 5유형, 환경 속성)부터 Lilian Weng·Anthropic의 LLM 에이전트 해부까지, 수식과 함께
-
AgentBench: Evaluating LLMs as Agents
AgentBench 논문 리뷰 — LLM as Agent 평가 패러다임을 정립한 8환경 multi-turn 벤치마크
-
GAIA: a benchmark for General AI Assistants
GAIA 논문 리뷰 — 인간 92% vs GPT-4 15%, AI assistant 평가의 reality check
-
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
SWE-bench 논문 리뷰 — 실 레포의 실 GitHub 이슈로 LLM agent를 평가하는 sandboxed execution benchmark
-
TravelPlanner: A Benchmark for Real-World Planning with Language Agents
TravelPlanner 논문 리뷰 — multi-constraint planning에서 GPT-4도 1% 미만, agent planning의 한계 노출