reinforcement-learning
an archive of posts with this tag
| Aug 11, 2026 | 에이전트의 reward hacking — 판정기가 뚫린다, 그리고 조합의 실패 |
|---|---|
| Aug 11, 2026 | 웹·GUI 에이전트 — end-to-end 멀티턴 RL |
| Aug 11, 2026 | 코드 에이전트 — SWE-RL과 테스트라는 reward |
| Aug 11, 2026 | 검색 에이전트 — Search-R1에서 DeepDive까지 |
| Aug 11, 2026 | 환경이 곧 reward다 — 샌드박스·테스트·상태 검증 |
| Aug 11, 2026 | shaping은 약인가 독인가 — 중간 보상의 효율과 위험 |
| Aug 11, 2026 | 토큰과 세그먼트로 더 잘게 — 세밀한 입도의 득과 실 |
| Aug 11, 2026 | 스텝을 단위로 삼는다 — 행동 단위 궤적 표현과 credit |
| Aug 11, 2026 | 턴 단위로 공을 나눈다 — turn-level reward 설계 |
| Aug 11, 2026 | 멀티턴 RL 실무 가이드 — 무엇이 실제로 작동하는가 |
| Aug 11, 2026 | 공을 어디에 돌릴 것인가 — credit assignment 47개 방법의 지도 |
| Aug 11, 2026 | 에이전트 RL은 무엇이 다른가 — 장기 지평·희소 보상·긴 궤적 |
| Aug 11, 2026 | WARP: 정책을 weight space에서 세 번 병합한다 |
| Aug 11, 2026 | BOND: Best-of-N을 추론 비용 없이 흉내 내다 |
| Aug 11, 2026 | DAPO: 신호 없는 프롬프트를 버리고, 탐색을 살린다 |
| Aug 11, 2026 | GSPO: importance ratio를 토큰이 아니라 시퀀스 단위로 |
| May 16, 2026 | Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models |
| May 16, 2026 | Curiosity-driven Red-teaming for Large Language Models |