-
InstructGPT: RLHF 3단계 레시피의 표준을 세우다
RL Reward 설계 시리즈 #2 — SFT → Reward Model → PPO, 오늘날 모든 RLHF 파이프라인의 원형 (Ouyang et al., OpenAI, NeurIPS 2022)
-
Deep RL from Human Preferences: 보상 함수를 사람의 선호로 배우다
RL Reward 설계 시리즈 #1 — 선호 비교만으로 reward model을 학습하는 원형 (Christiano et al., OpenAI/DeepMind, NeurIPS 2017)
-
Kubernetes 관측성 — 로그·메트릭과 Prometheus/Grafana
kubectl logs·events·top으로 시작해, 로그 수집 파이프라인과 Prometheus·Grafana 메트릭 스택까지 — 클러스터가 지금 어떤지 들여다보는 관측성 입문
-
Kubernetes 확장과 생태계 — Operator와 CNCF Projects
CRD와 Custom Controller로 나만의 리소스를 만드는 Operator 패턴, cert-manager 실습, 그리고 CNCF 성숙도 3단계로 읽는 생태계 지도 — K8s 입문 시리즈 마지막 편
-
Kubernetes 권한 관리 — ServiceAccount와 RBAC
인증과 인가의 차이부터 ServiceAccount, Role/RoleBinding 4요소, kubectl auth can-i 실습까지 — Kubernetes RBAC 입문