강화학습(RLHF)이 뭐야?

아주 쉽게, 그림으로

사람이 좋다·별로다 평가해주면서 AI를 훈련시키는 방식이에요
이 순서로 반복해요
더 보기
👍👎🤖
사람이 좋다·별로다 평가해주면서 AI를 훈련시키는 방식이에요
그 평가를 보상으로 삼아 AI가 점점 더 사람이 좋아하는 답을 하게 돼요
🤖AI가 답함🧑사람이 평가🎁보상으로 학습😊더 나은 답
이 순서로 반복해요
한 줄로: RLHF(강화학습)는 사람의 평가를 보상 삼아 AI가 더 도움되는 답을 하도록 훈련시키는 방식이에요.

출처: 일반 통용 정의 (RLHF: Reinforcement Learning from Human Feedback)