RLHF & Human Feedback
Reinforcement learning with human feedback: preference data, response scoring and rubric-based judgement that align models to human expectations.
- Preference ranking
- Reward model data
- Response evaluation
- Instruction following
- Safety judgements
- Model comparison