Bei RLHF bewerten Menschen verschiedene Modellantworten, und aus diesen Praeferenzen wird ein Belohnungsmodell gelernt. Das Sprachmodell wird anschliessend mit Reinforcement Learning so optimiert, dass es bevorzugte Antworten erzeugt. Dadurch werden Modelle hilfreicher, hoeflicher und sicherer im Sinne menschlicher Erwartungen. RLHF war ein Schluesselschritt, der rohe Sprachmodelle in nuetzliche Assistenten verwandelte.
