slicktune.objectives¶
Training objectives (what the model learns).
Classes¶
Direct Preference Optimization (TRL |
|
Group Relative Policy Optimization (TRL |
|
Kahneman–Tversky Optimization (TRL |
|
Odds Ratio Preference Optimization (TRL experimental ORPO). |
|
Supervised fine-tuning on instruction / chat pairs. |
Package Contents¶
- class slicktune.objectives.DPOObjective[source]¶
Bases:
slicktune.types.ObjectiveDirect Preference Optimization (TRL
DPOTrainer).- Parameters:
beta (float, optional) – KL penalty coefficient, by default 0.1.
loss_type (str, optional) – TRL DPO loss type, by default
"sigmoid".
- __slots__ = ()¶
- class slicktune.objectives.GRPOObjective[source]¶
Bases:
slicktune.types.ObjectiveGroup Relative Policy Optimization (TRL
GRPOTrainer).Uses a verifiable substring reward on
must_containby default (seeslicktune.rewards.substring_must_contain_reward()).- Parameters:
beta (float, optional) – KL penalty coefficient, by default 0.0.
num_generations (int, optional) – Completions sampled per prompt (must be >= 2), by default 4.
max_completion_length (int, optional) – Max new tokens per completion, by default 128.
temperature (float, optional) – Sampling temperature, by default 1.0.
- __slots__ = ()¶
- class slicktune.objectives.KTOObjective[source]¶
Bases:
slicktune.types.ObjectiveKahneman–Tversky Optimization (TRL
KTOTrainer).- Parameters:
beta (float, optional) – KL penalty coefficient, by default 0.1.
desirable_weight (float, optional) – Weight for desirable (
label=True) examples, by default 1.0.undesirable_weight (float, optional) – Weight for undesirable (
label=False) examples, by default 1.0.
- __slots__ = ()¶
- class slicktune.objectives.ORPOObjective[source]¶
Bases:
slicktune.types.ObjectiveOdds Ratio Preference Optimization (TRL experimental ORPO).
- Parameters:
beta (float, optional) – Odds-ratio penalty coefficient, by default 0.1.
- __slots__ = ()¶