The hyperparameters used for the reinforcement fine-tuning job.
Constructors
new(batch_size : FineTuneReinforcementHyperparametersBatchSize | Nil = nil, learning_rate_multiplier : FineTuneReinforcementHyperparametersLearningRateMultiplier | Nil = nil, n_epochs : FineTuneReinforcementHyperparametersNEpochs | Nil = nil, reasoning_effort : FineTuneReinforcementHyperparametersReasoningEffort | Nil = nil, compute_multiplier : FineTuneReinforcementHyperparametersComputeMultiplier | Nil = nil, eval_interval : FineTuneReinforcementHyperparametersEvalInterval | Nil = nil, eval_samples : FineTuneReinforcementHyperparametersEvalSamples | Nil = nil)
SourceInstance methods
batch_size
Number of examples in each batch. A larger batch size means that model parameters are updated less frequently, but with lower variance.
Sourcebatch_size=(batch_size : FineTuneReinforcementHyperparametersBatchSize | Nil)
Number of examples in each batch. A larger batch size means that model parameters are updated less frequently, but with lower variance.
Sourcecompute_multiplier
Multiplier on amount of compute used for exploring search space during training.
Sourcecompute_multiplier=(compute_multiplier : FineTuneReinforcementHyperparametersComputeMultiplier | Nil)
Multiplier on amount of compute used for exploring search space during training.
Sourceeval_interval
The number of training steps between evaluation runs.
Sourceeval_interval=(eval_interval : FineTuneReinforcementHyperparametersEvalInterval | Nil)
The number of training steps between evaluation runs.
Sourceeval_samples
Number of evaluation samples to generate per training step.
Sourceeval_samples=(eval_samples : FineTuneReinforcementHyperparametersEvalSamples | Nil)
Number of evaluation samples to generate per training step.
Sourcelearning_rate_multiplier
Scaling factor for the learning rate. A smaller learning rate may be useful to avoid overfitting.
Sourcelearning_rate_multiplier=(learning_rate_multiplier : FineTuneReinforcementHyperparametersLearningRateMultiplier | Nil)
Scaling factor for the learning rate. A smaller learning rate may be useful to avoid overfitting.
Sourcen_epochs
The number of epochs to train the model for. An epoch refers to one full cycle through the training dataset.
Sourcen_epochs=(n_epochs : FineTuneReinforcementHyperparametersNEpochs | Nil)
The number of epochs to train the model for. An epoch refers to one full cycle through the training dataset.
Sourcereasoning_effort
Level of reasoning effort.
Sourcereasoning_effort=(reasoning_effort : FineTuneReinforcementHyperparametersReasoningEffort | Nil)
Level of reasoning effort.
Source