class

OpenAI::FineTuneReinforcementHyperparameters

Inherits JSON::Serializable < Reference < Object

The hyperparameters used for the reinforcement fine-tuning job.

Constructors

new(batch_size : FineTuneReinforcementHyperparametersBatchSize | Nil = nil, learning_rate_multiplier : FineTuneReinforcementHyperparametersLearningRateMultiplier | Nil = nil, n_epochs : FineTuneReinforcementHyperparametersNEpochs | Nil = nil, reasoning_effort : FineTuneReinforcementHyperparametersReasoningEffort | Nil = nil, compute_multiplier : FineTuneReinforcementHyperparametersComputeMultiplier | Nil = nil, eval_interval : FineTuneReinforcementHyperparametersEvalInterval | Nil = nil, eval_samples : FineTuneReinforcementHyperparametersEvalSamples | Nil = nil)
Source
new(*, __pull_for_json_serializable pull : JSON::PullParser)
Source

Instance methods

batch_size

Number of examples in each batch. A larger batch size means that model parameters are updated less frequently, but with lower variance.

Source
batch_size=(batch_size : FineTuneReinforcementHyperparametersBatchSize | Nil)

Number of examples in each batch. A larger batch size means that model parameters are updated less frequently, but with lower variance.

Source
compute_multiplier

Multiplier on amount of compute used for exploring search space during training.

Source
compute_multiplier=(compute_multiplier : FineTuneReinforcementHyperparametersComputeMultiplier | Nil)

Multiplier on amount of compute used for exploring search space during training.

Source
eval_interval

The number of training steps between evaluation runs.

Source
eval_interval=(eval_interval : FineTuneReinforcementHyperparametersEvalInterval | Nil)

The number of training steps between evaluation runs.

Source
eval_samples

Number of evaluation samples to generate per training step.

Source
eval_samples=(eval_samples : FineTuneReinforcementHyperparametersEvalSamples | Nil)

Number of evaluation samples to generate per training step.

Source
learning_rate_multiplier

Scaling factor for the learning rate. A smaller learning rate may be useful to avoid overfitting.

Source
learning_rate_multiplier=(learning_rate_multiplier : FineTuneReinforcementHyperparametersLearningRateMultiplier | Nil)

Scaling factor for the learning rate. A smaller learning rate may be useful to avoid overfitting.

Source
n_epochs

The number of epochs to train the model for. An epoch refers to one full cycle through the training dataset.

Source
n_epochs=(n_epochs : FineTuneReinforcementHyperparametersNEpochs | Nil)

The number of epochs to train the model for. An epoch refers to one full cycle through the training dataset.

Source
reasoning_effort

Level of reasoning effort.

Source
reasoning_effort=(reasoning_effort : FineTuneReinforcementHyperparametersReasoningEffort | Nil)

Level of reasoning effort.

Source