ML::NN::ViTEncoder
Full Vision Transformer Encoder
Constructors
Instance methods
blocks
Sourcecall(x : Autograd::Variable) : Autograd::Variable
Sourceforward(x : Autograd::Variable) : Autograd::Variable
Forward: Image -> Sequence of embeddings x: [batch, channels, height, width] Returns: [batch, num_patches + 1, embed_dim] (includes CLS token)
forward_cls(x : Autograd::Variable) : Autograd::Variable
Get CLS token output (for classification)
norm
Sourceparameters
Sourcepatch_embed
Sourcepos_embed
Source