ML::NN::TransformerEncoderBlock
Transformer Encoder Block LayerNorm -> Self-Attention -> Residual -> LayerNorm -> MLP -> Residual
Constructors
Instance methods
attention
Sourcecall(x : Autograd::Variable, attn_mask : Tensor | Nil = nil) : Autograd::Variable
Sourcedropout
Sourceforward(x : Autograd::Variable, attn_mask : Tensor | Nil = nil) : Autograd::Variable
Forward: Pre-norm architecture (like ViT) x: [batch, seq_len, embed_dim]
mlp
Sourcenorm1
Sourcenorm2
Sourceparameters
Source