ML::GGUF::Dequant
Constants
K_SCALE_SIZE = 12
QK_K = 256
Class methods
Main entry: dequantize raw bytes to Float32 array
Q5_K: 5.5 bits per weight, QK_K=256 block, 176 bytes/block Block layout: [d:f16][dmin:f16][scales:12B][qh:32B][qs:128B]
Q6_K: 6.5625 bits per weight, QK_K=256 block, 210 bytes/block Block layout: [ql:128B][qh:64B][scales:16B][d:f16]