Cloudflare Research
publicación
2026

Unweight: Compresión sin pérdida de pesos de MLP para inferencia de LLM

Contribuciones

Ivan Nikulin

Detalles

Cloudflare Technical Report Cf-TR-2026.04.v1, April 2026

Resumen

Unweight es un programa de investigación sobre compresión sin pérdida de tensores de pesos de LLM, con trabajo activo en inferencia densa, distribución de modelos y servicio de Mixture-of-Experts. Este informe presenta resultados intermedios de la corriente de ingeniería: una herramienta de GPU componible cuyos componentes pueden ensamblarse para estos escenarios de implementación en GPUs NVIDIA Hopper (H100, H200). Está bien establecido en trabajos anteriores (DFloat11, ZipServ, ZipNN) que los campos de exponente de BF16 en pesos de LLM entrenados llevan ~2,6 bits de entropía de Shannon en su asignación de 8 bits, mientras que los campos de signo y mantisa son casi incompresibles. Unweight separa cada valor de BF16 en signo+mantisa y exponente, codifica los exponentes mediante Huffman sobre una paleta de 16 valores por tensor, y maneja exponentes raros a través de filas verbatim en lugar de símbolos de escape en línea. La representación comprimida, las tuberías de ejecución y la programación de tiempo de ejecución son configurables de forma independiente: un modelo puede estar codificado con Huffman para distribución y transcrito a una representación intermedia de paleta al cargar para inferencia. Se seleccionan tres tuberías de ejecución —decodificación completa a cuBLAS, decodificación de exponente con multiplicación de matrices reconstructiva y transcodificación de paleta con multiplicación de matrices reconstructiva— por proyección y bucket de tamaño de lote a través de autotuning de descenso de coordenadas en el rendimiento de extremo a extremo.