Unweight: Compressão de Pesos de MLP sem Perda para Inferência de LLM
Detalhes
Cloudflare Technical Report Cf-TR-2026.04.v1, April 2026
Resumo
Unweight é um programa de pesquisa sobre compressão sem perda de tensores de pesos de LLM, com trabalho ativo em inferência densa, distribuição de modelos e serviço de Mixture-of-Experts. Este relatório apresenta resultados intermediários da linha de engenharia: uma ferramenta composta para GPU cujos componentes podem ser montados para esses cenários de implantação em GPUs NVIDIA Hopper (H100, H200).
Está bem estabelecido em trabalhos anteriores (DFloat11, ZipServ, ZipNN) que os campos de expoentes de BF16 em pesos de LLM treinados carregam ~2,6 bits de entropia de Shannon em sua alocação de 8 bits, enquanto os campos de sinal e mantissa são quase incomprimíveis.
Unweight separa cada valor de BF16 em sinal+mantissa e expoente, codifica os expoentes por meio de uma paleta de 16 valores por tensor, e lida com expoentes raros por meio de linhas verbais em vez de símbolos de escape inline. A representação comprimida, os pipelines de execução e o agendamento de tempo de execução são independentemente configuráveis: um modelo pode ser codificado por Huffman para distribuição e transcrito para uma representação intermediária de paleta na carga para inferência.
Três pipelines de execução — decodificação completa para cuBLAS, decodificação de expoente com matmul reconstrutiva e transcodificação de paleta com matmul reconstrutiva — são selecionados por projeção e bucket de tamanho de lote por meio de ajuste automático de descida de coordenadas em throughput de ponta a ponta.