JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

RotorQuant: Uma Nova Abordagem para Compressão de KV Cache

RotorQuant: Uma Nova Abordagem para Compressão de KV Cache

Publicado em 14/04/2026 14:27 | Categorias: Artigos

Introdução ao RotorQuant

O projeto RotorQuant representa um avanço significativo na compressão de KV cache através da rotação block-diagonal. Esta abordagem inovadora supera a TurboQuant da Google em todos os aspetos medidos, oferecendo melhor perplexidade (PPL), 28% mais rápido na decodificação, 5x mais rápido no prefill e 44x menos parâmetros.

O código está disponível no GitHub do scrya-com, proporcionando uma alternativa eficiente para quem necessita de compressão de cache em modelos de linguagem. A técnica baseia-se em rotores do grupo Clifford, especificamente Cl(3,0), implementando um arquitectura de rotor sandwich que reduz drasticamente o número de operações e parâmetros necessários.

Comparação com TurboQuant

Os benchmarks demonstram claramente a superioridade do RotorQuant face ao TurboQuant da Google. Em termos de perplexidade, o método iso3 atinge 6.91 versus 7.07 do turbo3, o que indica qualidade superior na geração de texto.

Na velocidade de decodificação, RotorQuant alcança 119 tokens por segundo comparados com 93 tok/s do TurboQuant, representando um ganho de 28% mais rápido. No prefill, a diferença é ainda mais dramática: 3,822 tok/s versus 722 tok/s, ou seja, 5.3x mais rápido.

O aspeto mais impressionante reside na eficiência de parâmetros. RotorQuant utiliza apenas 128 parâmetros face aos 16,384 do TurboQuant, o que corresponde a 44x menos parâmetros mantendo melhor performance.

  • Implementação actual: IsoQuant (Quaternion 4D) com 4 dimensões, 512 FMAs, 128 parâmetros
  • Production ready: PlanarQuant (Givens 2D) com 2 dimensões, 256 FMAs, 128 parâmetros
  • Research version: Cl(3,0) rotor sandwich com 3 dimensões, 2,400 FMAs, 372 parâmetros
  • Google TurboQuant: WHT butterfly com 128 dimensões, 16,384 FMAs, 16,384 parâmetros

Poupança de Armazenamento

A compressão eficiente do RotorQuant traduz-se em poupanças substanciais de memória em diferentes tamanhos de contexto. Para um contexto de 8K, são 260 MB guardados. Com 32K de contexto, a poupança ascende a 1.04 GB.

Em contextos ainda maiores de 128K, RotorQuant permite economizar 4.16 GB de armazenamento. Estas poupanças resultam do processo de rotação que decorrelaciona vetores KV cache antes da quantização escalar.

O método funciona através de quatro passos fundamentais: normalização seguida de armazenamento separado das normas, rotação via block transform para quebrar correlações de coordenadas, quantização de cada coordenada para centroides Lloyd-Max, e inversão da rotação para reconstrução.

A inovação chave reside na decorrelação dos vetores KV cache através de rotação, o que permite quantização mais eficiente sem perda significativa de qualidade. A abordagem do RotorQuant representa um marco importante na otimização de modelos de linguagem para uso em produção.



Mais detalhes em : https://github.com/scrya-com/rotorquant

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método
Imagem gerada por I.A.

Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método

Publicado em 23/08/2026 20:00

Alegadamente... há uma boa notícia na investigação do cancro, mas não estamos perante uma “cura descoberta por inteligência artificial”.. não...

Ler Mais
OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”
Imagem gerada por I.A.

OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”

Publicado em 23/08/2026 16:40

A OpenAI confirmou que abrandou temporariamente o desenvolvimento de modelos de fronteira enquanto reforça medidas de segurança relacionadas com capacidades...

Ler Mais
Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor
Imagem gerada por I.A.

Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor

Publicado em 23/08/2026 14:30

É... o Ox Alpha apareceu como um modelo anónimo em plataformas usadas por programadores e depressa gerou o habitual frenesim...

Ler Mais
Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer
Imagem gerada por I.A.

Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer

Publicado em 23/08/2026 12:15

A Claude Academy é a plataforma de aprendizagem da Anthropic para quem quer usar os seus produtos com mais método....

Ler Mais
Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço
Imagem gerada por I.A.

Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço

Publicado em 23/08/2026 12:00

O Ornith-1.5 chega com uma promessa que merece alguma atenção (ou muita), pois em vez de depender apenas de tarefas...

Ler Mais
GEN 1.5
Créditos de imagem : generalistai.com
Link Externo

GEN 1.5

Publicado em 23/08/2026 11:15

GEN-1.5 é um modelo fundacional para robótica capaz de aprender novas tarefas físicas em segundos a partir de uma única demonstração, sem treino adicional, além de generalizar, improvisar e utilizar ferramentas nunca vistas.

Visitar Link
Qwen-Video-Edit
Créditos de imagem : github.com/yunpeng1998
Link Externo

Qwen-Video-Edit

Publicado em 23/08/2026 11:00

Qwen-Video-Edit é um sistema de edição de vídeo por instruções de texto que adapta o modelo de edição de imagens Qwen-Image-Edit para modificar vídeos diretamente, sem necessitar de um transformer previamente treinado em vídeo

Visitar Link
Audio8 TTS Preview 0.1B
Créditos de imagem : Audio8
Link Externo

Audio8 TTS Preview 0.1B

Publicado em 23/08/2026 10:45

Audio8 TTS Preview 0.1B é um modelo compacto de síntese de voz com cerca de 170 milhões de parâmetros, capaz de gerar fala e clonar vozes em zero-shot a partir de uma amostra de áudio, com suporte principal para inglês e chinês e experimental para outras seis línguas.

Visitar Link

Abaixo encontra uma pequena lista de artigos relacionados com este tema..