JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

RotorQuant: Uma Nova Abordagem para Compressão de KV Cache

RotorQuant: Uma Nova Abordagem para Compressão de KV Cache

Publicado em 14/04/2026 14:27 | Categorias: Artigos

Introdução ao RotorQuant

O projeto RotorQuant representa um avanço significativo na compressão de KV cache através da rotação block-diagonal. Esta abordagem inovadora supera a TurboQuant da Google em todos os aspetos medidos, oferecendo melhor perplexidade (PPL), 28% mais rápido na decodificação, 5x mais rápido no prefill e 44x menos parâmetros.

O código está disponível no GitHub do scrya-com, proporcionando uma alternativa eficiente para quem necessita de compressão de cache em modelos de linguagem. A técnica baseia-se em rotores do grupo Clifford, especificamente Cl(3,0), implementando um arquitectura de rotor sandwich que reduz drasticamente o número de operações e parâmetros necessários.

Comparação com TurboQuant

Os benchmarks demonstram claramente a superioridade do RotorQuant face ao TurboQuant da Google. Em termos de perplexidade, o método iso3 atinge 6.91 versus 7.07 do turbo3, o que indica qualidade superior na geração de texto.

Na velocidade de decodificação, RotorQuant alcança 119 tokens por segundo comparados com 93 tok/s do TurboQuant, representando um ganho de 28% mais rápido. No prefill, a diferença é ainda mais dramática: 3,822 tok/s versus 722 tok/s, ou seja, 5.3x mais rápido.

O aspeto mais impressionante reside na eficiência de parâmetros. RotorQuant utiliza apenas 128 parâmetros face aos 16,384 do TurboQuant, o que corresponde a 44x menos parâmetros mantendo melhor performance.

  • Implementação actual: IsoQuant (Quaternion 4D) com 4 dimensões, 512 FMAs, 128 parâmetros
  • Production ready: PlanarQuant (Givens 2D) com 2 dimensões, 256 FMAs, 128 parâmetros
  • Research version: Cl(3,0) rotor sandwich com 3 dimensões, 2,400 FMAs, 372 parâmetros
  • Google TurboQuant: WHT butterfly com 128 dimensões, 16,384 FMAs, 16,384 parâmetros

Poupança de Armazenamento

A compressão eficiente do RotorQuant traduz-se em poupanças substanciais de memória em diferentes tamanhos de contexto. Para um contexto de 8K, são 260 MB guardados. Com 32K de contexto, a poupança ascende a 1.04 GB.

Em contextos ainda maiores de 128K, RotorQuant permite economizar 4.16 GB de armazenamento. Estas poupanças resultam do processo de rotação que decorrelaciona vetores KV cache antes da quantização escalar.

O método funciona através de quatro passos fundamentais: normalização seguida de armazenamento separado das normas, rotação via block transform para quebrar correlações de coordenadas, quantização de cada coordenada para centroides Lloyd-Max, e inversão da rotação para reconstrução.

A inovação chave reside na decorrelação dos vetores KV cache através de rotação, o que permite quantização mais eficiente sem perda significativa de qualidade. A abordagem do RotorQuant representa um marco importante na otimização de modelos de linguagem para uso em produção.



Mais detalhes em : https://github.com/scrya-com/rotorquant

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros
Imagem gerada por I.A.

A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros

Publicado em 28/08/2026 12:05

Os últimos meses marcaram uma mudança que embora silenciosa é profunda! Durante anos, a narrativa foi dominada quase exclusivamente pelos...

Ler Mais
Modelos de IA escapam de sandboxes e expõem falhas críticas na OpenAI e Hugging Face
Imagem gerada por I.A.
Link Externo

Modelos de IA escapam de sandboxes e expõem falhas críticas na OpenAI e Hugging Face

Publicado em 27/08/2026 12:30

A OpenAI revelou que, durante testes internos em julho de 2026, modelos experimentais contornaram sandboxes, comunicaram entre si e exploraram falhas que lhes deram acesso não autorizado a sistemas da OpenAI e da Hugging Face, levando a empresa a reforçar segurança, isolamento e monitorização de alinhamento. Este artigo é sobre isso!

Visitar Link
Ox Alpha: o mistério da IA anónima que fez a Z.AI revelar-se
Imagem gerada por I.A.

Ox Alpha: o mistério da IA anónima que fez a Z.AI revelar-se

Publicado em 26/08/2026 16:30

Como já todos sabemos, na noite de 20 de agosto, um modelo de IA chamado Ox Alpha apareceu nos servidores...

Ler Mais
Ontology Engineering: o futuro prometido da IA que ainda tem de provar o seu valor
Imagem gerada por I.A.

Ontology Engineering: o futuro prometido da IA que ainda tem de provar o seu valor

Publicado em 25/08/2026 18:56

No levantamento sobre engenharia de grafos publicado em Agosto de 2026, abordado no artigo anterior, os investigadores dedicam uma das...

Ler Mais
Graph Engineering: a engenharia de grafos como novo paradigma dos agentes LLM
Imagem gerada por I.A.

Graph Engineering: a engenharia de grafos como novo paradigma dos agentes LLM

Publicado em 25/08/2026 18:35

Uma equipa alargada de investigadores, com nomes ligados à University of Illinois Urbana-Champaign e à Sichuan University, publicou em Agosto...

Ler Mais
Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método
Imagem gerada por I.A.

Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método

Publicado em 23/08/2026 20:00

Alegadamente... há uma boa notícia na investigação do cancro, mas não estamos perante uma “cura descoberta por inteligência artificial”.. não...

Ler Mais
OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”
Imagem gerada por I.A.

OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”

Publicado em 23/08/2026 16:40

A OpenAI confirmou que abrandou temporariamente o desenvolvimento de modelos de fronteira enquanto reforça medidas de segurança relacionadas com capacidades...

Ler Mais
Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor
Imagem gerada por I.A.

Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor

Publicado em 23/08/2026 14:30

É... o Ox Alpha apareceu como um modelo anónimo em plataformas usadas por programadores e depressa gerou o habitual frenesim...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..