JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

RotorQuant: Uma Nova Abordagem para Compressão de KV Cache

RotorQuant: Uma Nova Abordagem para Compressão de KV Cache

Publicado em 14/04/2026 14:27 | Categorias: Artigos

Introdução ao RotorQuant

O projeto RotorQuant representa um avanço significativo na compressão de KV cache através da rotação block-diagonal. Esta abordagem inovadora supera a TurboQuant da Google em todos os aspetos medidos, oferecendo melhor perplexidade (PPL), 28% mais rápido na decodificação, 5x mais rápido no prefill e 44x menos parâmetros.

O código está disponível no GitHub do scrya-com, proporcionando uma alternativa eficiente para quem necessita de compressão de cache em modelos de linguagem. A técnica baseia-se em rotores do grupo Clifford, especificamente Cl(3,0), implementando um arquitectura de rotor sandwich que reduz drasticamente o número de operações e parâmetros necessários.

Comparação com TurboQuant

Os benchmarks demonstram claramente a superioridade do RotorQuant face ao TurboQuant da Google. Em termos de perplexidade, o método iso3 atinge 6.91 versus 7.07 do turbo3, o que indica qualidade superior na geração de texto.

Na velocidade de decodificação, RotorQuant alcança 119 tokens por segundo comparados com 93 tok/s do TurboQuant, representando um ganho de 28% mais rápido. No prefill, a diferença é ainda mais dramática: 3,822 tok/s versus 722 tok/s, ou seja, 5.3x mais rápido.

O aspeto mais impressionante reside na eficiência de parâmetros. RotorQuant utiliza apenas 128 parâmetros face aos 16,384 do TurboQuant, o que corresponde a 44x menos parâmetros mantendo melhor performance.

  • Implementação actual: IsoQuant (Quaternion 4D) com 4 dimensões, 512 FMAs, 128 parâmetros
  • Production ready: PlanarQuant (Givens 2D) com 2 dimensões, 256 FMAs, 128 parâmetros
  • Research version: Cl(3,0) rotor sandwich com 3 dimensões, 2,400 FMAs, 372 parâmetros
  • Google TurboQuant: WHT butterfly com 128 dimensões, 16,384 FMAs, 16,384 parâmetros

Poupança de Armazenamento

A compressão eficiente do RotorQuant traduz-se em poupanças substanciais de memória em diferentes tamanhos de contexto. Para um contexto de 8K, são 260 MB guardados. Com 32K de contexto, a poupança ascende a 1.04 GB.

Em contextos ainda maiores de 128K, RotorQuant permite economizar 4.16 GB de armazenamento. Estas poupanças resultam do processo de rotação que decorrelaciona vetores KV cache antes da quantização escalar.

O método funciona através de quatro passos fundamentais: normalização seguida de armazenamento separado das normas, rotação via block transform para quebrar correlações de coordenadas, quantização de cada coordenada para centroides Lloyd-Max, e inversão da rotação para reconstrução.

A inovação chave reside na decorrelação dos vetores KV cache através de rotação, o que permite quantização mais eficiente sem perda significativa de qualidade. A abordagem do RotorQuant representa um marco importante na otimização de modelos de linguagem para uso em produção.



Mais detalhes em : https://github.com/scrya-com/rotorquant

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Gemini Omni 1.1 Flash
Imagem gerada por I.A.
Link Externo

Gemini Omni 1.1 Flash

Publicado em 31/08/2026 11:10

Gemini Omni 1.1 Flash é o novo modelo de geração de vídeo da Google orientado para produção, capaz de prolongar cenas até 40 segundos, criar transições entre frames definidos, acelerar protótipos em 360p e produzir resultados finais até 4K.

Visitar Link
VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções
Imagem gerada por I.A.
Link Externo

VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções

Publicado em 31/08/2026 11:02

VoiceMem é um sistema de memória para agentes de voz que combina factos, entidades e conhecimento com emoções, preferências e personalidade, permitindo que a IA reconheça o utilizador e recupere memórias relevantes em tempo real durante a própria conversa.

Visitar Link
Code World Model - A lógica no mundo virtual
Imagem gerada por I.A.
Link Externo

Code World Model - A lógica no mundo virtual

Publicado em 31/08/2026 10:58

Code World Model é uma abordagem de IA que usa um agente de programação como “cérebro” de mundos virtuais, mantendo estados, regras e consequências persistentes através de código executável, enquanto um modelo de vídeo transforma essa estrutura em ambientes visuais coerentes e dinâmicos.

Visitar Link
GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira
Imagem gerada por I.A.

GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira

Publicado em 31/08/2026 10:55

Bom... parece que o enigmático Ox Alpha que apareceu no OpenRouter deixou de ser apenas uma pista. A confirmação chegou:...

Ler Mais
FixAnything - Um sistema de IA que corrige artefactos e falhas em renderizações 3D
Imagem gerada por I.A.
Link Externo

FixAnything - Um sistema de IA que corrige artefactos e falhas em renderizações 3D

Publicado em 31/08/2026 10:05

FixAnything é um sistema de IA que corrige artefactos e falhas em renderizações 3D de diferentes representações (como NeRF, Gaussian Splatting, malhas ou nuvens de pontos) usando modelos generativos de vídeo para recuperar resultados visualmente mais limpos e geometricamente consistentes.

Visitar Link
Block3D - Um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente
Imagem gerada por I.A.
Link Externo

Block3D - Um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente

Publicado em 31/08/2026 09:55

Block3D é um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente, combinando difusão por blocos com mecanismos de correção para preservar a qualidade geométrica.

Visitar Link
OVOW - (One Video, One World) - Vídeo convencional em cena 4D estruturada
Imagem gerada por I.A.
Link Externo

OVOW - (One Video, One World) - Vídeo convencional em cena 4D estruturada

Publicado em 31/08/2026 09:00

OVOW (One Video, One World) é um sistema de IA capaz de transformar um único vídeo convencional numa cena 4D estruturada, reconstruindo objetos, movimentos, deformações e relações físicas em modelos 3D prontos para simulação.

Visitar Link
A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros
Imagem gerada por I.A.

A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros

Publicado em 28/08/2026 12:05

Os últimos meses marcaram uma mudança que embora silenciosa é profunda! Durante anos, a narrativa foi dominada quase exclusivamente pelos...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..