JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

RotorQuant: Uma Nova Abordagem para Compressão de KV Cache

RotorQuant: Uma Nova Abordagem para Compressão de KV Cache

Publicado em 14/04/2026 14:27 | Categorias: Artigos

Introdução ao RotorQuant

O projeto RotorQuant representa um avanço significativo na compressão de KV cache através da rotação block-diagonal. Esta abordagem inovadora supera a TurboQuant da Google em todos os aspetos medidos, oferecendo melhor perplexidade (PPL), 28% mais rápido na decodificação, 5x mais rápido no prefill e 44x menos parâmetros.

O código está disponível no GitHub do scrya-com, proporcionando uma alternativa eficiente para quem necessita de compressão de cache em modelos de linguagem. A técnica baseia-se em rotores do grupo Clifford, especificamente Cl(3,0), implementando um arquitectura de rotor sandwich que reduz drasticamente o número de operações e parâmetros necessários.

Comparação com TurboQuant

Os benchmarks demonstram claramente a superioridade do RotorQuant face ao TurboQuant da Google. Em termos de perplexidade, o método iso3 atinge 6.91 versus 7.07 do turbo3, o que indica qualidade superior na geração de texto.

Na velocidade de decodificação, RotorQuant alcança 119 tokens por segundo comparados com 93 tok/s do TurboQuant, representando um ganho de 28% mais rápido. No prefill, a diferença é ainda mais dramática: 3,822 tok/s versus 722 tok/s, ou seja, 5.3x mais rápido.

O aspeto mais impressionante reside na eficiência de parâmetros. RotorQuant utiliza apenas 128 parâmetros face aos 16,384 do TurboQuant, o que corresponde a 44x menos parâmetros mantendo melhor performance.

  • Implementação actual: IsoQuant (Quaternion 4D) com 4 dimensões, 512 FMAs, 128 parâmetros
  • Production ready: PlanarQuant (Givens 2D) com 2 dimensões, 256 FMAs, 128 parâmetros
  • Research version: Cl(3,0) rotor sandwich com 3 dimensões, 2,400 FMAs, 372 parâmetros
  • Google TurboQuant: WHT butterfly com 128 dimensões, 16,384 FMAs, 16,384 parâmetros

Poupança de Armazenamento

A compressão eficiente do RotorQuant traduz-se em poupanças substanciais de memória em diferentes tamanhos de contexto. Para um contexto de 8K, são 260 MB guardados. Com 32K de contexto, a poupança ascende a 1.04 GB.

Em contextos ainda maiores de 128K, RotorQuant permite economizar 4.16 GB de armazenamento. Estas poupanças resultam do processo de rotação que decorrelaciona vetores KV cache antes da quantização escalar.

O método funciona através de quatro passos fundamentais: normalização seguida de armazenamento separado das normas, rotação via block transform para quebrar correlações de coordenadas, quantização de cada coordenada para centroides Lloyd-Max, e inversão da rotação para reconstrução.

A inovação chave reside na decorrelação dos vetores KV cache através de rotação, o que permite quantização mais eficiente sem perda significativa de qualidade. A abordagem do RotorQuant representa um marco importante na otimização de modelos de linguagem para uso em produção.



Mais detalhes em : https://github.com/scrya-com/rotorquant

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

LongHorizon-Harness: a arquitectura que ensina agentes de IA a não perderem o fio
Imagem gerada por I.A.

LongHorizon-Harness: a arquitectura que ensina agentes de IA a não perderem o fio

Publicado em 10/08/2026 10:35

Os agentes de inteligência artificial já conseguem (faz algum tempo) escrever código, operar aplicações, consultar páginas web e executar comandos...

Ler Mais
Xiaomi-Robotics-1: IA para Robôs que Aprende a Manipular Objetos no Mundo Real
Créditos de imagem : Xiaomi-Robotics
Link Externo

Xiaomi-Robotics-1: IA para Robôs que Aprende a Manipular Objetos no Mundo Real

Publicado em 10/08/2026 10:30

O Xiaomi-Robotics-1 (XR-1) é um modelo de IA Vision-Language-Action treinado com mais de 100 mil horas de interações no mundo real, capaz de compreender instruções e executar tarefas de manipulação em ambientes e com objetos que nunca viu antes, adaptando-se ainda a novas tarefas com poucas horas de demonstração.

Visitar Link
LeapTalk: Quebrando o compromisso entre latência e qualidade na geração de avatares falantes
Créditos de imagem : LeapTalk @ zhangrongxiang
Link Externo

LeapTalk: Quebrando o compromisso entre latência e qualidade na geração de avatares falantes

Publicado em 10/08/2026 10:15

O LeapTalk é um sistema de IA para criar avatares falantes em tempo real a partir de áudio, mantendo sincronização labial, identidade e estabilidade visual mesmo em vídeos longos, com geração até 200 FPS.

Visitar Link
VocalRender
Créditos de imagem : VocalRender
Link Externo

VocalRender

Publicado em 10/08/2026 10:15

O VocalRender é um sistema de IA para gerar vozes cantadas expressivas diretamente a partir de letras e partituras MIDI, respeitando notas, duração, ritmo e melodia sem exigir alinhamento fonético manual.

Visitar Link
Wan-Animate-2 - Indo para além dos limites da animação
Créditos de imagem : Tongyi Lab,Alibaba Group
Link Externo

Wan-Animate-2 - Indo para além dos limites da animação

Publicado em 10/08/2026 10:00

Wan-Animate-2 é uma ferramenta de IA que dá vida a personagens a partir de uma imagem, reproduzindo movimentos e expressões com grande fidelidade, incluindo animação em tempo real e controlo do ângulo da câmara.

Visitar Link
MultiAgent CAD
Créditos de imagem : MultiAgent CAD
Link Externo

MultiAgent CAD

Publicado em 10/08/2026 09:40

Multi-Agent-CAD (AgentsCAD) é um sistema de IA multiagente que analisa modelos CAD/STEP e propõe automaticamente alterações geométricas para melhorar a sua fabricação e impressão 3D.

Visitar Link
SymphonyGen - Um modelo de IA para geração e orquestração automática de música sinfónica,
Créditos de imagem : SymphonyGen
Link Externo

SymphonyGen - Um modelo de IA para geração e orquestração automática de música sinfónica,

Publicado em 10/08/2026 09:30

SymphonyGen é um modelo de IA para geração e orquestração automática de música sinfónica, com controlo sobre a estrutura harmónica e a composição multi-instrumental.

Visitar Link
Hermes Agent 0.20 Herald: o agente que passa a falar, colaborar e justificar as suas respostas
Imagem gerada por I.A. com referências de Nous Research

Hermes Agent 0.20 Herald: o agente que passa a falar, colaborar e justificar as suas respostas

Publicado em 05/08/2026 10:10

A versão 0.20.0 do Hermes Agent, conhecida como Herald Release, representa uma mudança importante na forma como os utilizadores interagem...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..