Links Externos
Co-Scientist: um parceiro de IA multiagente para acelerar a investigação científica
Publicado em 25/05/2026 13:50 em Links Externos
O Co-Scientist da Google DeepMind é um sistema de IA baseado no Gemini que gera, debate, refina e hierarquiza hipóteses científicas para ajudar investigadores a descobrir novas linhas de pesquisa, sobretudo nas ciências da vida.
Visitar Link
LongCat-Video-Avatar 1.5: geração de avatares em vídeo guiada por áudio
Publicado em 25/05/2026 09:35 em Links Externos
O LongCat-Video-Avatar 1.5 é um modelo open-source para gerar vídeos de avatares humanos, animados ou animais a partir de áudio, com sincronização labial, estabilidade temporal e suporte a cenários como apresentação, canto, marketing e conversas multi-pessoa.
Visitar Link
Carbon: o modelo de IA da Hugging Face para analisar e gerar sequências de ADN
Publicado em 25/05/2026 09:26 em Links Externos
O Carbon é um modelo que permite avaliar sequências de ADN, observar mutações e prever alterações funcionais.
Visitar Link
L2P: Da Representação Latente à Geração de Imagens em Píxeis
Publicado em 25/05/2026 09:20 em Links Externos
L2P, um paradigma eficiente que transfere conhecimento de modelos de difusão latentes pré-treinados para geração direta em píxeis, permitindo imagens de alta qualidade e alta resolução com baixo custo computacional.
Visitar Link
Surface Light Field Tokenization
Publicado em 25/05/2026 08:44 em Links Externos
Visualização conceptual de IA a transformar imagens 2D em objetos 3D através de tokens, campos de luz e reconstrução de superfícies.
Visitar Link
RecGen: reconstrução 3D generativa com RGB-D e o salto na oclusão
Publicado em 11/05/2026 14:05 em Artigos, Links Externos
A reconstrução 3D de cenas reais continua a ser um problema difícil quando há objectos parcialmente escondidos, simetrias visuais e poucos pontos de vista. O...
Ler Mais
Ollama é agora powered by MLX nos Apple Silicon
Publicado em 31/03/2026 11:12 em Links Externos, Recursos
Para os que fazem uso da framework MLX da Apple. Uma das vantagens é que se toma partido da memória unificada.. e bom.. isso é mesmo uma grande vantagem!
Visitar Link
Echos Over Time - Como ultrapassar um dos grandes limites dos modelos de video‑to‑audio
Publicado em 02/03/2026 15:20 em Links Externos
O Echoes Over Time explora como ultrapassar um dos grandes limites dos modelos de video‑to‑audio: a capacidade de gerar áudio de longa duração a partir de vídeo, mesmo quando treinados apenas com clipes curtos.
O projeto apresenta a arquitetura MMHNet, uma rede multimodal hierárquica que melhora significativamente a geração de áudio contextualizado por vídeo, escalando para durações superiores a 5 minutos onde métodos anteriores falham.
Esta abordagem mostra que é possível treinar com segmentos curtos e generalizar para vídeos longos, abrindo portas a aplicações mais realistas em multimédia e design sonoro.
Statics2Dynamics - Para além da transformação estática
Publicado em 02/03/2026 15:15 em Links Externos
O projecto Statics2Dynamics propõe um novo paradigma para image editing que vai além da simples transformação estática de imagens, introduzindo transições físicas previsíveis entre estados para gerar edições que respeitam leis de física como refracção ou deformação realista. Baseia-se num grande conjunto de trajectórias de transição física (PhysicTran38K) e num modelo (PhysicEdit) que combina raciocínio físico guiado por texto-visão com consultas de transição adaptáveis para conduzir um backbone de difusão.
Isto resulta em edições de imagem mais plausíveis e coerentes com o mundo real, superando limitações de métodos que tratam apenas pares de imagens sem dinâmica contínua.
LavaSR - Fast Speech restoration and enhancement
Publicado em 02/03/2026 14:50 em Links Externos
O LavaSR é um modelo de speech enhancement que recupera e melhora rapidamente áudio de baixa qualidade, estendendo a largura de banda (upsampling) até 48 kHz com alta fidelidade e muito maior velocidade do que modelos baseados em difusão. Com apenas ~50 MB e execução até milhares de vezes em tempo real, é ideal para restaurar gravações, melhorar TTS ou chamadas com ruído sem exigir hardware pesado.
Visitar Link
Test-Time Training na reconstrução 3D,
Publicado em 02/03/2026 14:34 em Links Externos
O tttLRM introduz Test-Time Training na reconstrução 3D, permitindo que o modelo se adapte dinamicamente durante a inferência à medida que recebe novas imagens. Em vez de usar apenas representações fixas, comprime múltiplas vistas em pesos adaptativos que capturam a estrutura 3D implícita da cena. O resultado é uma reconstrução mais coerente, escalável e eficiente, com complexidade linear mesmo em contextos longos.
Visitar Link
VecGlypher - Gerador de fontes
Publicado em 01/03/2026 14:44 em Links Externos
O VecGlypher é um modelo de linguagem multimodal que gera glifos vetoriais (contornos SVG editáveis) diretamente a partir de descrições de estilo em texto ou de imagens de referência, sem precisar de passar por rasterização nem vetorização posterior.
Ele produz outlines vetoriais de alta fidelidade num único passo, combinando treino em grande escala com dados tipográficos para dominar geometria e linguagem, facilitando a criação de fontes tipográficas com palavras ou exemplos visuais.