Mistral Large 4: um modelo europeu de escala inédita, mas ainda em pré-visualização
Mistral Large 4: um modelo europeu de escala inédita, mas ainda em pré-visualização
O sistema combina instruções, raciocínio e funções de agente, aceita texto e imagens e foi concebido para tarefas como programação e análise visual. A Mistral indica preços de 1,36 dólares por milhão de tokens de entrada e 4,18 dólares por milhão de tokens de saída. O contexto anunciado em referências independentes é de 512 mil tokens (não um milhão, como por vezes se afirmou).
A empresa diz que treinou o modelo de raiz em centros de dados europeus e que ultrapassa em performance modelos abertos Americanos e Europeus (o que não é uma fasquia muito alta, que se diga de passagem - e que se note, não mencionou modelos abertos chineses.. pois, porque aí a conversa será outra)! A empresa indica ter usado cerca de 3.800 GPU NVIDIA Grace Blackwell e que a pré-visualização funciona na mesma infraestrutura. Parece ser um passo relevante para a capacidade de desenvolvimento e operação de IA na Europa, mas isso não significa independência tecnológica completa pois o hardware usado é da NVIDIA que por sua vez é uma empresa norte-americana... e... bom... mesmo sendo melhor que antes, este "gordinho" não parece superar os modelos chineses! Mas... vamos seguir em frente... *cof* *cof*...
Na cibersegurança porém, a Mistral destaca resultados fortes em avaliações de detecção e correção de vulnerabilidades, incluindo uma posição entre os modelos de topo no índice da Artificial Analysis. Mas mais uma vez... estes números devem ser lidos com cautela! Estes são resultados de testes específicos e não provam por isso uma superioridade geral. A avaliação pública e reproduzível indicará resultados mais esclarecedores.. ou seja, quando investigadores e programadores puderem testar os pesos por conta própria.
Os primeiros ensaios também mostram que o desempenho real depende da integração. Limites de contexto, parâmetros de raciocínio e compatibilidade com ferramentas de programação podem exigir configuração manual pois uma resposta promissora num benchmark não garante uma experiência simples ou consistente num agente de código.
O Large 4 é, assim, uma aposta ambiciosa num modelo europeu de grande escala e com maior controlo potencial para quem o puder alojar (que certamente muito poucos conseguem), mas por agora, porém, a experiência está limitada à API de pré-visualização. O verdadeiro teste começará quando os pesos forem disponibilizados e os resultados puderem ser verificados fora do ambiente controlado pela própria Mistral. Let the LLM games begin!!!!!