Olha só isso: mais um MoE entrando na disputa

A galera da ANT Group acabou de liberar o Ling 3.0 Tiny no AI Gateway da Vercel, e ele já chegou tomando o slot gratuito que era do Ling 3.0 Flash. Se você tá de olho na onda dos modelos MoE (Mixture-of-Experts), esse aqui merece atenção.

Os números principais:

  • 7.9B de parâmetros totais, mas só ~1.3B ativos por token
  • Janela de contexto de 256K tokens (isso mesmo, 256 mil!)
  • Até 32K tokens de saída
  • Function calling nativo e prompt caching embutidos
  • Otimizado pra agentes responsivos, seguir instruções e conversas multi-turn

O pulo do gato tá na proporção entre parâmetros totais e ativos. Você tem a capacidade de um modelo denso de ~8B, mas paga o custo de inferência de um modelo de 1-2B. Pra quem roda agentes em escala, essa matemática muda tudo.

근거자료: Vercel Changelog — Ling 3.0 Tiny no AI Gateway

Por que MoE tá ganhando a corrida da eficiência

Modelos densos tradicionais ativam todos os parâmetros pra cada token. Arquiteturas MoE roteiam cada token por um subconjunto de especialistas, então você só paga pelo que usa. Os ~1.3B de parâmetros ativos do Ling 3.0 Tiny significam:

  • Latência menor por token comparado a um denso de 8B
  • Inferência mais barata — menos FLOPs por forward pass
  • Throughput melhor pra cargas de trabalho concorrentes de agentes

O trade-off? Modelos MoE podem ser mais chatos de fazer fine-tuning, e o consumo total de VRAM ainda tá atrelado aos 7.9B completos. Mas se seu caso é só inferência, é vitória clara.

Developer configuring Ling 3.0 Tiny MoE model in AI SDK code editor for agent workflows Programming Illustration

Vamos ao código: duas linhas e pronto

A integração com o Vercel AI SDK é minimalista. Olha o setup completo:

import { streamText } from 'ai';

// Use o tier gratuito até 14/08, depois mude pro nome padrão
const result = streamText({
  model: 'inclusionai/ling-3.0-tiny-free',
  prompt: 'Summarize this thread and draft a reply.',
});

É isso. O AI SDK cuida de streaming, retries e failover automaticamente através do AI Gateway.

Cuidado com a migração do nome

Presta atenção nisso, porque muita gente vai escorregar:

PeríodoIdentificador do Modelo
Até 14/08, 8h PTinclusionai/ling-3.0-tiny-free
Depois de 14/08inclusionai/ling-3.0-tiny

Se você deixar o sufixo -free hardcoded, sua aplicação quebra no dia 14. Usa variável de ambiente, pelo amor!

Configurando no coding agent

Quer usar dentro de um coding agent? Um comando só:

vercel ai-gateway coding-agents setup

Depois é só selecionar inclusionai/ling-3.0-tiny-free no picker interativo. O agent vai rotear todas as completions pelo Gateway com sua auth existente.

AI Gateway dashboard showing unified API routing for Ling 3.0 Tiny with cost tracking Dev Environment Setup

O que o AI Gateway te entrega de verdade

Não é só um proxy. O AI Gateway empilha várias features nível produção em cima do acesso cru ao modelo:

  • API unificada — uma interface pra todos os providers
  • Tracking de uso e custo — breakdown por chave e por modelo
  • Retries e failover — fallback automático se um provider cair
  • Zero Data Retention pra workloads com requisitos de compliance
  • Budgets por API key — limites rígidos pra um loop de agent não estourar seu cartão
  • Regras de roteamento — manda requests baratos pra modelos pequenos, complexos pra modelos frontier
  • BYOK (Bring Your Own Key) — usa suas próprias chaves, sem taxa de plataforma

O preço é pass-through. Sem markup na inferência, sem taxa de plataforma, mesmo em requests BYOK. Isso é uma diferença e tanto em relação à maioria dos gateways que ficam com 10-20% no topo.

Limitações e cuidados

Antes de sair arrancando seu setup atual, guarda essas observações:

  1. O tier gratuito expira em 14/08, 8h PT. Depois disso, é pay-per-use nas tarifas do provider. Planeja o orçamento.
  2. MoE ≠ qualidade de modelo denso. Um modelo com 1.3B ativos não vai bater um denso de 70B em tarefas de raciocínio pesado. Ótimo pra agentes, sumarização e chat multi-turn — não pra resolver provas de matemática inéditas.
  3. Contexto de 256K é impressionante, mas o custo de atenção escala quadraticamente. Performance em contexto longo pode degradar de formas que benchmarks nem sempre capturam.
  4. Lock-in via Gateway. Sim, é API unificada, mas migrar depois ainda significa reescrever sua lógica de roteamento.
  5. Function calling é 'nativo' — mas verifica. Testa sempre a confiabilidade do tool-calling contra seu schema específico antes de ir pra produção.

Cloud server infrastructure powering ANT Group Ling 3.0 Tiny model with 256K context window IT Technology Image

Vale a pena testar?

Se você tá construindo agentes, prototipando chat multi-turn, ou só quer um modelo barato pra pipelines de sumarização, sim. A janela gratuita até 14 de agosto é uma forma de baixo risco pra benchmarkar o Ling 3.0 Tiny contra o que você já roda hoje.

A história maior aqui é a tendência MoE. Modelos com poucos parâmetros ativos e capacidade total grande estão virando a escolha padrão pra workloads agênticos, e o Ling 3.0 Tiny é uma entrada sólida nessa categoria.

Próximos passos

  • Troca a string do modelo num projeto AI SDK existente e compara latência
  • Testa function calling contra um schema real de ferramenta (não só no playground)
  • Define um budget cap na sua API key antes de fazer deploy — confia em mim nessa
  • Se você curte inferência on-device, dá uma olhada em como o AI Edge Gallery do Google tá empurrando function calling cross-platform — as duas tendências estão convergindo rápido

Leitura complementar

Este conteúdo foi elaborado com o auxílio de ferramentas de IA, com base em fontes confiáveis, e revisado pela nossa equipe editorial antes da publicação. Não substitui o aconselhamento de um profissional especializado.