Olha só isso: mais um MoE entrando na disputa
A galera da ANT Group acabou de liberar o Ling 3.0 Tiny no AI Gateway da Vercel, e ele já chegou tomando o slot gratuito que era do Ling 3.0 Flash. Se você tá de olho na onda dos modelos MoE (Mixture-of-Experts), esse aqui merece atenção.
Os números principais:
- 7.9B de parâmetros totais, mas só ~1.3B ativos por token
- Janela de contexto de 256K tokens (isso mesmo, 256 mil!)
- Até 32K tokens de saída
- Function calling nativo e prompt caching embutidos
- Otimizado pra agentes responsivos, seguir instruções e conversas multi-turn
O pulo do gato tá na proporção entre parâmetros totais e ativos. Você tem a capacidade de um modelo denso de ~8B, mas paga o custo de inferência de um modelo de 1-2B. Pra quem roda agentes em escala, essa matemática muda tudo.
Por que MoE tá ganhando a corrida da eficiência
Modelos densos tradicionais ativam todos os parâmetros pra cada token. Arquiteturas MoE roteiam cada token por um subconjunto de especialistas, então você só paga pelo que usa. Os ~1.3B de parâmetros ativos do Ling 3.0 Tiny significam:
- Latência menor por token comparado a um denso de 8B
- Inferência mais barata — menos FLOPs por forward pass
- Throughput melhor pra cargas de trabalho concorrentes de agentes
O trade-off? Modelos MoE podem ser mais chatos de fazer fine-tuning, e o consumo total de VRAM ainda tá atrelado aos 7.9B completos. Mas se seu caso é só inferência, é vitória clara.
![]()
Vamos ao código: duas linhas e pronto
A integração com o Vercel AI SDK é minimalista. Olha o setup completo:
import { streamText } from 'ai';
// Use o tier gratuito até 14/08, depois mude pro nome padrão
const result = streamText({
model: 'inclusionai/ling-3.0-tiny-free',
prompt: 'Summarize this thread and draft a reply.',
});
É isso. O AI SDK cuida de streaming, retries e failover automaticamente através do AI Gateway.
Cuidado com a migração do nome
Presta atenção nisso, porque muita gente vai escorregar:
| Período | Identificador do Modelo |
|---|---|
| Até 14/08, 8h PT | inclusionai/ling-3.0-tiny-free |
| Depois de 14/08 | inclusionai/ling-3.0-tiny |
Se você deixar o sufixo -free hardcoded, sua aplicação quebra no dia 14. Usa variável de ambiente, pelo amor!
Configurando no coding agent
Quer usar dentro de um coding agent? Um comando só:
vercel ai-gateway coding-agents setup
Depois é só selecionar inclusionai/ling-3.0-tiny-free no picker interativo. O agent vai rotear todas as completions pelo Gateway com sua auth existente.

O que o AI Gateway te entrega de verdade
Não é só um proxy. O AI Gateway empilha várias features nível produção em cima do acesso cru ao modelo:
- API unificada — uma interface pra todos os providers
- Tracking de uso e custo — breakdown por chave e por modelo
- Retries e failover — fallback automático se um provider cair
- Zero Data Retention pra workloads com requisitos de compliance
- Budgets por API key — limites rígidos pra um loop de agent não estourar seu cartão
- Regras de roteamento — manda requests baratos pra modelos pequenos, complexos pra modelos frontier
- BYOK (Bring Your Own Key) — usa suas próprias chaves, sem taxa de plataforma
O preço é pass-through. Sem markup na inferência, sem taxa de plataforma, mesmo em requests BYOK. Isso é uma diferença e tanto em relação à maioria dos gateways que ficam com 10-20% no topo.
Limitações e cuidados
Antes de sair arrancando seu setup atual, guarda essas observações:
- O tier gratuito expira em 14/08, 8h PT. Depois disso, é pay-per-use nas tarifas do provider. Planeja o orçamento.
- MoE ≠ qualidade de modelo denso. Um modelo com 1.3B ativos não vai bater um denso de 70B em tarefas de raciocínio pesado. Ótimo pra agentes, sumarização e chat multi-turn — não pra resolver provas de matemática inéditas.
- Contexto de 256K é impressionante, mas o custo de atenção escala quadraticamente. Performance em contexto longo pode degradar de formas que benchmarks nem sempre capturam.
- Lock-in via Gateway. Sim, é API unificada, mas migrar depois ainda significa reescrever sua lógica de roteamento.
- Function calling é 'nativo' — mas verifica. Testa sempre a confiabilidade do tool-calling contra seu schema específico antes de ir pra produção.

Vale a pena testar?
Se você tá construindo agentes, prototipando chat multi-turn, ou só quer um modelo barato pra pipelines de sumarização, sim. A janela gratuita até 14 de agosto é uma forma de baixo risco pra benchmarkar o Ling 3.0 Tiny contra o que você já roda hoje.
A história maior aqui é a tendência MoE. Modelos com poucos parâmetros ativos e capacidade total grande estão virando a escolha padrão pra workloads agênticos, e o Ling 3.0 Tiny é uma entrada sólida nessa categoria.
Próximos passos
- Troca a string do modelo num projeto AI SDK existente e compara latência
- Testa function calling contra um schema real de ferramenta (não só no playground)
- Define um budget cap na sua API key antes de fazer deploy — confia em mim nessa
- Se você curte inferência on-device, dá uma olhada em como o AI Edge Gallery do Google tá empurrando function calling cross-platform — as duas tendências estão convergindo rápido
Leitura complementar
- Como a Proteção de Navegação Avançada do Messenger funciona sem comprometer sua privacidade — um bom lembrete de que privacidade e capacidade nem sempre são soma zero.