O modelo certo é pequeno.
Usar um LLM gigante para toda tarefa é desperdício de custo, energia e latência. Para um domínio específico, um modelo compacto e especializado responde mais rápido, custa uma fração e é mais fácil de verificar. Você chama por uma API; a nuvem escala.
Números de benchmarks internos, ilustrativos. Cada afirmação abaixo traz sua fonte e método.
Um modelo gigante para tudo cobra caro pelo que você não usa.
Modelos generalistas carregam centenas de bilhões de parâmetros para responder qualquer pergunta. Numa tarefa estreita, você paga por essa capacidade ociosa em três moedas — dinheiro, tempo e energia.
Custo por chamada
Por 1M de tokens de saída. Preço de tabela do generalista vs. preço AtomoAI, jan/2026.
Latência p95
Primeira resposta, p95, mesma tarefa de extração. Bench interno, 50 mil chamadas us-east.
Energia por 1k chamadas
Estimativa a partir do consumo de GPU por token; ordem de grandeza, não medição certificada.
Três passos do domínio à produção.
Sem provisionar GPU, sem afinar infraestrutura. Você escolhe o modelo do domínio, chama a API e a nuvem cuida da escala.
Escolha o domínio
Selecione um modelo do catálogo — jurídico, atendimento, código, SQL — ou peça um treino sob medida para o seu. Cada modelo vem com benchmark e ficha técnica.
Chame a API
Um endpoint REST, uma chave, resposta em milissegundos. Compatível com o formato de completions que você já usa — troque só o nome do modelo.
Escale na nuvem
Do primeiro request a milhões, sem gerenciar servidores. Auto-scaling, 99.9% de uptime contratual e custo previsível por token.
Um modelo por domínio, com a ficha completa.
Cada modelo é nomeado pelo tamanho e pela especialidade. Parâmetros, latência p95, janela de contexto e preço — tudo à vista, antes de você escrever a primeira linha.
Na tarefa do domínio, o pequeno alcança — ou supera — o gigante.
A tese não é que modelos pequenos são melhores em tudo. É que, na tarefa para a qual foram treinados, empatam ou vencem um generalista de 70B — a uma fração do custo e da latência.
| Modelo | Tarefa · dataset | Métrica | AtomoAI | Generalista 70B | Latência p95 |
|---|---|---|---|---|---|
| atomo-3b-legal | Extração de cláusulas · CUAD-pt | F1 | 94.2% | 91.8% | 41 ms |
| atomo-1b-support | Triagem de tickets · interno-5k | Acurácia | 96.1% | 93.0% | 22 ms |
| atomo-3b-code | Conclusão de função · HumanEval-py | pass@1 | 71.4% | 68.9% | 58 ms |
| atomo-1b-sql | Texto → SQL · Spider-dev | Exec. acc. | 82.7% | 80.1% | 27 ms |
Método: avaliação AtomoAI v3, jan/2026. Generalista de 70B (quantizado, few-shot) na mesma partição de teste. Latência p95 medida no endpoint us-east. Números ilustrativos de benchmark interno — o relatório completo, com seeds e prompts, está nos docs. Fora do domínio treinado, o generalista vence; é para isso que ele existe.
Uma chamada. Resposta em 38 ms.
Se você já integrou uma API de completions, já sabe usar a AtomoAI. Troque o nome do modelo e pronto.
- REST + streaming SSE, SDKs em Python e JS
- Custo exato retornado em cada resposta
- Sem provisionar GPU, sem tempo de cold start
# Autentique com sua chave de API export ATOMO_KEY="sk-atomo-•••" # Chame o modelo do domínio curl https://api.atomo.ai/v1/completions \ -H "Authorization: Bearer $ATOMO_KEY" \ -d '{ "model": "atomo-3b-legal", "input": "Resuma as obrigações da cláusula 7.2." }' # → resposta { "model": "atomo-3b-legal", "latency_ms": 38, "output": "A cláusula 7.2 obriga o fornecedor a…", "usage": { "tokens": 214, "cost_usd": 0.0000107 } }
Pare de pagar por parâmetros que você não usa.
Crie uma conta, pegue sua chave e faça a primeira chamada em minutos. Comece grátis — sem cartão.
1M tokens grátis por mês · sem cartão de crédito · cancele quando quiser