Small Language Models · servidos na nuvem

O modelo certo é pequeno.

Usar um LLM gigante para toda tarefa é desperdício de custo, energia e latência. Para um domínio específico, um modelo compacto e especializado responde mais rápido, custa uma fração e é mais fácil de verificar. Você chama por uma API; a nuvem escala.

38ms
Latência p95
atomo-3b-legal, endpoint us-east, jan/2026. Medido em 50 mil chamadas.
$0.05/1M
Custo por 1M tokens
Tokens de saída, atomo-3b. ~12× abaixo de um generalista de 70B na mesma tarefa.
3B
Tamanho do modelo
3 bilhões de parâmetros — roda em uma única GPU, sem cluster.

Números de benchmarks internos, ilustrativos. Cada afirmação abaixo traz sua fonte e método.

O problema

Um modelo gigante para tudo cobra caro pelo que você não usa.

Modelos generalistas carregam centenas de bilhões de parâmetros para responder qualquer pergunta. Numa tarefa estreita, você paga por essa capacidade ociosa em três moedas — dinheiro, tempo e energia.

Custo por chamada

SLM atomo-3b$0.05
LLM generalista 70B$0.60
~12× mais barato

Por 1M de tokens de saída. Preço de tabela do generalista vs. preço AtomoAI, jan/2026.

Latência p95

SLM atomo-3b38 ms
LLM generalista 70B320 ms
~8× mais rápido

Primeira resposta, p95, mesma tarefa de extração. Bench interno, 50 mil chamadas us-east.

Energia por 1k chamadas

SLM atomo-3b0.03 Wh
LLM generalista 70B~0.9 Wh
~30× menos energia

Estimativa a partir do consumo de GPU por token; ordem de grandeza, não medição certificada.

Como funciona

Três passos do domínio à produção.

Sem provisionar GPU, sem afinar infraestrutura. Você escolhe o modelo do domínio, chama a API e a nuvem cuida da escala.

01

Escolha o domínio

Selecione um modelo do catálogo — jurídico, atendimento, código, SQL — ou peça um treino sob medida para o seu. Cada modelo vem com benchmark e ficha técnica.

02

Chame a API

Um endpoint REST, uma chave, resposta em milissegundos. Compatível com o formato de completions que você já usa — troque só o nome do modelo.

03

Escale na nuvem

Do primeiro request a milhões, sem gerenciar servidores. Auto-scaling, 99.9% de uptime contratual e custo previsível por token.

Catálogo de modelos

Um modelo por domínio, com a ficha completa.

Cada modelo é nomeado pelo tamanho e pela especialidade. Parâmetros, latência p95, janela de contexto e preço — tudo à vista, antes de você escrever a primeira linha.

Jurídico
atomo-3b-legal
Extração de cláusulas, resumo de contratos e classificação de risco em português jurídico.
3B
Parâmetros
40 ms
Latência p95
32k
Contexto
94.2%
F1 · CUAD-pt
$0.05 / 1M tokens
Docs →
Atendimento
atomo-1b-support
Classificação de tickets, roteamento e respostas de primeira linha em canais de suporte.
1B
Parâmetros
22 ms
Latência p95
16k
Contexto
96.1%
Acc · triagem
$0.02 / 1M tokens
Docs →
Código
atomo-3b-code
Conclusão de função, geração de testes e revisão em Python, TypeScript e Go.
3B
Parâmetros
55 ms
Latência p95
32k
Contexto
71.4%
pass@1
$0.06 / 1M tokens
Docs →
Texto → SQL
atomo-1b-sql
Converte perguntas em linguagem natural para consultas SQL válidas sobre seu schema.
1B
Parâmetros
27 ms
Latência p95
8k
Contexto
82.7%
Exec · Spider
$0.02 / 1M tokens
Docs →
Saúde
atomo-3b-medical
Codificação CID, extração de sintomas e resumo de evolução clínica. Não é aconselhamento médico.
3B
Parâmetros
44 ms
Latência p95
32k
Contexto
91.8%
F1 · CID-10
$0.07 / 1M tokens
Docs →
Tradução
atomo-1b-translate
Tradução pt · en · es de baixa latência, com terminologia consistente por glossário.
1B
Parâmetros
19 ms
Latência p95
8k
Contexto
43.6
BLEU · pt→en
$0.02 / 1M tokens
Docs →
Prova · benchmarks

Na tarefa do domínio, o pequeno alcança — ou supera — o gigante.

A tese não é que modelos pequenos são melhores em tudo. É que, na tarefa para a qual foram treinados, empatam ou vencem um generalista de 70B — a uma fração do custo e da latência.

ModeloTarefa · datasetMétricaAtomoAIGeneralista 70BLatência p95
atomo-3b-legalExtração de cláusulas · CUAD-ptF194.2%91.8%41 ms
atomo-1b-supportTriagem de tickets · interno-5kAcurácia96.1%93.0%22 ms
atomo-3b-codeConclusão de função · HumanEval-pypass@171.4%68.9%58 ms
atomo-1b-sqlTexto → SQL · Spider-devExec. acc.82.7%80.1%27 ms

Método: avaliação AtomoAI v3, jan/2026. Generalista de 70B (quantizado, few-shot) na mesma partição de teste. Latência p95 medida no endpoint us-east. Números ilustrativos de benchmark interno — o relatório completo, com seeds e prompts, está nos docs. Fora do domínio treinado, o generalista vence; é para isso que ele existe.

API

Uma chamada. Resposta em 38 ms.

Se você já integrou uma API de completions, já sabe usar a AtomoAI. Troque o nome do modelo e pronto.

  • REST + streaming SSE, SDKs em Python e JS
  • Custo exato retornado em cada resposta
  • Sem provisionar GPU, sem tempo de cold start
exemplo · atomo-3b-legal
# Autentique com sua chave de API
export ATOMO_KEY="sk-atomo-•••"

# Chame o modelo do domínio
curl https://api.atomo.ai/v1/completions \
  -H "Authorization: Bearer $ATOMO_KEY" \
  -d '{
    "model": "atomo-3b-legal",
    "input": "Resuma as obrigações da cláusula 7.2."
  }'

# → resposta
{
  "model": "atomo-3b-legal",
  "latency_ms": 38,
  "output": "A cláusula 7.2 obriga o fornecedor a…",
  "usage": { "tokens": 214, "cost_usd": 0.0000107 }
}

Pare de pagar por parâmetros que você não usa.

Crie uma conta, pegue sua chave e faça a primeira chamada em minutos. Comece grátis — sem cartão.

1M tokens grátis por mês · sem cartão de crédito · cancele quando quiser