# Inferência que não sai da sua máquina

> Para algumas cargas a pergunta interessante não é qual modelo é melhor, mas se o dado tem permissão de sair. Um modelo dentro do processo responde isso sem egress, sem um fornecedor na cadeia de confiança e sem fatura por token — e o que ele cobra em troca é latência e tamanho de modelo.

2026-09-22 · https://synsema.com/pt/blog/inferencia-que-nao-sai-da-sua-maquina


Todo recurso com IA começa com uma pergunta de qualidade: qual modelo escreve o melhor resumo, qual roteia o ticket corretamente. Alguns batem numa segunda pergunta que pesa mais: esse dado tem permissão de sair do prédio? As notas de um hospital, os descritivos das transações de um banco, o material de um escritório de advocacia, o conteúdo de um bucket que seu cliente deixa você processar mas não encaminhar. Quando a resposta é não, o modelo precisa ir até o dado.

Desde o motor **v0.6.27** isso é uma configuração, não um projeto. Um processo Synsema pode rodar um modelo quantizado **dentro de si mesmo** — sem servidor ao lado, sem API key, sem socket — e o mesmo programa que em staging fala com a Anthropic ou a OpenAI roda contra um arquivo em disco na implantação que não tem saída para a internet.

## O que muda na conversa com o cliente

Três coisas deixam de ser promessas e passam a ser propriedades da implantação.

**Não há egress para liberar.** O provider não é "um servidor local na porta 11434" em que uma regra de firewall precisa confiar; é o mesmo processo. A carga pode ser implantada com o acesso à rede negado por completo e o modelo responde igual. Nada para colocar numa allowlist, nada para logar, nada que um revisor precise aceitar por fé.

**Não há fornecedor na cadeia de confiança.** Nenhum termo de serviço para ler sobre treinar com suas entradas, nenhum adendo de tratamento de dados para negociar por causa desse recurso, nenhum suboperador a mais para declarar no questionário que seu cliente manda. Os pesos são um arquivo que você escolheu, e estão onde você colocou.

**Não há fatura por token.** O custo se move para CPU e RAM que você já está pagando, e isso muda quais decisões valem a pena automatizar: as que não justificavam um preço por chamada agora justificam.

## Dentro de um enclave, essa é a diferença entre uma demo e uma implantação

Se a carga roda num TEE — o tema de [Onde rodar uma carga de trabalho confidencial](/pt/blog/onde-rodar-uma-carga-de-trabalho-confidencial) — então chamar a API de um modelo externo abre um buraco exatamente no meio daquilo que o enclave vinha fazer. O dado é decifrado dentro, e depois sai num prompt. Faça o fornecedor o que fizer com isso, a atestação que você mostra ao seu cliente já não cobre mais.

Com o modelo dentro do processo, o prompt nunca cruza a fronteira. Essa é a versão de IA confidencial que sobrevive a uma revisão de segurança, e vale ser preciso sobre o que custa: os pesos entram **dentro** do ambiente medido, o que vai contra [manter o enclave pequeno](/pt/blog/mantenha-o-enclave-pequeno). O atenuante é que pesos são dados, não código — não adicionam um caminho que um atacante possa executar — e são mensuráveis: o motor reporta o sha256 dos pesos, o da definição da arquitetura e o do motor que os rodou, então "qual modelo produziu esta saída" tem uma resposta exata em bytes, e não um nome comercial.

## O que custa, dito na cara

Isso é inferência em CPU, e os números são os que se esperaria de inferência em CPU. O prefill fica em torno de 12 tokens por segundo, então um prompt de 1.000 tokens leva cerca de 90 segundos num modelo pequeno. A geração roda a uns 11 tokens por segundo num modelo de 0.5B e a 5 num de 3B com quatro threads. Carregar o modelo leva 7 segundos para um 0.5B e cerca de 35 para um 3B — pago uma vez por processo, então numa implantação servida o primeiro request paga e o resto não (medido: de 8,2 s para 1,3 s).

Esse perfil tem uma forma clara. Classificar, rotear, extrair, anonimizar, uma reescrita curta, um resumo de alguns parágrafos: ferramenta certa. Um assistente de chat respondendo prompts de 4.000 tokens com respostas longas numa máquina sem GPU: ferramenta errada, e nenhuma configuração vai mudar isso. A arquitetura honesta para a maioria dos produtos são as duas coisas — o modelo pequeno local para as decisões de alto volume sobre dados que não podem se mover, e um modelo de fronteira pela rede para o trabalho em que a qualidade é a restrição e a entrada não é sensível.

## Nada é baixado, e isso importa mais do que parece

O modelo é nomeado do jeito que sua máquina já o nomeia: um caminho para um `.gguf`, um `model:tag` que já está no cache do Ollama, ou um repositório do Hugging Face que já está nesse cache. Nenhuma das três formas busca um byte. Um processo de produção que começa baixando 3 GB de um host que não controla é um evento de cadeia de suprimentos e uma queda esperando um dia de rede ruim; aqui os pesos são provisionados como qualquer outro artefato, e o processo só lê o que está lá.

O motor também deixou de precisar de um release nosso para suportar uma nova família de modelos. Uma arquitetura é um arquivo de texto que o binário já compilado lê ao iniciar — uma lista plana de passos com nome sobre os tensores do arquivo — então um modelo que o motor não conhece pode ser adicionado por quem implanta, sem compilador e sem esperar. O formato não tem condicionais, nem loops, nem forma de abrir um arquivo ou um socket, então aceitar uma definição de fora não é aceitar código. O detalhe para quem programa está em [A model you already have](https://synsema.org/blog/local-inference-architectures-as-files).

## O mesmo release fez isso para as decisões

A outra metade disso é o juiz: um modelo System One que devolve probabilidades calibradas em vez de prosa, que é o que a maior parte da automação realmente precisa. Isso agora também roda local, a partir de um checkpoint em disco sem chave e sem rede — incluindo o portão de confiança que decide o que uma pessoa vê. Está em [Um juiz sem fornecedor](/pt/blog/um-juiz-sem-fornecedor).

## Por onde começar

Pegue o recurso que está travado por uma pergunta de dados e não de qualidade — aquele em que alguém na reunião disse "isso a gente não pode mandar" e o recurso voltou para a gaveta. Veja se o trabalho de modelo dele é classificação ou geração curta. Se for, hoje ele cabe no processo: uma variável nomeia o provider, outra nomeia um modelo que sua máquina já tem, e a implantação onde ele roda não precisa de nenhuma saída para a internet.

