Privacidade por arquitetura
Dado sensível processado on-premise, sem trafegar para fora. Sigilo e soberania garantidos pela topologia da rede, não por uma cláusula de contrato.
O melhor dos dois mundos: a força do ChatGPT na nuvem com a privacidade de um LLM local on-premise (Llama 3, Mistral via Ollama/vLLM). RAG sobre a sua base, roteamento por sensibilidade do dado e conformidade com a LGPD.
Nem todo dado deve subir para a nuvem, e nem toda tarefa se paga rodando on-premise. O ChatGPT (API da OpenAI) entrega modelos de fronteira, com janela de contexto ampla, sem você administrar GPU; um LLM local — como o Llama 3 (Meta) ou o Mistral — mantém a inferência dentro do seu perímetro, com o dado sensível na sua rede. A resposta madura não é escolher um lado: é orquestrar os dois.
A Agência Buzz desenha essa arquitetura híbrida de ponta a ponta. Uma camada de roteamento classifica cada requisição e decide, por sensibilidade e complexidade, o que segue para a nuvem e o que permanece local. Os modelos abertos são servidos por Ollama (setup ágil) ou vLLM (alta vazão, com PagedAttention e batching contínuo), o conhecimento vem da sua base via RAG — embeddings, banco de vetores e recuperação de trechos — e todo o fluxo respeita privacidade, soberania de dados e a LGPD. Nosso especialista em ChatGPT conduz a integração com engenharia de prompt e guardrails.
Somos engenheiros, não vendedores de hype: dizemos com franqueza quando a nuvem basta, quando o servidor local se paga e quando o híbrido é o desenho correto. Desde 2013, com mais de 300 projetos entregues, priorizamos tecnologia que resolve — não a que impressiona no slide.
Dado sensível processado on-premise, sem trafegar para fora. Sigilo e soberania garantidos pela topologia da rede, não por uma cláusula de contrato.
Uma camada classifica cada prompt e escolhe o destino: ChatGPT na nuvem para o genérico e complexo, LLM local para o confidencial.
Volume rotineiro absorvido pelo local; picos e tarefas pesadas na nuvem elástica. Previsibilidade no custo por token, sem susto na fatura.
Banco de vetores com os seus documentos — que pode viver on-premise. Respostas ancoradas no seu material, com citação de fonte e atualização imediata.
Llama 3 e Mistral hospedados via Ollama ou vLLM, com quantização e dimensionamento de GPU sob medida para o seu caso.
Ajuste de estilo, formato e vocabulário do modelo local com LoRA/QLoRA quando faz sentido — sem prometer milagre nem treinar do zero à toa.
Nuvem (ChatGPT): acesso aos modelos maiores e mais capazes, com elasticidade instantânea para picos e para tarefas que exigem o topo de raciocínio, sem manter hardware. Ideal para prototipar, validar e para tudo que não é sigiloso.
Local (Llama 3 / Mistral): inferência dentro do seu perímetro, para o dado que não pode sair — sigilo profissional, requisitos de LGPD e custo marginal estável em volume alto. Servido por Ollama ou vLLM, quantizado e dimensionado ao seu parque de GPU.
Mapeamos os dados, o nível de sigilo e o volume de consultas, e definimos o que vale nuvem, o que vale local e onde traçar a fronteira.
Rodamos os modelos candidatos (Llama 3, Mistral, GPT) sobre o seu caso real e medimos qualidade, latência e custo por token antes de qualquer investimento.
Servimos o LLM local via Ollama ou vLLM, montamos o pipeline de RAG e a camada de roteamento, com chaves de API protegidas, guardrails e homologação.
Observamos qualidade, latência e custo em produção, calibramos o roteamento e revisitamos os modelos conforme o ecossistema aberto avança.
O seu dado mais sensível não precisa sair de casa para ter inteligência.
Por três motivos que costumam pesar: privacidade, custo e soberania de dados. Um LLM local processa dentro da sua infraestrutura, então o dado sensível não sai da sua rede — o que simplifica cenários de LGPD, sigilo profissional e auditoria. Em volume alto e contínuo, o custo por token de um modelo próprio tende a ser mais previsível que o da nuvem. E você reduz a dependência de um único fornecedor, porque modelos abertos como Llama 3 e Mistral são portáveis. Em troca, a nuvem entrega os modelos de fronteira sem você manter GPU. Por isso, na maioria dos casos reais, o desenho vencedor é híbrido: cada tarefa no ambiente em que ela sai mais barata e mais segura.
Apenas o que você decidir enviar a ele. A OpenAI declara que os dados trafegados pela API não são usados para treinar seus modelos por padrão, mas ainda assim eles saem da sua rede e vão para a nuvem. Numa arquitetura híbrida, a proteção está no roteamento: perguntas e documentos confidenciais são atendidos pelo LLM local e nunca deixam a sua infraestrutura; só o conteúdo genérico ou não sigiloso pode seguir para o ChatGPT quando vale a pena usar um modelo maior. Você define essa fronteira do dado, e nós a implementamos em código, com mascaramento e logs auditáveis onde fizer sentido.
Depende do modelo, da quantização e do volume simultâneo. Modelos menores e quantizados — por exemplo, versões de 7 a 8 bilhões de parâmetros do Llama 3 ou do Mistral em 4 ou 8 bits — rodam em uma única GPU de bom porte, e até em CPU com desempenho mais modesto. Modelos maiores exigem GPUs com mais memória de vídeo, ou várias em paralelo. É possível hospedar on-premise, num servidor seu, ou numa nuvem privada com GPU dedicada, mantendo o isolamento. No diagnóstico dimensionamos o hardware pelo caso de uso real e pela concorrência esperada, sem superdimensionar nem deixar a fila travar.
Quantização é reduzir a precisão numérica dos pesos do modelo — de 16 bits para 8 ou 4 bits, por exemplo. Na prática, isso encolhe o consumo de memória de vídeo e o custo de GPU, permitindo rodar um modelo maior no mesmo hardware ou atender mais usuários em paralelo. A contrapartida é uma perda de qualidade que costuma ser pequena em 8 bits e um pouco maior em 4 bits, dependendo da tarefa e do idioma. Não decidimos no palpite: testamos os níveis de quantização no seu caso real e escolhemos o ponto de equilíbrio entre custo, velocidade e precisão que atende ao seu padrão de resposta.
São curvas de custo diferentes. A nuvem cobra por uso, em tokens, sem investimento inicial — ótima para começar, validar e para volumes irregulares. O local tem custo inicial de hardware e de operação, mas o custo marginal por consulta tende a ficar mais estável em volume alto e contínuo. Não existe resposta única: fazemos a conta com os seus números de consumo e, com frequência, o desenho mais econômico é híbrido — o local absorve o alto volume rotineiro e a nuvem cobre os picos e as tarefas que pedem o modelo mais forte. Revemos esse cálculo à medida que o seu uso cresce.
Depende da tarefa, do idioma e do hardware disponível. Llama 3 e Mistral são famílias de modelos abertos maduras, com bom desempenho em português e servidas com facilidade por Ollama ou vLLM. A escolha entre elas, e entre os tamanhos, sai de um teste prático: rodamos o seu caso de uso real em alguns candidatos, medimos qualidade, velocidade e custo, e decidimos com dado — não por hype. Como o ecossistema aberto evolui rápido, tratamos essa escolha como reversível e a revisitamos sempre que surge um modelo melhor para o seu problema.
RAG, ou geração aumentada por recuperação, evita treinar um modelo do zero. Nós quebramos os seus documentos em trechos, geramos representações vetoriais — os embeddings — e as guardamos num banco de vetores. Quando chega uma pergunta, recuperamos os trechos mais relevantes e os entregamos ao modelo como contexto para responder. Assim a resposta se apoia no seu material, é atualizável na hora e reduz bastante a chance de o modelo inventar, porque ele passa a citar a fonte. Num desenho híbrido, tanto o índice quanto o modelo podem permanecer locais, mantendo o conteúdo sensível dentro da sua infraestrutura.
Conte quais dados precisam ficar em casa e receba um diagnóstico honesto: a arquitetura híbrida sob medida, o dimensionamento de GPU e o desenho mais econômico entre nuvem, local e roteamento.
Diagnóstico gratuito · resposta em horário comercial · sem compromisso