Três serviços de engenharia, escopo fixo, preço definido.
Cada serviço responde a um problema específico de infraestrutura de inferência. O cliente escolhe o ponto de entrada com base no problema que precisa resolver agora.
← Voltar ao inícioBilling exports, traces, logs de infraestrutura — o diagnóstico começa pelo que o cliente já tem, não por suposições sobre o ambiente.
Cada número no relatório tem uma fonte e uma premissa listada. O cliente pode verificar e contestar antes de qualquer mudança ser feita.
Código, configurações de tracing e runbooks são transferidos ao final. O trabalho não cria dependência de plataforma ou de fornecedor.
Revisão de Custo de Inferência
R$ 780
Uma leitura focada do que a empresa gasta para servir seus modelos e onde o gasto concentra. O engenheiro lê exportações de billing, rastreia padrões de requisição e reporta os poucos ajustes que fariam diferença — e os que não fariam.
Escrito para leads de engenharia que precisam de um número defensável antes de um ciclo de planejamento. Não requer mudanças de infraestrutura para entregar valor — a revisão é o valor.
Entregáveis
- Breakdown de gasto por workload (modelo principal, embedding, reranking, pré-processamento)
- Lista ranqueada de ajustes com faixas de efeito esperado
- Walkthrough de uma hora com a equipe de engenharia
- Relatório escrito com premissas explícitas
Etapas do trabalho
Indicado para
Equipes cuja conta de cloud cresce sem causa clara, ou que precisam de um número justificável de gasto antes de apresentar ao financeiro ou ao C-level.
Indicado para
Equipes com modelos validados offline que precisam colocá-los em produção de forma estável, com latências documentadas e comportamento de falha previsível.
Engajamento de Arquitetura de Serving
R$ 3.380 — 10 semanas
Cobertura do design e implantação de uma stack de serving para modelos já validados offline. O trabalho inclui estratégia de batching, caching, fila sob carga, política de autoscaling, comportamento em falha e um caminho de rollback que foi efetivamente ensaiado.
Os testes de carga rodam contra o tráfego real do cliente, não contra uma curva sintética. O relatório apresenta as latências nos percentis 50, 95 e 99 — não uma média que esconde a cauda longa.
Entregáveis
- Documento de arquitetura com decisões e justificativas
- Código de infraestrutura (IaC) revisado e documentado
- Relatório de load test com P50, P95 e P99 por componente
- Rollout em etapas com critérios de avanço definidos
- Runbook de on-call com procedimentos de rollback ensaiados
Fases do engajamento
Investigação de Latência
R$ 1.180
Uma investigação curta para equipes cujo caminho de serving ficou lento e que não conseguem identificar a causa. O engenheiro instrumenta o caminho de requisição, separa o tempo de modelo do tempo de rede, fila e serialização, e reporta onde o tempo vai de fato.
Os achados são apresentados com medições, não com afirmações. A equipe recebe dados que pode verificar e um plano de correção que pode executar internamente sem depender da Talvane para as próximas etapas.
Entregáveis
- Setup de tracing distribuído que o cliente retém e opera de forma independente
- Relatório escrito com lista de causas ranqueadas por tempo observado
- Plano de correção com etapas que a equipe pode executar internamente
- Documentação do setup de tracing para operação contínua
Etapas do trabalho
Indicado para
Equipes que notaram aumento de latência em produção mas não conseguem identificar se o problema está no modelo, na rede, na fila ou em algum componente de pré/pós-processamento.
Qual serviço é o certo para o meu caso?
| Característica | Revisão de Custo R$ 780 |
Arquitetura de Serving R$ 3.380 |
Investigação de Latência R$ 1.180 |
|---|---|---|---|
| Duração | ~1 semana | 10 semanas | 1–2 semanas |
| Foco principal | Custo de token e gasto por workload | Stack completa de serving | Latência e gargalos de caminho |
| Código entregue | (setup de tracing) | ||
| Testes de carga | |||
| Runbook de on-call | |||
| Indicado como ponto de entrada | Sim | Quando há sintomas de latência |
* Arquitetura de Serving (destacado em laranja) é o serviço mais abrangente e o mais indicado para equipes que ainda não têm uma stack de serving estruturada.
Padrões técnicos aplicados em todos os serviços
NDA antes do início
Acordo de confidencialidade assinado antes de qualquer dado de billing, log ou configuração ser compartilhado.
Código revisado antes da entrega
Todo código de infraestrutura passa por revisão interna. Documentação é parte do entregável, não apêndice.
Premissas explícitas nos relatórios
Cada número tem fonte e premissa listados. O cliente pode verificar e contestar antes de qualquer implementação.
Testes no tráfego real
Onde aplicável, cargas de teste são construídas a partir do padrão de tráfego observado — não de curvas sintéticas padronizadas.
Rollback ensaiado
No Engajamento de Arquitetura, o caminho de rollback é testado antes da implantação em produção.
Handoff completo ao final
Todos os artefatos — código, configurações, relatórios e runbooks — são transferidos ao cliente. Nenhum ativo fica com a Talvane.
- Leitura de billing exports
- Breakdown por workload
- Lista ranqueada de ajustes
- Walkthrough de 1 hora
- Design e implantação de stack
- Código IaC + testes de carga
- Relatório P50/P95/P99
- Runbook de on-call
- Instrumentação de trace
- Separação de tempo por componente
- Relatório com causas ranqueadas
- Plano de correção
Não tem certeza de por onde começar?
A revisão de custo é o ponto de entrada natural para a maioria das equipes. Em uma semana, o time tem um mapa do gasto e sabe se o próximo passo é a investigação de latência ou o engajamento de arquitetura.
Falar com a equipe