Sistemas em operaçãoSão Paulo, BR, 23°33′S 46°38′W

Radar FSTech

A infraestrutura entrou no modelo

Modelo, acelerador, memória e rede começam a compartilhar o mesmo desenho econômico.

Edição #28 · 21 de julho de 2026 · Arquivo completo

O custo da inteligência artificial está mudando de lugar.

O custo da inteligência está migrando para o co-design.

Radar FSTech #28, infraestrutura integrada ao modelo

Leitores do Radar

Nem todo mundo quer mais conteúdo sobre IA.

Algumas pessoas querem critério.

... leitores já acessaram esta edição do Radar FSTech para separar sinal de ruído no universo da inteligência artificial.

Se você é uma delas, assine o Radar ou compartilhe com alguém que também deveria estar aqui.

Inferência virou um problema de sistema.

O Google apresenta o Ironwood como sua primeira TPU criada especificamente para inferência. A empresa informa duas vezes mais eficiência por watt que a geração anterior, 192 GB de memória de alta largura de banda por chip e 7,37 TB/s de banda de memória.

A Samsung registrou receita e lucro trimestrais recordes em memória. A companhia atribui o resultado à demanda de infraestrutura de IA, aos preços mais altos e à oferta limitada.

Capacidade computacional útil depende tanto do fluxo de dados quanto da multiplicação de matrizes.

Flexibilidade tem custo físico.

Hardware genérico permite trocar modelos e workloads, mas paga por isso em energia, movimentação de dados e latência. Quando uma arquitetura se estabiliza, parte das decisões pode migrar do software para o silício.

O ganho cria uma obrigação. Modelo e hardware passam a compartilhar o mesmo ciclo de decisão. Uma mudança profunda na arquitetura pode reduzir o valor do chip antes do fim de sua vida física.

A memória fecha a equação. Aumentar capacidade aritmética sem alimentar o processador na velocidade necessária apenas desloca o gargalo.

Dados, modelo e máquina começam a operar como uma vertical única.


Meça IA por tarefa concluída. Escolha um fluxo real e registre cinco números:

  1. Custo total por resultado.
  2. Quantidade de inferências.
  3. Latência no percentil 95.
  4. Consumo de contexto.
  5. Taxa de intervenção humana.

Depois, teste roteamento por complexidade. Use o modelo mais capaz onde o custo esperado do erro justificar. Preserve contratos de ferramentas e dados fora das particularidades de um único provedor.

Sua margem precisa sobreviver à arquitetura escolhida.

01

Memória no centro

HBM, armazenamento de cache e interconexão passam a definir a economia dos agentes.

02

Eficiência e lock-in

A integração vertical reduz custo em workloads estáveis e aumenta a penalidade de mudanças profundas.

Google · Samsung Electronics

Antes de dar ação ao agente, desenhe o plano de controle.

O Operational Ontology Starter Kit organiza entidades, relações, decisões e ações antes de você automatizar o processo.

Começar pelo Starter Kit

Acompanhar bastidores no WhatsApp →

Felipe Silva

Felipe Silva

Fundador, FSTech