A Etched começou a enviar seu hardware de inferência de IA? A startup afirma ter entregue seu primeiro rack para a Jane Street enquanto levantava US$ 700 milhões em uma rodada que avaliou a empresa em US$ 21 bilhões. À medida que as cargas de trabalho de inferência ganham escala, a largura de banda de memória, a latência de interconexão, o fornecimento de energia e a utilização sustentada de computação podem se tornar tão importantes quanto o rendimento aritmético máximo. As unidades de processamento gráfico (GPUs) tradicionais foram projetadas para lidar com cargas de trabalho altamente paralelas. No entanto, a geração autorregressiva move repetidamente pesos de modelos, dados de cache KV e estados intermediários através da hierarquia de memória, com padrões de acesso que variam conforme a arquitetura do modelo e a configuração de atendimento.
Por que o primeiro rack da Etched é importante para a economia da inferência de IA
Visão Geral
- A Etched concluiu uma rodada de financiamento de US$ 700 milhões liderada pela Jane Street, duplicando seu valuation em papel para US$ 21 bilhões em apenas um mês.
- A empresa enviou seu primeiro rack de inferência para a Jane Street, marcando um marco importante enquanto a gigante de negociação quantitativa começa a implantar o hardware em suas cargas de trabalho.
- A Etched garantiu mais de US$ 1 bilhão em contratos com clientes em empresas de IA públicas e privadas, fornecendo um sinal precoce da demanda dos clientes.
O rápido crescimento da IA ger 생성... (gerativa) aumentou a demanda por infraestrutura de computação de alto desempenho. Durante a era de treinamento inicial, as unidades de processamento gráfico padrão foram altamente eficazes porque o treinamento de modelos dependia de cálculos contínuos de retropropagação. As cargas de trabalho de treinamento geralmente conseguem expor mais paralelismo aritmético do que a decodificação autorregressiva, tornando as GPUs particularmente adequadas para a computação matricial em grande escala.
No entanto, à medida que as aplicações transicionam para a era da inferência, os requisitos de engenharia mudam. Ao contrário do treinamento, a inferência não atualiza repetidamente os pesos dos modelos; o desempenho de atendimento depende fortemente de mover e processar de forma eficiente o estado do modelo sob restrições de latência e vazão. Dependendo das características da carga de trabalho, a largura de banda da memória e a latência de interconexão podem deixar os recursos de computação subutilizados, mesmo quando o rendimento aritmético máximo é alto. A Etched argumenta que a vazão de inferência sustentada em aceleradores de IA existentes pode permanecer bem abaixo do pico de FLOPs, uma vez que restrições térmicas, de memória e de interconexão limitam a utilização.

Essas restrições ajudam a explicar por que o hardware de inferência especializado está atraindo investimentos. A Etched busca um sistema de inferência verticalmente codesenvolvido que abrange silício, racks, memória, interconexões, software e fabricação. Embora a empresa estivesse originalmente associada a um design de silício específico para Transformers, seus sistemas atuais foram projetados para dar suporte a uma gama mais ampla de arquiteturas de modelos de fronteira, incluindo modelos de mistura de especialistas (MoE) e, de acordo com executivos da empresa, arquiteturas que não são baseadas em Transformer, como o Mamba. Ao codesenvolver toda a pilha de execução, o hardware personalizado visa reduzir a sobrecarga de execução. A compensação é clara: o hardware personalizado é geralmente menos flexível do que as plataformas de GPU de propósito geral para cargas de trabalho fora de seu domínio de inferência direcionado. A implantação da Jane Street fornece um sinal inicial de confiança do cliente na arquitetura da Etched, embora os dados públicos ainda não estabeleçam seu desempenho em escala de produção ou vantagem de custo sobre os principais sistemas de GPU, conforme discutido na reportagem do TechCrunch sobre a rodada de financiamento.
Mecanismos internos: inferência de baixa tensão e memória em escala de cluster
Em escala de rack, os subsistemas de memória e as interconexões de expansão podem limitar a rapidez com que o estado do modelo se move entre a memória e os recursos de computação. Quando uma aplicação executa uma chamada de inferência, o processador deve ler os dados da memória, concluir a operação e gravar a saída de volta. Em configurações padrão, essas transferências podem introduzir latência e pressão de largura de banda em toda a hierarquia de memória e na interconexão de expansão.
Para solucionar esses gargalos de inferência, a Etched combina duas abordagens arquitetônicas complementares para cargas de trabalho de alta vazão e baixa latência:
Inferência de Baixa Tensão (LVI) e Memória em Escala de Cluster (CSM)
- Inferência de Baixa Tensão (LVI): A Etched posiciona a LVI principalmente em torno da inferência de alta vazão e a descreve no contexto de cargas de trabalho pesadas de pré-carga. A Etched afirma que blocos matemáticos de menor tensão permitem uma densidade de computação substancialmente maior dentro do envelope de energia e térmico disponível, ao mesmo tempo em que reduzem a exposição a restrições de energia e térmicas.
- Memória em Escala de Cluster (CSM): A CSM tem como alvo o acesso à memória de baixa latência e foi projetada para resolver os gargalos de decodificação. A Etched argumenta que os sistemas de IA baseados em HBM atuais lutam para alcançar latência de decodificação em nível de SRAM devido a gargalos nos subsistemas de memória e de interconexão. A CSM resolve isso conectando vários chips por meio de uma interconexão proprietária de alta largura de banda, criando um pool de memória compartilhado e de baixa latência em todo o domínio de expansão.
Um mapeamento simplificado baseado na descrição da Etched sobre as cargas de trabalho de pré-carga e decodificação pode ser representado como:
[Cargas de Trabalho de Alta Vazão / Pesadas em Pré-Carga]
│
▼
[Inferência de Baixa Tensão — LVI]
[Cargas de Trabalho de Baixa Latência / Pesadas em Decodificação]
│
▼
[Memória em Escala de Cluster — CSM]
Ao codesenvolver computação, memória e interconexões, a Etched visa melhorar a utilização sustentada de inferência. Juntas, essas abordagens visam diferentes restrições de computação, memória e interconexão em todas as cargas de trabalho de inferência.

ASICs especializados vs. GPUs de propósito geral: avaliando o compromisso de especialização
À medida que os ambientes modernos de computação caminham para plataformas de hardware alternativas, os desenvolvedores precisam reavaliar como gerenciam pilhas de execução e cargas de trabalho computacionais. A transição de GPUs de propósito geral para circuitos integrados específicos de aplicação (ASICs) representa uma escolha estratégica fundamental. As equipes de engenharia devem ponderar as vantagens potenciais de eficiência do hardware dedicado em relação aos riscos sistêmicos de vinculação de software e limites arquitetônicos rígidos.
Avaliação arquitetônica: ASIC personalizado vs. GPU de propósito geral
O desenvolvimento de um ASIC requer recursos consideráveis de engenharia inicial, acordos de fabricação de longo prazo e um perfil de carga de trabalho estável e previsível. Essa abordagem pode melhorar o desempenho por token e a eficiência de custos quando as características da carga de trabalho se alinham de perto com o hardware, mas limita a capacidade da plataforma de se adaptar se as arquiteturas de redes neurais subjacentes passarem por uma mudança repentina. Por outro lado, as GPUs se beneficiam de um ecossistema de software maduro e geralmente oferecem maior flexibilidade quando as arquiteturas de modelos evoluem, embora os ASICs específicos para cargas de trabalho possam oferecer maior eficiência quando a carga de trabalho corresponde intimamente à sua arquitetura.
A tabela abaixo resume as principais compensações entre ASICs especializados e GPUs de propósito geral:
| Dimensão | ASIC Especializado | GPU de Propósito Geral |
|---|---|---|
| Flexibilidade de Carga de Trabalho | Mais baixa | Mais alta |
| Ecossistema de Software | Mais especializado | Maduro (ex: CUDA) |
| Otimização de Inferência | Potencialmente alta | Ampla/geral |
| Risco de Concentração de Implantação | Maior dependência de carga de trabalho/fornecedor | Ecossistema mais amplo, mas ainda dependente de fornecedor |
| Economia de Escala | Depende da adequação e utilização da carga de trabalho | Estabelecida |
| Flexibilidade de Atualização | Mais baixa | Mais alta |
A avaliação dessas compensações de hardware é fundamental à medida que as organizações escalam seus clusters de implantação ativa. Embora as GPUs de propósito geral continuem sendo o padrão para pesquisas comuns e experimentação com múltiplos modelos, os ASICs especializados são cada vez mais atraentes para cargas de trabalho de produção de alto volume e bem definidas, onde a minimização da latência é o principal objetivo operacional.
Listas de verificação de integração: como as equipes de engenharia se preparam para o codesenvolvimento de hardware e software
Para manter a estabilidade de execução e um desempenho previsível à medida que os data centers adotam hardware de inferência especializado, as equipes de engenharia e produto devem adotar fluxos de trabalho de codesenvolvimento robustos.
Lista de verificação de implementação para desenvolvedores
- Perfil de Requisitos de Memória de Modelo e Cache KV: Meça os pesos do modelo, o crescimento do cache KV, a memória de ativação e a sensibilidade ao tamanho do lote sob o tráfego de produção.
- Avaliar a Compatibilidade da Arquitetura do Modelos: Verifique se suas redes neurais de produção se alinham com os operadores matemáticos em nível de hardware suportados pelo ASIC.
- Avaliar a Latência de Execução Principal: Analise as etapas de pré-carga e decodificação separadamente sob distribuições de lote realistas para identificar potenciais gargalos no pipeline.
Lista de verificação de produto e estratégia
- Avaliar a Estabilidade da Carga de Trabalho Antes da Especialização de Hardware: Determine com que frequência as arquiteturas de modelos de produção mudam antes de se comprometer com um hardware mais especializado.
- Auditar a Economia de Inferência: Monitore a vazão por dólar e por watt para justificar os custos de transição para a adoção de pilhas de hardware especializadas.
- Verificar a Escalabilidade do Sistema: Garanta que seus planos de implantação de hardware levem em conta os prazos de entrega de matérias-primas e restrições de fornecimento de embalagens avançadas.
Ao estabelecer essas diretrizes estruturadas, as equipes de desenvolvimento podem transicionar suas aplicações para implantações de inferência mais confiáveis e eficientes, mantendo a continuidade operacional.
Perguntas Frequentes (FAQ)
Quando um ASIC de inferência especializado pode superar uma GPU de propósito geral?
Como a Inferência de Baixa Tensão e a Memória em Escala de Cluster resolvem os gargalos de pré-carga e decodificação?
Qual é o maior risco comercial de adotar hardware de inferência especializado?
Principais conclusões para as equipes de engenharia
O primeiro envio de rack da Etched dá à empresa algo que seu valuation de US$ 21 bilhões não tinha antes: uma implantação real em um cliente. A adoção precoce da Jane Street e mais de US$ 1 bilhão em contratos reportados fortalecem o argumento da demanda, mas contratos e testes iniciais não são o mesmo que economia comprovada em grande escala.
A aposta técnica é mais ampla do que um único chip. A Etched está codesenvolvendo silício, memória, interconexões, racks e software em torno de cargas de trabalho de inferência, usando LVI para operações de alta vazão e CSM para acesso à memória de baixa latência. Para os compradores, a questão central é se esses ganhos de eficiência podem superar a flexibilidade, a maturidade do ecossistema, a resiliência da cadeia de suprimentos e o caminho de atualização oferecidos pelas GPUs de propósito geral.
Referências
-
Etched. From Zero to One: Shipped First Customer Delivery. https://www.etched.com/progress/from-zero-to-one
-
Reuters. AI chip startup Etched valued at $21 billion in latest funding round. https://www.reuters.com/technology/ai-chip-startup-etched-valued-21-billion-latest-funding-round-2026-08-18/
-
TechCrunch. Etched’s valuation doubles to $21B in a month. https://techcrunch.com/2026/08/18/etcheds-valuation-doubles-to-21b-in-a-month/
-
TechCrunch. AI chip startup Etched defies skeptics, hits $10.3B valuation from big-name investors. https://techcrunch.com/2026/07/23/ai-chip-startup-etched-defies-skeptics-hits-10-3b-valuation-from-big-name-investors/
Share this article



