Etched 是否已经开始交付其 AI 推理硬件?这家初创公司宣布,在以 210 亿美元估值完成 7 亿美元融资的同时,已向 Jane Street 交付了首个机架。随着推理工作负载的不断扩展,内存带宽、互连延迟、供电能力以及持续的计算资源利用率,往往变得与峰值算力吞吐量同等重要。传统图形处理器(GPU)专为处理高度并行的工作负载而设计。然而,自回归生成会不断在内存层次结构中传输模型权重、KV-cache 数据以及中间状态,其访问模式会随模型架构和部署配置的不同而变化。
为什么 Etched 的首个机架对 AI 推理经济学至关重要
核心要点
- Etched 完成了由 Jane Street 领投的 7 亿美元融资,在一个月内使其纸面估值翻倍至 210 亿美元。
- 该公司已向 Jane Street 交付了首个推理机架,标志着这家量化交易巨头开始在其工作负载中部署该硬件,迈出了关键一步。
- Etched 已经在公共和私营 AI 公司中获得了超过 10 亿美元的客户合同,这为市场需求发出了早期信号。
生成式 AI 的迅猛发展推高了对高性能计算基础设施的需求。在最初的模型训练时代,标准图形处理器非常高效,因为模型训练依赖于持续的反向传播计算。训练工作负载通常能暴露出比自回归解码更多的算力并行性,这使得 GPU 极其契合大规模矩阵计算。
然而,随着应用迈入推理时代,工程需求已经发生了转变。与训练不同,推理不会重复更新模型权重;相反,推理性能在很大程度上取决于在延迟和吞吐量约束下高效地传输和处理模型状态。根据工作负载特征的不同,即使峰值算力很高,内存带宽和互连延迟也可能导致计算资源利用率不足。Etched 认为,由于热设计、内存和互连限制了硬件利用率,现有 AI 加速器在推理过程中的持续吞吐量可能远低于峰值 FLOPs。

这些限制有助于解释为什么专门的推理硬件正在吸引大量投资。Etched 正在构建一个涵盖芯片、机架、内存、互连、软件和制造的垂直协同设计推理系统。尽管该公司最初与针对 Transformer 的特定硅片设计紧密相关,但其当前系统旨在支持更广泛的前沿模型架构,包括混合专家模型(MoE),并且据公司高管透露,还支持非 Transformer 架构(如 Mamba)。通过对整个执行栈进行协同设计,这种定制硬件旨在降低执行开销。两者的权衡显而易见:对于其目标推理域之外的工作负载,定制硬件的灵活性通常不如通用 GPU 平台。Jane Street 的部署为市场对 Etched 架构的信心提供了早期信号,尽管公开数据尚未确立其在生产规模下的性能或相比领先 GPU 系统的成本优势,正如TechCrunch 对该轮融资的报道中所讨论的那样。
底层机制:低电压推理与集群级内存
在机架规模下,内存子系统和横向扩展互连可能会制约模型状态在内存与计算资源之间传输的速度。当应用执行推理调用时,处理器必须从内存中读取数据、完成运算并将输出写回。在标准配置下,这些数据传输会在整个内存层次结构和互连中引入延迟和带宽压力。
为了解决这些推理瓶颈,Etched 结合了两种互补的架构方法来应对高吞吐量和低延迟的工作负载:
低电压推理(LVI)与集群级内存(CSM)
- 低电压推理(LVI):Etched 主要将 LVI 定位用于高吞吐量推理,并在预填充(prefill)密集型工作负载的语境下对其进行描述。Etched 表示,更低电压的数学计算模块能够在可用的功耗和散热包络内实现大幅提升的计算密度,同时降低对功耗和散热限制的敏感性。
- 集群级内存(CSM):CSM 专注于低延迟内存访问,旨在解决解码瓶颈。Etched 认为,由于内存子系统和互连瓶颈,当今基于 HBM 的 AI 系统很难实现 SRAM 级别的解码延迟。CSM 通过专有的高带宽互连将多个芯片连接起来,从而在整个横向扩展域中创建了一个共享的、低延迟的内存池。
基于 Etched 对预填充和解码工作负载描述的简化映射可表示为:
[High-Throughput / Prefill-Heavy Workloads]
│
▼
[Low Voltage Inference — LVI]
[Low-Latency / Decode-Heavy Workloads]
│
▼
[Cluster Scale Memory — CSM]
通过协同设计计算、内存和互连,Etched 旨在提高持续的推理利用率。这些方法共同针对推理工作负载中不同的计算、内存和互连限制。

专用 ASIC 与通用 GPU:评估专业化权衡
随着现代计算环境向替代硬件平台演进,开发人员必须重新评估他们管理执行栈和计算工作负载的方式。从通用 GPU 向特定应用集成电路(ASIC)的转变代表了一项基础性的战略选择。工程团队必须权衡专用硬件潜在的效率优势与软件锁定及严格架构边界带来的系统性风险。
架构评估:定制 ASIC 与通用 GPU
开发 ASIC 需要投入大量的前期工程资源、长期的制造协议以及稳定可预测的工作负载配置文件。当工作负载特征与硬件高度吻合时,这种方法可以提高单 Token 性能和成本效率,但如果底层神经网络架构经历突然的范式转变,它将限制平台适应的能力。相反,GPU 受益于成熟的软件生态系统,在模型架构演进时通常能提供更高的灵活性,尽管在工作负载与其架构高度匹配时,工作负载专用的 ASIC 可能具备更强的效率。
下表概述了专用 ASIC 与通用 GPU 之间的核心权衡:
| 维度 | 专用 ASIC | 通用 GPU |
|---|---|---|
| 工作负载灵活性 | 较低 | 较高 |
| 软件生态系统 | 更加专业化 | 成熟(例如 CUDA) |
| 推理优化 | 潜力较高 | 广泛/通用 |
| 部署集中化风险 | 对特定工作负载/供应商的依赖度更高 | 生态系统更广,但仍依赖供应商 |
| 规模经济性 | 取决于工作负载契合度与利用率 | 成熟 |
| 升级灵活性 | 较低 | 较高 |
随着组织不断扩展其活跃的部署集群,评估这些硬件权衡至关重要。虽然通用 GPU 仍然是标准研究和多模型实验的默认选择,但对于将最小化延迟作为首要运营目标的高吞吐量、明确定义的生产工作负载而言,专用 ASIC 的吸引力正日益增加。
集成检查清单:工程团队如何为软硬件协同设计做好准备
随着数据中心采用专门的推理硬件,为了维持执行稳定性和可预测的性能,工程和产品团队必须采用稳健的协同设计工作流。
开发者实现检查清单
- 配置文件与 KV-Cache 内存需求:在生产流量下测量模型权重、KV-cache 增长、激活内存以及批处理大小敏感性。
- 评估模型架构兼容性:验证您的生产神经网络是否与 ASIC 支持的硬件级数学运算符相匹配。
- 基准测试核心执行延迟:在真实的批处理分布下分别对预填充和解码阶段进行性能分析,以识别潜在的流水线瓶颈。
产品与策略检查清单
- 在硬件专业化之前评估工作负载稳定性:在致力于采用更专门的硬件之前,确定生产模型架构更改的频繁程度。
- 审计推理经济学:对每美元吞吐量和每瓦特吞吐量进行基准测试,以证明采用专门硬件栈的切换成本是合理的。
- 验证系统可扩展性:确保您的硬件部署规划考虑了原材料交货期以及先进封装的供应链限制。
通过建立这些结构化的准则,开发团队能够在维持业务连续性的同时,将其应用过渡到更可靠、更高效的推理部署中。
常见问题解答 (FAQ)
专用推理 ASIC 在什么情况下可以胜过通用 GPU?
低电压推理和集群级内存如何解决预填充和解码瓶颈?
采用专用推理硬件面临的最大商业风险是什么?
致工程团队的核心要点
Etched 的首个机架交付为其带来了其 210 亿美元估值此前所欠缺的东西:真实的客户部署。Jane Street 的早期采用以及超过 10 亿美元的公开合同增强了市场需求论证,但合同和早期测试并不等于已被证实的规模化经济效益。
n这项技术押注远超单一芯片。Etched 围绕推理工作负载对硅片、内存、互连、机架和软件进行协同设计,利用 LVI 实现高吞吐量运行,利用 CSM 实现低延迟内存访问。对于买家而言,核心问题在于这些效率提升是否能够盖过通用 GPU 所带来的灵活性、生态成熟度、供应链韧性以及升级路径。
参考文献
-
Etched. 从零到一:完成首个客户交付。 https://www.etched.com/progress/from-zero-to-one
-
路透社. AI 芯片初创公司 Etched 在最新一轮融资中估值达到 210 亿美元。 https://www.reuters.com/technology/ai-chip-startup-etched-valued-21-billion-latest-funding-round-2026-08-18/
-
TechCrunch. Etched 估值在一个月内翻倍至 210 亿美元。 https://techcrunch.com/2026/08/18/etcheds-valuation-doubles-to-21b-in-a-month/
-
TechCrunch. AI 芯片初创公司 Etched 顶住质疑,获得知名投资人青睐,估值达 103 亿美元。 https://techcrunch.com/2026/07/23/ai-chip-startup-etched-defies-skeptics-hits-10-3b-valuation-from-big-name-investors/
Share this article



