在Hot Chips大会上,OpenAI揭开了其全新AI推理系统Jalapeño的神秘面纱,不仅详细介绍了技术架构,还首次公布了基准测试数据。这款由OpenAI与博通联合研发的芯片,在性能与能效表现上均超越了当前市场上的主流解决方案,引发行业广泛关注。
根据SemiAnalysis的InferenceX测试结果,Jalapeño在单用户token处理量和每千瓦吞吐量两项核心指标上均领先于现有顶尖推理处理器。OpenAI硬件负责人理查德·何强调,该系统通过优化电力利用效率,实现了"用更少能源完成更多工作"的突破,同时将响应速度提升至新高度,既能支撑大规模用户并发请求,又能保持极低的交互延迟。
技术层面,Jalapeño采用全栈协同开发模式,将AI模型架构与芯片设计深度融合。研发团队特别针对推理流程中的预填充阶段和通信延迟进行优化,通过本地化存储KV缓存等关键模型状态,减少数据搬运次数。系统可根据不同推理阶段动态调配计算、内存和网络资源,这种架构设计使数据传输路径缩短了40%以上。
在对比测试中,Jalapeño展现出显著优势。以GPT-OSS 120B、DeepSeek R1和Kimi K2.5 1T三个模型为测试基准,该系统每瓦完成的AI工作量达到英伟达GB200/GB300系统的1.5至1.9倍,端到端延迟则降低至28%至59%。这种能效比的提升,主要得益于其创新的内存访问机制和计算单元调度算法。
OpenAI透露,Jalapeño的研发过程深度整合了自有模型的技术积累。芯片架构从初始设计阶段就考虑了AI推理的特殊需求,例如通过优化矩阵运算单元的布局,使常见推理操作的执行效率提升30%。这种软硬件协同优化的模式,为未来多代技术迭代奠定了基础。
关于部署计划,OpenAI表示将在2024年底启动小规模试点应用,重点测试系统在实际业务场景中的稳定性。2027年将根据试点反馈逐步扩大部署规模,但未透露具体芯片投放数量。业内分析认为,这种渐进式部署策略有助于控制技术风险,同时为生态合作伙伴留出适配时间。












