AI资讯OpenAI的Jalapeño芯片实现大规模快速推理,基准测试表现优异
在周二举行的Hot Chips大会上,OpenAI详细介绍了其新型芯片Jalapeño,并首次公布了该系统的基准测试结果。根据SemiAnalysis的InferenceX基准测试,Jalapeño在每用户处理的令牌数和每千瓦功率的吞吐量方面均优于当前最先进的推理处理器。 OpenAI硬件负责人Richard Ho在新闻发布会上表示:“结果显示,Jalapeño在性能上相较现有技术有非常显著的提升
按标签聚合查看文章内容。
AI资讯在周二举行的Hot Chips大会上,OpenAI详细介绍了其新型芯片Jalapeño,并首次公布了该系统的基准测试结果。根据SemiAnalysis的InferenceX基准测试,Jalapeño在每用户处理的令牌数和每千瓦功率的吞吐量方面均优于当前最先进的推理处理器。 OpenAI硬件负责人Richard Ho在新闻发布会上表示:“结果显示,Jalapeño在性能上相较现有技术有非常显著的提升
AI资讯美国Emurasoft公司于5月7日(日本时间)正式发布了文本编辑器“EmEditor Professional”最新版本v26.1.0。本次更新主要进行了细节优化和性能提升。 在之前的v26.0版本中,EmEditor已经实现了能够快速打开不含换行符的单行超大文件,但水平滚动和编辑操作的性能未有明显提升。本次版本通过算法优化和SIMD指令的应用,使这些操作更加流畅。根据官方基准测试,删除换行符
AI教程vLLM等推理引擎为什么几乎都默认启用连续批处理?核心在于把“批次”从一次性打包,改成每一步动态重建,让GPU不再为已经结束的请求白白烧显存和算力。本文从传统批处理讲起,拆解连续批处理的调度细节、KV缓存与抢占机制,以及如何用几个关键参数在延迟和吞吐量之间做取舍。
AI资讯Cloudflare成为最新加入新型网页浏览器竞赛的公司。但与其向消费者推出Chrome替代品不同,这家互联网基础设施提供商发布了Kitesurf——一款专为AI代理设计的云端浏览器。 AI软件正从简单的问答聊天机器人发展为能够代表用户完成任务的智能代理。浏览器在这一转变中扮演关键角色,因为它们需要像人类一样浏览网页并使用网站。 Cloudflare在其公告中解释道,与为人类设计的传统浏览器不同,
AI资讯Google发布了可在配备16GB VRAM或集成内存的笔记本电脑上运行的多模态模型“Gemma 4 12B”,实现了音频与视觉输入的直接融合。
AI商业BenchiQ 是一个面向开发者和工程团队的在线基准测试与性能分析平台,支持对代码、算法和系统进行可重复、可对比的性能测试与结果可视化展示,帮助用户快速发现性能瓶颈并优化方案。
AI教程为什么顶级 GPU 标称千万亿次算力,却只能跑出几十 token/s?本文用直观比喻和可算的数字,重建你对 GPU 的系统直觉,让批处理、量化、FlashAttention 等优化从“技巧清单”变成顺理成章的结果。
AI教程为什么 1 PFLOPS 的 GPU 生成不了 1M token/s?这篇从算术 vs 内存的根本不对称讲起,把批处理、量化、FlashAttention 等技巧串成一个统一直觉框架。
AI资讯我们的建议:聪明地开始 我们经常被问到的一个问题是:“针对这个工作负载,我应该选择哪个模型?”随着我们发布了更多的模型类别和版本,答案变得更加细致。 本文将详细介绍各个模型类别,选择模型时需要考虑的关键问题,以及其他最佳实践。 但暂且不谈细节,我们的默认建议是从最智能的通用可用模型开始,根据所需的性能和成本调整使用强度。 更智能的模型在每项任务的成本上往往更低,尤其是在较低使用强度时,即使它们的每
AI资讯有些文章读起来像宣言:约翰·巴克斯(John Backus)1977年的《编程能否摆脱冯·诺依曼风格?》激发了一种新范式,催生了函数式语言如Haskell。另一些则是警示:肯·汤普森(Ken Thompson)在1984年的《信任信任的反思》中展示了后门编译器的危险,可能避免了大量安全漏洞。埃兹格·迪克斯特拉(Edsger Dijkstra)在1972年的《谦逊的程序员》中提醒同行们警惕过度聪明,
AI资讯苹果于7月13日发布了iOS 27公测版,经过一段时间的使用,整体表现既不惊艳也不失望。本文分享了新系统的亮点与不足。
AI资讯NVIDIA与Amazon Web Services合作,优化AI系统构建环境,提升企业AI部署的性能与效率。