AI推理速度的竞赛正如火如荼地进行中,Cerebras凭借其专用芯片在今年五月的IPO中获得了市场的热烈欢迎。然而,法国初创公司Kog则认为,传统GPU仍有巨大的潜力可以挖掘。
今年五月,Kog在Hacker News首页发布了一项技术预览,展示了“在企业现有的标准数据中心GPU上实现极快的单请求解码”的可能性,演示中使用了AMD MI300X和Nvidia H200 GPU。
虽然部分人对其未能覆盖笔记本GPU感到失望,但更多人看到了潜力。随着推理速度和成本成为关键瓶颈,Kog承诺通过软件优化释放现有硬件的新能力,吸引了大量关注。CEO Gaël Delalleau透露,他们收获了200个实际业务线索。
根据早期反馈,Kog预计软件工程将成为首个应用场景。经验丰富的Claude Code用户深知等待结果可能耗时数小时,而Anthropic也意识到速度的价值,因此对Claude的快速模式收取更高费用。
Kog希望吸引那些因延迟而受阻的客户,尤其是依赖AI工作流完成专业任务的用户。同时,Kog也与设计合作伙伴合作,帮助用户通过提示生成游戏和应用,借助Kog推理引擎(KIE)实现更快的结果,从而带来更多收入。
公司认识到市场尚未完全成熟。观察需求后,Kog发现潜在客户尚未准备好微调小型模型,因此自发布以来,团队专注于加速大型模型的开发以满足需求。
这意味着Kog需要实现巨大飞跃,兑现“LLM推理速度提升30倍”的承诺。其演示展示了每秒3000个请求令牌(TPS)的惊人成绩,但这是基于一个仅有约20亿参数的小型专用模型——现已开源的Laneformer 2B。

Delalleau自信同样的方法能有效应用于大型语言模型(LLM),尽管其规模对推理芯片构成挑战。他认为GPU未来光明,且新一代GPU拥有越来越多的内存带宽,亟待被充分利用。
Kog并非唯一相信软件优化能让GPU发挥更大潜力的公司。法国另一家初创企业ZML发布了硬件无关的软件,绕过Nvidia的CUDA,实现跨芯片的快速推理。但Delalleau表示,Kog更类似于斯坦福大学的Hazy Research实验室,专注于更深层次的GPU加速。
Delalleau本人并非研究人员,他的第一家公司Stribe与Kog毫无关联,唯一联系是其前联合创始人、现风险投资人Kamel Zeroual通过Varsity VC参与了Kog的种子轮投资。Kog的深度专注源于Delalleau独特的背景。
他曾在法国理工学院学习固态物理,随后从事攻防网络安全(白帽黑客)工作。Delalleau表示,这段经历塑造了他鼓励团队采用的思维方式——在科学层面,理解物理定律和GPU规律以最大化利用;在黑客层面,深入逆向工程,理解底层汇编语言和二进制代码,利用硬件实现非设计目标。
这种方法的缺点是极其依赖动手操作且耗时。每款新GPU,团队都需投入数周甚至数月进行深入研究。现有11人的团队规模限制了Kog短期内能支持的芯片数量。
从长远看,Kog希望将其方法论融入基于代理的流水线,以支持更多芯片和模型。随着欧洲力图在这两方面建立自主能力,这将为Kog带来主权优势。公司已获得Scaleway支持,并得到法国Bpifrance和French Tech 2030项目的资助。
目前,Kog需要向世界证明其方法在大型语言模型上的有效性,这也是获得更多融资的关键。Delalleau表示,一旦在9月实现首个10倍速大型模型的部署,将开始展示客户进展,并启动A轮融资。


