#多模态AI

按标签聚合查看文章内容。

DeepSeek发布支持图像的多模态AI模型,性能媲美Opus 4.8AI资讯

DeepSeek发布支持图像的多模态AI模型,性能媲美Opus 4.8

日本DeepSeek公司于2026年8月21日发布了其最新的多模态AI模型“DeepSeek-V4-Flash-Vision-Exp”,该模型首次支持图像输入,能够同时处理文本和图像数据。该模型已集成到DeepSeek API平台,使用费用与现有的DeepSeek V4 Flash保持一致,图像输入的计费上限为每张384个令牌(tokens)。目前该模型仍处于实验阶段,尚未决定是否公开权重。 D

智能手机上本地运行AI的新趋势AI资讯

智能手机上本地运行AI的新趋势

智能手机和电脑虽然可以使用“AI”,但大多数情况下,这只是一个“入口”。实际的处理是在互联网另一端的数据中心中的大型计算机上完成的,因为AI需要大量的内存和计算能力。 然而,最近这种常识开始发生变化。虽然在游戏电脑上运行本地AI的尝试早已有之,但现在终于出现了“在智能手机上运行本地AI”的趋势。 这一变化的契机之一是日本国家谷歌公开的“Gemma4”。该AI核心模型采用了允许商业使用的Apache

微软推出三款全新基础AI模型,挑战竞争对手AI资讯

微软推出三款全新基础AI模型,挑战竞争对手

微软AI研究实验室于周四宣布推出三款基础AI模型,分别支持文本、语音和图像生成。这一发布标志着微软在构建多模态AI模型体系上的持续努力,旨在与其他AI实验室竞争,尽管微软仍与OpenAI保持合作关系。 其中,MAI-Transcribe-1支持25种语言的语音转文本,速度是微软Azure Fast的2.5倍。MAI-Voice-1是一款音频生成模型,能够在一秒内生成60秒的音频,并支持用户定制个性

高性能视频生成AI「MiniMax-H3」开源发布,支持商业用途AI资讯

高性能视频生成AI「MiniMax-H3」开源发布,支持商业用途

2023年8月3日(中国时间),MiniMax发布了通用AI模型「MiniMax-H3」的权重文件,已在Hugging Face平台公开。该模型能够综合理解文本、图像、视频和音频等多种素材,生成最高2K分辨率并带有立体声的视频。 MiniMax-H3采用MiniMax-H3社区许可协议,允许商业使用,但需注明许可信息。若年销售额超过2000万美元(约合31亿元人民币,按1美元兑155日元计算),

巴尔特斯创新株式会社推出利用AI提升业务流程与生产力的解决方案AI资讯

巴尔特斯创新株式会社推出利用AI提升业务流程与生产力的解决方案

巴尔特斯创新株式会社于13日宣布,正式推出一款通过AI技术解决企业业务难题的“AI解决方案”。该方案通过优化业务流程并应用生成式AI,旨在精准解决企业面临的各种业务挑战。 “AI解决方案”采用多模态AI技术,能够跨越文本、语音、图像和数值等多种数据类型,集成于业务流程中,实现自动化和效率提升。该方案不仅仅是将AI作为工具引入,而是在梳理业务问题的基础上,将AI深度嵌入业务流程,实现判断、记录与执行