#语音识别

按标签聚合查看文章内容。

AMD的NPU驱动大型语言模型!支持语音识别与图像生成的本地AI工具「Lemonade Server」AI资讯

AMD的NPU驱动大型语言模型!支持语音识别与图像生成的本地AI工具「Lemonade Server」

AMD的AI技术曾被认为落后于NVIDIA和Intel,但近年来其表现显著回升,其中代表作之一便是「Lemonade Server」。 这是一款基于AMD Ryzen AI,整合多种AI运行时的本地AI执行环境。虽然名为服务器,支持远程调用AI功能,但也附带桌面客户端,方便用户在本地直接运行AI模型。 本文将介绍该客户端的基本使用方法。测试设备为搭载AMD Ryzen AI 9 HX 370的日

Slackbot新增跨应用自动化功能,实现业务流程一体化管理AI资讯

Slackbot新增跨应用自动化功能,实现业务流程一体化管理

日本国家Slack公司为其个人AI助手“Slackbot”增添了全新功能。用户此前需要分别操作的应用程序、数据源及第三方代理,现在可以通过Slack中的单一对话界面统一管理。 Slackbot能够将用户使用的应用、代理及数据整合到一个对话式界面中。它与Slack内积累的对话、决策和知识库相连接,直接访问业务所需信息。与公开信息不同,Slackbot能理解企业业务背景,提供针对性回答。 此次功能升

讯飞译制:AI视频字幕制作与翻译软件AI音频

讯飞译制:AI视频字幕制作与翻译软件

讯飞译制是一款基于科大讯飞语音识别与翻译技术的AI视频字幕制作软件,可自动识别语音生成字幕、智能匹配时间轴,并支持多语种视频翻译与多种字幕格式导出,适合自媒体、教育培训、企业宣传等多种场景。

Deepgram 语音识别与语音理解平台AI音频

Deepgram 语音识别与语音理解平台

Deepgram 是面向开发者与企业的云端语音识别与语音理解平台,提供高精度、多语言、低延迟的语音转文字与语音分析能力,可通过 API 快速集成到各类应用中。

微软推出三款全新基础AI模型,挑战竞争对手AI资讯

微软推出三款全新基础AI模型,挑战竞争对手

微软AI研究实验室于周四宣布推出三款基础AI模型,分别支持文本、语音和图像生成。这一发布标志着微软在构建多模态AI模型体系上的持续努力,旨在与其他AI实验室竞争,尽管微软仍与OpenAI保持合作关系。 其中,MAI-Transcribe-1支持25种语言的语音转文本,速度是微软Azure Fast的2.5倍。MAI-Voice-1是一款音频生成模型,能够在一秒内生成60秒的音频,并支持用户定制个性

总部位于巴黎的AI语音初创公司Gradium完成1亿美元种子轮融资,获Nvidia支持AI资讯

总部位于巴黎的AI语音初创公司Gradium完成1亿美元种子轮融资,获Nvidia支持

Gradium是一家总部位于巴黎的语音AI模型初创公司,近日宣布重新开放种子轮融资,吸引了包括Nvidia在内的新投资者,累计融资金额达到1亿美元。 公司计划利用这笔资金在美国湾区设立办事处,以吸引当地人才,进一步巩固其在全球领先的AI生态系统中的核心地位。巴黎作为欧洲重要的AI中心,这一举措体现了AI初创企业靠近Anthropic、Google、Meta和OpenAI等科技巨头的战略优势。 Gr

Liquid AI免费发布支持边缘推理的日语语音与语言AI模型AI资讯

Liquid AI免费发布支持边缘推理的日语语音与语言AI模型

日本Liquid AI公司于2026年6月6日宣布推出两款面向日语的通用聊天模型和多模态语音文本模型,分别命名为「LFM2.5-1.2B-JP-202606」和「LFM2.5-Audio-1.5B-JP」。这两款模型采用LFM Open License v1.0授权,年收入低于1000万美元的企业可免费商用。 LFM2.5是基于多模态架构“Liquid Foundation Models”的最新