
美国微软公司于7月23日(当地时间)宣布推出两款新AI模型:“MAI-Image-2.5-Pro”和“MAI-Voice-2-Flash”,均作为其自主开发的AI模型系列“MAI”的新成员,以公开预览形式提供。
MAI-Image-2.5-Pro
“MAI-Image-2.5-Pro”是一款专注于图像质量的生成与编辑模型,适用于对图像清晰度要求极高的应用场景。该模型是微软目前最高精度的图像生成模型,同时在文本绘制的准确性和忠实度方面表现优异。
其定价为:每100万文本输入令牌5美元,每100万图像输入令牌8美元,每100万图像输出令牌106美元。
值得一提的是,其基础版本“MAI-Image-2.5”已在美国微软的“Bing Image Creator”、“PowerPoint”和“OneDrive”等产品中广泛应用,普通用户也能享受到该技术带来的便利。在“PowerPoint”中,GPU成本相比之前的“GPT-Image-2”最高降低了84%;在“OneDrive”中,生成图像的保存率提升了26%,95百分位延迟(P95)减少约25%,显著提升了用户体验。

MAI-Voice-2-Flash
“MAI-Voice-2-Flash”是在现有语音生成模型“MAI-Voice-2”的基础上加速优化的版本。它在保持自然语调和高音质的同时,响应速度提升了两倍,价格降低了32%。该模型适合对响应速度要求较高或需要处理大量语音数据的场景。
其定价为每100万字符15美元。该模型已被美国微软的“Dynamics 365 Contact Center”呼叫中心平台采用,客户包括T-Mobile和easyJet,GPU成本最高节省达89%。此外,它还集成于“Azure Voice Live”,支持构建语音对话代理。


