微软通过推出三种基本模型来巩固其在人工智能领域的地位,这些模型能够生成文本、语音和视觉内容。这些由MAI超级智能团队开发的模型反映了向完全控制AI堆栈的转变,而不仅仅是整合地面能力。这些模型包括MAI-Transcribe-1,一个支持25种语言的语音转录模型,MAI-Voice-1,能够在仅一秒钟内生成60秒的语音,以及MAI-Image-2,专注于生成视觉内容。微软计划以具有竞争力的价格提供这些模型,强调在商业环境中采用的经济优势。尽管进行了内部开发,公司仍然保持与OpenAI的合作,采取双重战略:内部开发核心能力和外部合作以加速创新。这一举措为公司提供了更多选择和成本优势,迅速融入现有的微软产品中。