微软推出了全新图像生成模型 Mai Image 2.5,该模型在视觉推理、文字渲染及空间关系理解上表现强劲,目前在 AI 排行榜位列第三。在应用层面,Microsoft 365 Copilot 迎来了更智能的交互界面,能够无缝抓取用户的文档、邮件及聊天记录进行综合处理。同时,Perplexity 也深度集成了 Microsoft 365 全家桶,允许用户通过复杂的自然语言指令,跨应用程序完成如合同谈判 draft 生成等高阶任务,预示着 AI 办公场景的进一步深化。
AI 代理领域迎来了 Hermes,它通过自我改进的学习循环构建持久记忆,解决了 AI 代理跨任务遗忘的核心痛点,非常适合在个人 VPS 上部署长期自动化作业。与此同时,Leonardo AI 引入了图像转 3D 模型功能,支持通过多角度参考图提升生成的细节精度,极大地降低了游戏资源与电商产品建模的门槛。ElevenLabs 的 Music V2 模型则在合规版权前提下展现了出色的音乐创作能力,并推出了高质量的视频 dubbing 功能,能够保留原声情感与面部表情,为内容创作者提供了新的工具支持。
Google 的 Gemini Omni 模型展示了惊人的创造力,用户通过简单的地图草图或航拍路径规划,即可生成逼真的第一人称驾驶视角或无人机飞掠视频。社会讨论方面,YouTube 开始强制执行 AI 生成内容的自动标签检测,以提升信息透明度。此外,教皇对 AI 发展的关注引发了对“AI 核武器化”风险的讨论,呼吁行业建立外部批评机制。最后,关于企业大规模裁员是否真的由 AI 驱动的争论也愈演愈烈,科技领袖如 Jensen Huang 明确指出 AI 往往被大公司作为臃肿裁员的“懒惰借口”。