Google Photos 上线 Auto frame 功能,可自动重构照片拍摄视角
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新的照片视角重构方法,用机器学习理解场景的 3D 空间布局,再用生成式 AI 想象新视角下的画面。
推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解自动重构拍摄视角的技术路径。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新的照片视角重构方法,用机器学习理解场景的 3D 空间布局,再用生成式 AI 想象新视角下的画面。
推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解自动重构拍摄视角的技术路径。
Google 发布 Vibe Coding XR 工作流,把 Gemini 与基于 WebXR 的 XR Blocks 框架结合,可将自然语言提示直接转成具备物理感知的 Android XR 应用,耗时不到 60 秒。
推荐理由:Google 把 Gemini 的长上下文推理接到 WebXR 框架上,读者可据此判断自然语言生成 XR 原型的可行边界。
Google Research 推出 Groundsource,一套用 Gemini 从非结构化新闻中提取灾害事件的可扩展方法,并发布首个开放数据集,包含 2.6 百万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 把 80 种语言的新闻报道转成结构化灾害数据,其人工核验准确率与覆盖范围可供评估这类方法的上限。
Mistral AI 发布 Mistral Compute,提供私有化集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务,形态从裸金属服务器到全托管 PaaS。
推荐理由:Mistral 把自建训练与推理基础设施对外开放,读者可据此判断欧洲主权 AI 算力供给的形态与边界。
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量或本地 GPU 气隙部署,代码保留在企业边界内。
推荐理由:Mistral 把模型、IDE 插件与本地部署打包成企业级编码助手,可据此判断私有化 AI 编码的落地路径。
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、网页搜索等内置连接器和 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,读者可据此判断企业级智能体平台的搭建方式。