<?xml version="1.0" encoding="utf-8"?>
<feed xmlns="http://www.w3.org/2005/Atom">
  <title>51AllAI</title>
  
  <subtitle>探索 AI 的无限可能</subtitle>
  <link href="https://51allai.com/atom.xml" rel="self"/>
  
  <link href="https://51allai.com/"/>
  <updated>2026-09-11T11:01:27.000Z</updated>
  <id>https://51allai.com/</id>
  
  <author>
    <name>51AllAI</name>
    
  </author>
  
  <generator uri="https://hexo.io/">Hexo</generator>
  
  <entry>
    <title>豆包输入法推出 Windows 版，五个平台均已提供下载入口</title>
    <link href="https://51allai.com/posts/2026/09/doubao-ime-windows/"/>
    <id>https://51allai.com/posts/2026/09/doubao-ime-windows/</id>
    <published>2026-09-11T11:01:27.000Z</published>
    <updated>2026-09-11T11:01:27.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>豆包输入法 Windows 版于 2026 年 9 月 8 日开放下载，当前版本为 V0.9.0。它提供语音识别、大模型键盘输入、文字整理和跨端复制粘贴；官网现已列出 Windows、macOS、iOS、Android 与 HarmonyOS NEXT 五个平台的入口。<br><img src="https://images.51allai.com/blog/doubao-ime-windows-cover_20260911_190704.png" alt="豆包输入法 Windows 版与五个平台下载入口" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Windows-版-V0-9-0-已开放下载"><a href="#Windows-版-V0-9-0-已开放下载" class="headerlink" title="Windows 版 V0.9.0 已开放下载"></a>Windows 版 V0.9.0 已开放下载</h2><p>豆包输入法现在可以直接安装到 Windows 电脑。Windows 下载版本为 V0.9.0，发布日期是 2026 年 9 月 8 日，安装包由豆包官方域名提供。</p><p>Windows 版上线后，豆包输入法官网已经同时列出 Windows、macOS、iOS、Android 和 HarmonyOS NEXT。手机与电脑用户可以从同一个产品页面选择对应平台，不必前往第三方下载站寻找安装包。</p><h2 id="语音输入支持方言、专业术语和中英混输"><a href="#语音输入支持方言、专业术语和中英混输" class="headerlink" title="语音输入支持方言、专业术语和中英混输"></a>语音输入支持方言、专业术语和中英混输</h2><p>语音输入可以识别方言、专业术语和中英文混合表达，也覆盖嘈杂环境和轻声说话场景，适合在聊天框、文档或其他可输入文字的位置口述内容。</p><p>键盘输入则加入智能联想、长句补全和随打随纠。这里的大模型能力用于结合当前句子的上下文调整候选内容，减少长句输入时反复拆词和回删的操作。</p><h2 id="长内容可以整理，复制内容可以跨端粘贴"><a href="#长内容可以整理，复制内容可以跨端粘贴" class="headerlink" title="长内容可以整理，复制内容可以跨端粘贴"></a>长内容可以整理，复制内容可以跨端粘贴</h2><p>“智能文字整理”面向较长的口述内容。用户说出零散句子后，可以使用整理功能补全表达、划分重点，再把结果写入当前输入位置。</p><p>“超级互传”用于跨设备复制粘贴。用户在一台设备上复制内容后，可以在另一台设备继续粘贴，减少通过聊天软件或文件传输工具中转文本的步骤。</p><h2 id="从官网下载-Windows-安装包"><a href="#从官网下载-Windows-安装包" class="headerlink" title="从官网下载 Windows 安装包"></a>从官网下载 Windows 安装包</h2><p>打开<a href="https://ime.doubao.com/pc">豆包输入法官网</a>，移动到“多端可用”区域，选择“Windows 版”并点击“立即下载”。下载页会从官方接口取得当前安装包，因此比保存第三方下载链接更适合后续更新。</p><p>安装完成后，先在常用的文档、浏览器和聊天软件里测试语音与键盘输入。需要在电脑和手机之间复制内容时，再使用同一产品提供的跨端互传功能。</p>]]></content>
    
    
    <summary type="html">豆包输入法推出 Windows 版 V0.9.0，官网现已列出五个平台的下载入口。本文梳理语音输入、键盘联想、文字整理与跨端互传等已确认功能，以及 Windows 版的官方下载方式。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="bytedance" scheme="https://51allai.com/tags/bytedance/"/>
    
    <category term="doubao" scheme="https://51allai.com/tags/doubao/"/>
    
    <category term="speech-recognition" scheme="https://51allai.com/tags/speech-recognition/"/>
    
    <category term="doubao-ime" scheme="https://51allai.com/tags/doubao-ime/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 暂停 ChatGPT Pro 200 美元套餐新订阅，现有用户续订不受影响</title>
    <link href="https://51allai.com/posts/2026/09/chatgpt-pro-200-subscription-pause/"/>
    <id>https://51allai.com/posts/2026/09/chatgpt-pro-200-subscription-pause/</id>
    <published>2026-09-11T01:22:51.000Z</published>
    <updated>2026-09-11T01:22:51.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 自 2026 年 9 月 10 日起暂停 ChatGPT Pro 200 美元套餐的新订阅与升级。现有 Pro 200 美元订阅仍会正常续费，Pro 100 美元套餐、其他套餐和 API 不在暂停范围内。<br><img src="https://images.51allai.com/blog/chatgpt-pro-200-subscription-pause-cover_20260911_092709.png" alt="ChatGPT Pro 200 美元套餐新订阅暂停与现有用户续订" fetchpriority="high" decoding="async"></p></blockquote><h2 id="新用户和套餐升级暂时无法购买-Pro-200-美元档"><a href="#新用户和套餐升级暂时无法购买-Pro-200-美元档" class="headerlink" title="新用户和套餐升级暂时无法购买 Pro 200 美元档"></a>新用户和套餐升级暂时无法购买 Pro 200 美元档</h2><p>此次暂停只针对 ChatGPT Pro 200 美元档，也就是 Pro 20x。Free、Go、Plus 和 Pro 100 美元用户都不能在暂停期间新购或升级到这一档。</p><p>Pro 100 美元档仍然可以从定价页面或 <code>Settings → My Plan</code> 升级。其他 ChatGPT 套餐和 OpenAI API 也继续可用。</p><p><img src="https://images.51allai.com/blog/%E6%88%AA%E5%B1%8F2026-09-11_09.27.26_20260911_092749.png" alt="ChatGPT Pro 200 美元套餐新订阅暂停与现有用户续订" loading="lazy" decoding="async"></p><h2 id="现有-Pro-200-美元订阅继续自动续费"><a href="#现有-Pro-200-美元订阅继续自动续费" class="headerlink" title="现有 Pro 200 美元订阅继续自动续费"></a>现有 Pro 200 美元订阅继续自动续费</h2><p>已经使用 Pro 200 美元档的账户不受新购暂停影响，订阅会按原有设置续费。用户如果已经安排取消或降级，在当前计费周期结束前仍保留 Pro 200 美元权益，也可以在账单设置中撤销变更。</p><p>取消或降级一旦生效，账户在暂停期间无法重新购买 Pro 200 美元档。续费付款失败后，如果用户没有在服务提示的时间内恢复付款并导致订阅取消，也会受到同样限制。</p><h2 id="Pro-100-美元与-200-美元档的差别主要在用量"><a href="#Pro-100-美元与-200-美元档的差别主要在用量" class="headerlink" title="Pro 100 美元与 200 美元档的差别主要在用量"></a>Pro 100 美元与 200 美元档的差别主要在用量</h2><p>两档 Pro 套餐包含相同的主要功能，差别是套餐用量：Pro 100 美元档提供 Plus 的 5 倍用量，Pro 200 美元档提供 Plus 的 20 倍用量。暂停期间，Pro 100 美元档是个人用户仍可新购的 Pro 选项。</p><p>GPT-6 Pro 由 GPT-6 Astra 驱动，在两档 Pro 套餐中都可用，但各档的模型用量不同。想了解模型本身而不是订阅变化，可参考 <a href="/posts/2026/09/openai-gpt-6-astra/">GPT-6 Astra 的模型规格、API 价格和上下文窗口</a>。</p><h2 id="取消或降级前先检查计费周期"><a href="#取消或降级前先检查计费周期" class="headerlink" title="取消或降级前先检查计费周期"></a>取消或降级前先检查计费周期</h2><p>现有 Pro 200 美元用户如果需要继续使用该档位，可以在 <code>Settings → My Plan</code> 检查订阅状态。已安排取消或降级的用户，可在当前计费周期结束前撤销。</p><p>如果通过 Apple App Store 或 Google Play 订阅，续费与付款恢复由对应商店处理。通过 chatgpt.com 订阅的用户，在续费失败时会收到与账户关联邮箱的处理说明。</p>]]></content>
    
    
    <summary type="html">OpenAI 暂停 ChatGPT Pro 200 美元套餐的新订阅与升级，现有订阅仍可正常续费，Pro 100 美元套餐继续开放。本文说明取消、降级和续费失败后暂时无法恢复原套餐的影响。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
  </entry>
  
  <entry>
    <title>Google 推出 Gemini Windows 应用，Alt + Space 随时调用</title>
    <link href="https://51allai.com/posts/2026/09/google-gemini-windows-app/"/>
    <id>https://51allai.com/posts/2026/09/google-gemini-windows-app/</id>
    <published>2026-09-10T16:13:50.000Z</published>
    <updated>2026-09-10T16:13:50.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Google 于 9 月 10 日推出 Gemini Windows 应用，支持 Windows 10 及以上系统和 x64、ARM64 设备。安装后按 <code>Alt + Space</code> 即可从当前工作界面调出 Gemini，并在桌面工作区处理文档、连接 Google 应用、生成图片或进行深度研究。<br><img src="https://images.51allai.com/blog/google-gemini-windows-app-cover_20260911_001732.png" alt="Gemini Windows 应用与 Alt Space 桌面快捷键" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Windows-10-或更高版本即可安装"><a href="#Windows-10-或更高版本即可安装" class="headerlink" title="Windows 10 或更高版本即可安装"></a>Windows 10 或更高版本即可安装</h2><p><a href="https://gemini.google/desktop">Gemini Windows 应用</a>已开放下载，系统要求为 Windows 10 或更高版本，同时支持 x64 和 ARM64 架构。覆盖范围跟随 Gemini 应用现有的语言和国家或地区名单，具体功能会因账号和地区而异。</p><p>Windows 版本补齐了 Gemini 的两套主流桌面入口。Google 在 4 月先推出了 <a href="/posts/2026/04/gemini-macos-swift-client/">Gemini macOS 客户端</a>，要求 Apple Silicon 和 macOS 15；Windows 版本则覆盖更早的 Windows 10，并同时兼容两种处理器架构。</p><p><img src="https://images.51allai.com/blog/%E6%88%AA%E5%B1%8F2026-09-11_00.16.15_20260911_001759.png" alt="Gemini Windows 应用与 Alt Space 桌面快捷键" loading="lazy" decoding="async"></p><h2 id="Alt-Space-从当前工作界面调出-Gemini"><a href="#Alt-Space-从当前工作界面调出-Gemini" class="headerlink" title="Alt + Space 从当前工作界面调出 Gemini"></a>Alt + Space 从当前工作界面调出 Gemini</h2><p>应用运行后，按 <code>Alt + Space</code> 可以直接调出 Gemini，无需先切到浏览器。这个快捷键可以在设置中修改，也可以从 Windows 任务栏或系统托盘打开应用。</p><p>快捷入口适合处理临时任务，例如润色文字、总结长文档、起草消息和整理想法。它的变化不在于新增一个模型，而是把 Gemini 从网页标签页移到桌面常驻入口，减少应用之间的切换。</p><h2 id="桌面工作区保留-Gemini-的完整工具入口"><a href="#桌面工作区保留-Gemini-的完整工具入口" class="headerlink" title="桌面工作区保留 Gemini 的完整工具入口"></a>桌面工作区保留 Gemini 的完整工具入口</h2><p>Windows 应用内有独立的桌面工作区。用户可以连接 Gmail、Google Drive、Docs 和 Calendar，从邮件、文档与日程中查找或汇总信息。连接 Google 应用时，Gemini 会按相应账号与服务的可用范围工作。</p><p>创作工具也进入桌面工作区，包括用 Nano Banana 生成图片、用 Gemini Omni 生成视频，以及使用 Deep Research 执行多步骤资料研究。这些能力集中在同一个客户端内，但各项功能的实际可用性仍取决于 Gemini 对账号和地区的开放范围。</p><h2 id="下载安装后即可设置快捷键"><a href="#下载安装后即可设置快捷键" class="headerlink" title="下载安装后即可设置快捷键"></a>下载安装后即可设置快捷键</h2><p>Windows 10 及以上用户可以从桌面版下载页获取安装程序。完成安装并登录 Google 账号后，可直接使用默认的 <code>Alt + Space</code>，也可以进入设置改成自己的组合键。</p>]]></content>
    
    
    <summary type="html">Google 于 2026 年 9 月 10 日推出 Gemini Windows 应用，支持 Windows 10 及以上系统和 x64、ARM64 设备。本文梳理下载入口、Alt + Space 快捷键、Google 应用连接与桌面工作区功能。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="desktop-agent" scheme="https://51allai.com/tags/desktop-agent/"/>
    
    <category term="google" scheme="https://51allai.com/tags/google/"/>
    
    <category term="gemini-desktop" scheme="https://51allai.com/tags/gemini-desktop/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 为 ChatGPT Work 推出数据智能体，可生成交互式仪表盘</title>
    <link href="https://51allai.com/posts/2026/09/openai-chatgpt-work-data-agent/"/>
    <id>https://51allai.com/posts/2026/09/openai-chatgpt-work-data-agent/</id>
    <published>2026-09-10T15:12:19.000Z</published>
    <updated>2026-09-10T15:12:19.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 于 2026 年 9 月 10 日为 ChatGPT Work 推出数据智能体。用户可用自然语言查询已授权的企业数据，追问指标变化的原因，再将分析生成可编辑、分享和刷新的交互式仪表盘。<br><img src="https://images.51allai.com/blog/openai-chatgpt-work-data-agent-cover_20260910_232836.png" alt="ChatGPT Work 数据智能体与交互式仪表盘" fetchpriority="high" decoding="async"></p></blockquote><h2 id="从业务问题直接开始分析"><a href="#从业务问题直接开始分析" class="headerlink" title="从业务问题直接开始分析"></a>从业务问题直接开始分析</h2><p>Data 智能体运行在 ChatGPT Work 中，主要处理企业里的产品、运营、销售和财务数据问题。用户可以直接询问“上周活跃用户为什么变化”，让它比较前后时段、查找可能的驱动因素，并继续追问结果。使用过程不要求用户手写数据库查询语句。</p><p>它不只输出一次性回答。分析结果可以转成内置交互式仪表盘，团队成员能够编辑、分享和刷新。用户也可以把品牌规范加入任务，调整图表和页面的视觉样式。</p><p><img src="https://images.51allai.com/blog/%E6%88%AA%E5%B1%8F2026-09-10_23.29.29_2_20260910_233011.png" alt="ChatGPT Work 数据智能体与交互式仪表盘" loading="lazy" decoding="async"></p><h2 id="可连接数据仓库、文档和-BI-工具"><a href="#可连接数据仓库、文档和-BI-工具" class="headerlink" title="可连接数据仓库、文档和 BI 工具"></a>可连接数据仓库、文档和 BI 工具</h2><p>已公布的数据源包括 Amazon Redshift、Datadog、Google BigQuery、ClickHouse、Databricks、MongoDB 和 Snowflake。Google Drive 与 SharePoint 里的文件和文档也能加入分析。</p><p>单有原始表格还不足以准确理解企业指标。Data 智能体还可读取业务术语、指标定义、自定义计算方式和数据间的关系。这些上下文可以来自 Databricks Genie Ontology、dbt、GitHub、Snowflake Horizon 和现有 BI 仪表盘。BI 是商业智能的缩写，这里指企业已有的数据分析和报表系统。</p><p>它还能在 Omni、Oracle BI、Power BI、Sigma、Tableau 和 ThoughtSpot 中创建或操作仪表盘。因此，团队可以保留现有数据平台，通过 ChatGPT Work 用自然语言指挥分析。</p><h2 id="查询继续遵守现有数据权限"><a href="#查询继续遵守现有数据权限" class="headerlink" title="查询继续遵守现有数据权限"></a>查询继续遵守现有数据权限</h2><p>企业管理员决定哪些数据连接可用，以及哪些角色可以使用它们。Data 智能体发出查询时，会执行已连接账号原有的表、行和列级权限。连接并不会让成员越过数据平台已有的访问范围。</p><p>分析完成后，Data 智能体可以通过 Slack 或电子邮件分享结果，也可以通过已连接工具执行用户批准的后续操作。这类写入和对外发送会继续受工作区设置、应用权限与确认机制约束。</p><h2 id="在插件目录安装后使用-Data"><a href="#在插件目录安装后使用-Data" class="headerlink" title="在插件目录安装后使用 @Data"></a>在插件目录安装后使用 @Data</h2><p>具备 ChatGPT Work 访问权限的账号，可以在 Plugins 目录找到 Data，选择“Install plugin”并完成所需的账号连接。之后在对话中输入 <code>@Data</code>，再直接提出业务问题。</p><p>企业管理员也可以从“Workspace settings &gt; Plugins”为团队安装或开放 Data，然后配置 Databricks、Snowflake 等数据源插件及可用角色。在 ChatGPT Work 中运行数据分析任务，会沿用 <a href="/posts/2026/08/openai-plus-codex-five-hour-limit/">ChatGPT Work 与 Codex 共享额度</a> 的用量结构。</p>]]></content>
    
    
    <summary type="html">OpenAI 为 ChatGPT Work 推出数据智能体，可连接企业数据源，用自然语言调查指标变化并生成可编辑、分享和刷新的交互式仪表盘。本文说明连接范围、权限边界与启用步骤。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="ai-agents" scheme="https://51allai.com/tags/ai-agents/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
  </entry>
  
  <entry>
    <title>DeepSeek 发布 V4.1 Flash，552B 开源模型支持图像输入</title>
    <link href="https://51allai.com/posts/2026/09/deepseek-v41-flash-open-source-multimodal/"/>
    <id>https://51allai.com/posts/2026/09/deepseek-v41-flash-open-source-multimodal/</id>
    <published>2026-09-10T12:32:02.000Z</published>
    <updated>2026-09-10T12:32:02.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>DeepSeek 于 9 月 10 日正式发布 V4.1 Flash。新模型共有 552B 主干参数，可原生处理文本与图像，已以 MIT 许可开源；API 模型名更换为 <code>deepseek-flash</code>，旧 Flash 模型名暂时保留路由兼容。<br><img src="https://images.51allai.com/blog/deepseek-v41-flash-open-source-multimodal-cover_20260910_204304.png" alt="DeepSeek V4.1 Flash 552B 开源模型与多模态 API" fetchpriority="high" decoding="async"></p></blockquote><h2 id="V4-1-Flash-正式进入-API-与开源仓库"><a href="#V4-1-Flash-正式进入-API-与开源仓库" class="headerlink" title="V4.1 Flash 正式进入 API 与开源仓库"></a>V4.1 Flash 正式进入 API 与开源仓库</h2><p>DeepSeek V4.1 Flash 已从两天的中间版本测试转为正式版。临时模型名 <code>deepseek-v4.1-flash-expires-on-0910</code> 不再是正式入口，开发者应把 <code>model</code> 改为 <code>deepseek-flash</code>，API 基础地址仍是 <code>https://api.deepseek.com</code>。</p><p>模型文件、推理代码、提示词编码实现和评测复现说明已放入 <a href="https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash">DeepSeek-V4.1-Flash 开源仓库</a>。仓库和模型权重均使用 MIT 许可，文件可直接下载。</p><h2 id="552B-参数不会在每个阶段全部激活"><a href="#552B-参数不会在每个阶段全部激活" class="headerlink" title="552B 参数不会在每个阶段全部激活"></a>552B 参数不会在每个阶段全部激活</h2><p>V4.1 Flash 是一个拥有 552B 主干参数的混合专家模型（MoE）。MoE 会在每次计算时只调用部分参数：读取输入时每个 Token 激活 8B 参数，生成输出时激活 16B。</p><p>模型采用 Causal Encoder-Decoder（因果编码器—解码器）结构，由 20 层因果编码器和 20 层解码器组成。它把全局 KV Cache 压缩到每个 Token 890 字节，约为上一代 V4 Flash 的四分之一。KV Cache 是模型为上下文保留的中间数据，这个规格直接决定长对话和智能体任务需要保留多少高速存储。</p><h2 id="deepseek-flash-同时接收文本和图像"><a href="#deepseek-flash-同时接收文本和图像" class="headerlink" title="deepseek-flash 同时接收文本和图像"></a><code>deepseek-flash</code> 同时接收文本和图像</h2><p>正式版把图像理解并入主 Flash API。<code>deepseek-flash</code> 可以接收 JPEG、PNG、GIF 和 WebP 图片，用于描述图片、读取截图文字或分析图表。图片可以用 Base64 内联、公开 URL 或 Files API 的 <code>file_id</code> 三种方式传入。</p><p>API 规格同时保留 1M Token 上下文、最大 384K Token 输出和单账号 2500 并发。它支持 JSON Output、Tool Calls、Responses API 和 Anthropic API；使用 OpenAI 兼容的 Chat Completions 接口时，图片只能放在 <code>user</code> 消息中。</p><h2 id="旧-Flash-模型名只剩兼容路由"><a href="#旧-Flash-模型名只剩兼容路由" class="headerlink" title="旧 Flash 模型名只剩兼容路由"></a>旧 Flash 模型名只剩兼容路由</h2><p>V4 Flash 与 V4 Flash Vision Exp 已下线。为了避免现有应用立即失效，<code>deepseek-v4-flash</code> 和 <code>deepseek-v4-flash-vision-exp</code> 两个旧模型名会暂时路由到 V4.1 Flash，账单按 Flash 价格计算。新接入应直接使用 <code>deepseek-flash</code>，现有项目也可以把模型名放进配置项，避免继续依赖过渡期别名。</p><p>新价格已于 9 月 10 日 12:00 生效：空闲时段每百万 Token 的缓存命中输入、缓存未命中输入和输出分别为 0.02 元、1 元和 4 元，高峰时段价格翻倍。完整的新旧价差和 V4 Pro 过渡路由已在 <a href="/posts/2026/09/deepseek-v41-flash-release-plan/">V4.1 Flash 发布与 API 降价预告</a> 中单独梳理。</p>]]></content>
    
    
    <summary type="html">DeepSeek 正式发布 V4.1 Flash。552B MoE 模型已开源，采用 MIT 许可并原生处理文本和图像；API 统一使用 deepseek-flash，支持 1M 上下文和最大 384K 输出。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="open-source" scheme="https://51allai.com/tags/open-source/"/>
    
    <category term="deepseek" scheme="https://51allai.com/tags/deepseek/"/>
    
    <category term="deepseek-v4" scheme="https://51allai.com/tags/deepseek-v4/"/>
    
    <category term="multimodal" scheme="https://51allai.com/tags/multimodal/"/>
    
  </entry>
  
  <entry>
    <title>豆包搜索 Global 版新增图搜图，可返回相似图与网页结果</title>
    <link href="https://51allai.com/posts/2026/09/doubao-search-visual-search/"/>
    <id>https://51allai.com/posts/2026/09/doubao-search-visual-search/</id>
    <published>2026-09-10T03:27:49.000Z</published>
    <updated>2026-09-10T03:27:49.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>豆包搜索 Global 版在 2026 年 9 月新增图搜图。开发者可以把图片 URL 或 Base64 编码作为查询输入，也可指定图片局部并补充文字提示；返回结果同时包含相关图片和网页级信息。<br><img src="https://images.51allai.com/blog/doubao-search-visual-search-cover_20260910_113248.png" alt="豆包搜索 Global 版图搜图与网页结果" fetchpriority="high" decoding="async"></p></blockquote><h2 id="图片成为豆包搜索的查询输入"><a href="#图片成为豆包搜索的查询输入" class="headerlink" title="图片成为豆包搜索的查询输入"></a>图片成为豆包搜索的查询输入</h2><p>这次更新面向火山引擎豆包搜索 Global 版 API。它不是豆包 App 新增入口的说明，而是给企业和开发者接入搜索能力的接口更新。</p><p>豆包搜索在 7 月开放服务时，已经提供 API、Skill 和 MCP 等接入方式，具体背景可参考<a href="/posts/2026/07/doubao-search-service/">豆包搜索服务开放与接入方式</a>。9 月加入图搜图后，Global 版的查询输入从文字扩展到图片。此前 8 月上线的是“文搜图”，也就是输入文字找图片；这次的“图搜图”直接使用一张图片发起检索。</p><h2 id="支持整图、局部图片和文字辅助检索"><a href="#支持整图、局部图片和文字辅助检索" class="headerlink" title="支持整图、局部图片和文字辅助检索"></a>支持整图、局部图片和文字辅助检索</h2><p>图搜请求需要把 <code>SearchType</code> 设为 <code>visual</code>，并在 <code>ImageQuery</code> 中提供图片。图片可以使用 HTTP 或 HTTPS URL，也可以传入纯 Base64 编码，两种方式必须二选一。</p><p><code>RegionOfInterest</code> 用于指定图片中的矩形区域。开发者可以用 0 到 1 之间的相对坐标设置区域边界，让检索只关注图片的一部分。若不传该字段，系统会使用整张图片。</p><p>文字字段 <code>Query</code> 在图搜模式下可以留空。需要缩小检索方向时，也可以加入不超过 100 个字符的文字提示。例如，商品图片中同时出现人物和服装时，应用可以指定服装区域，再用文字补充要找的对象。</p><table><thead><tr><th>请求字段</th><th>作用</th><th>已确认边界</th></tr></thead><tbody><tr><td><code>SearchType</code></td><td>选择图搜模式</td><td>值为 <code>visual</code></td></tr><tr><td><code>ImageQuery.Url</code></td><td>通过网络地址传图</td><td>与 Base64 二选一</td></tr><tr><td><code>ImageQuery.ImageBase64</code></td><td>直接传图片编码</td><td>不包含 Data URL 前缀</td></tr><tr><td><code>RegionOfInterest</code></td><td>指定检索区域</td><td>不传时使用整图</td></tr><tr><td><code>Query</code></td><td>用文字辅助图片检索</td><td>可留空，最长 100 个字符</td></tr></tbody></table><h2 id="一次返回图片与网页级信息"><a href="#一次返回图片与网页级信息" class="headerlink" title="一次返回图片与网页级信息"></a>一次返回图片与网页级信息</h2><p>图搜结果以 <code>Documents</code> 数组返回。每条结果包含排序位置、网页 URL 和标题；<code>Snippet</code> 中可以同时出现文字片段与图片，图片字段包括宽度、高度、地址和替代文本。结果还可带有文件类型、站点名称和站点图标。</p><p>这套结构让接入方不必只展示一组图片缩略图。应用可以把相似图片与它所在的网页放在一起，保留可点击的页面入口和站点信息；也可以把这些字段继续交给智能体做整理、筛选或溯源。</p><p>单次请求默认返回 10 条结果，最多可设为 20 条。<code>MaxSnippetLength</code> 控制单个摘要片段长度，默认 300，最大 3000。</p><h2 id="通过-Global-版-API-接入"><a href="#通过-Global-版-API-接入" class="headerlink" title="通过 Global 版 API 接入"></a>通过 Global 版 API 接入</h2><p>开发者通过 <code>POST https://open.feedcoopapi.com/search_api/global_search</code> 调用接口，并在请求头中使用 API Key 完成 Bearer 鉴权。Global 版默认限流为账号维度 10 QPS，也就是每秒最多处理 10 次请求；需要更高额度时可提交工单扩容。</p><p>Global 版只支持按量后付费，不支持订阅套餐。每个火山引擎账号每月有 500 次免费联网搜索额度，这部分额度与 Custom 版共用，也不区分搜索类型。图搜图适合先用免费额度验证返回图片、网页字段和业务流程，再决定是否持续接入。</p>]]></content>
    
    
    <summary type="html">豆包搜索 Global 版在 2026 年 9 月新增图搜图：开发者可用图片 URL 或 Base64 发起检索，并获得相似图片、网页标题、URL 与站点信息。本文梳理请求字段、返回结构和调用边界。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="ai-search" scheme="https://51allai.com/tags/ai-search/"/>
    
    <category term="bytedance" scheme="https://51allai.com/tags/bytedance/"/>
    
    <category term="doubao" scheme="https://51allai.com/tags/doubao/"/>
    
    <category term="web-search" scheme="https://51allai.com/tags/web-search/"/>
    
  </entry>
  
  <entry>
    <title>Google 推出 Pics，Docs 与 Slides 可直接修图</title>
    <link href="https://51allai.com/posts/2026/09/google-pics-workspace-image-editor/"/>
    <id>https://51allai.com/posts/2026/09/google-pics-workspace-image-editor/</id>
    <published>2026-09-10T03:11:32.000Z</published>
    <updated>2026-09-10T03:11:32.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Google 于 2026 年 9 月 1 日正式推出 AI 图像创作与编辑工具 Pics。符合条件的个人与 Workspace 用户可从独立网页进入，也能在 Docs 和 Slides 中直接修改图片；工具支持对象级局部编辑、图中文字修改、多人协作及 2K、4K JPEG 导出。<br><img src="https://images.51allai.com/blog/google-pics-workspace-image-editor-cover-v2_20260910_111903.png" alt="Google Pics 接入 Docs 与 Slides 的 AI 图像编辑工具" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Pics-把生成和局部编辑放进同一画布"><a href="#Pics-把生成和局部编辑放进同一画布" class="headerlink" title="Pics 把生成和局部编辑放进同一画布"></a>Pics 把生成和局部编辑放进同一画布</h2><p><a href="https://pics.new/">Google Pics</a> 是 Google Workspace 的独立图像创作与编辑工具，底层使用 Gemini 的 Nano Banana 图像模型。用户可以输入文字生成新图，也可以从电脑、Google Drive 或 Google Photos 导入已有图片继续修改。电脑与 Drive 支持上传 JPG、PNG、BMP 和 TIFF 文件。</p><p>Pics 会为同一条提示词提供多个生成结果。已有图片还能作为元素或风格参考，例如沿用一张图片的配色。站内此前介绍过 <a href="/posts/2026/02/google-nano-banana-2/">Nano Banana 2 的图像生成与编辑能力</a>；Pics 将这类模型能力封装成面向普通用户和团队的可视化编辑器。</p><h2 id="对象、选区和文字可以分开修改"><a href="#对象、选区和文字可以分开修改" class="headerlink" title="对象、选区和文字可以分开修改"></a>对象、选区和文字可以分开修改</h2><p>编辑图片时，用户可以把提示词作用于整张图，也可以点选具体对象，或拖动框选一个区域后再描述修改要求。一次操作最多可以加入五处对象、选区或文字修改，确认后统一应用。</p><p>Pics 会识别图片里的文字。用户可以直接替换文字内容，也能要求改变字重、斜体等样式。裁剪工具提供旋转和画幅调整，内置选项包括 16:9、1:1 和 4:3。</p><p>这种操作方式适合修改海报、社交媒体图片和演示插图：需要换一个对象时，不必重新生成整张图；需要制作不同语言版本时，可以直接处理图中文字和版式。</p><h2 id="Docs-与-Slides-可以直接打开-Pics-编辑器"><a href="#Docs-与-Slides-可以直接打开-Pics-编辑器" class="headerlink" title="Docs 与 Slides 可以直接打开 Pics 编辑器"></a>Docs 与 Slides 可以直接打开 Pics 编辑器</h2><p>在 Google Docs 或 Slides 中选中图片后，用户可以打开 Pics 编辑器，完成修改后用新结果替换文档或幻灯片里的原图。编辑器运行在当前应用内，不需要先把图片下载到本地再上传。</p><p>Pics 文件沿用 Workspace 的协作方式，可以邀请其他人以查看者或编辑者身份加入，也可以通过链接分享。用户还能在 Drive 中创建或打开 Pics 文件；Google 已安排继续扩展从 Drive 直接打开普通图片并编辑的入口。</p><h2 id="个人与企业账户需要符合指定套餐"><a href="#个人与企业账户需要符合指定套餐" class="headerlink" title="个人与企业账户需要符合指定套餐"></a>个人与企业账户需要符合指定套餐</h2><p>个人账户需要订阅 Google AI Pro 或 Ultra。企业账户支持 Business Standard、Business Plus、Enterprise Standard 和 Enterprise Plus；教育账户支持 Google AI Pro for Education，AI Expanded Access 附加方案也在开放范围内。组织管理员可以按网域、组织部门或群组关闭 Pics。</p><p>功能采用分批开放：快速发布网域从 9 月 1 日开始，最长需要 15 天；计划发布网域从 9 月 15 日开始，最长也需要 15 天。Pics 支持中文生成和编辑，适用范围覆盖支持 Google Workspace 的国家和地区；德国的个人账户不在开放范围内。</p><h2 id="目前只支持桌面端，4K-下载消耗更多额度"><a href="#目前只支持桌面端，4K-下载消耗更多额度" class="headerlink" title="目前只支持桌面端，4K 下载消耗更多额度"></a>目前只支持桌面端，4K 下载消耗更多额度</h2><p>Pics 目前只在桌面端使用。Google 列出的浏览器范围是最新版和前一个版本的 Chrome、Firefox，以及 Windows 上的 Microsoft Edge；其他浏览器可能无法使用全部功能。</p><p>完成图片后，可以下载原始尺寸、2K JPEG 或 4K JPEG，也可以打印或与协作者共享。下载较高分辨率会更快消耗推广期额度。生成式 AI 功能受使用上限约束，Google 为用户提供的较高访问额度至少持续到 2027 年 2 月 28 日；从 Docs 或 Slides 调用 Pics 时，仍沿用这些应用现有的 Nano Banana 图像生成额度。</p>]]></content>
    
    
    <summary type="html">Google 推出 AI 图像创作与编辑工具 Pics，用户可在独立网页、Docs 和 Slides 中生成或修改图片。本文梳理局部编辑、图中文字处理、2K/4K 导出、开放套餐与桌面端限制。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="image-generation" scheme="https://51allai.com/tags/image-generation/"/>
    
    <category term="google" scheme="https://51allai.com/tags/google/"/>
    
    <category term="gemini" scheme="https://51allai.com/tags/gemini/"/>
    
    <category term="nano-banana" scheme="https://51allai.com/tags/nano-banana/"/>
    
  </entry>
  
  <entry>
    <title>Suno 发布 v6 系列，新增局部编辑与多模态创作</title>
    <link href="https://51allai.com/posts/2026/09/suno-v6-music-models/"/>
    <id>https://51allai.com/posts/2026/09/suno-v6-music-models/</id>
    <published>2026-09-09T15:56:33.000Z</published>
    <updated>2026-09-09T15:56:33.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Suno 于 9 月 9 日发布 v6、v6-wild 和 v6-mini 三款音乐模型。新系列支持用自然语言修改歌曲局部、组合多首歌曲的元素，并可从文字、音频、图片或视频开始创作；v6-mini 对免费账户开放。<br><img src="https://images.51allai.com/blog/suno-v6-music-models-cover_20260910_000126.png" alt="Suno v6 三款音乐模型与局部编辑和多模态创作" fetchpriority="high" decoding="async"></p></blockquote><h2 id="三款模型对应不同创作方式"><a href="#三款模型对应不同创作方式" class="headerlink" title="三款模型对应不同创作方式"></a>三款模型对应不同创作方式</h2><p>Suno v6 系列由三个模型组成。v6 面向目标较明确的创作和后续精修，v6-wild 用于尝试变化更大的方向，v6-mini 则是所有账户都能使用的入口。</p><table><thead><tr><th>模型</th><th>主要用途</th><th>可用账户</th></tr></thead><tbody><tr><td>v6</td><td>按明确目标生成和精修歌曲</td><td>Pro、Premier</td></tr><tr><td>v6-wild</td><td>探索不同编曲和声音方向</td><td>Pro、Premier</td></tr><tr><td>v6-mini</td><td>日常音乐生成</td><td>包括免费账户在内的所有用户</td></tr></tbody></table><p>当前月付价格为：Free 免费，Pro 每月 10 美元，Premier 每月 30 美元。免费用户可以直接使用 v6-mini；需要使用 v6 或 v6-wild 的用户需订阅 Pro 或 Premier。</p><h2 id="自然语言可以只修改歌曲的一部分"><a href="#自然语言可以只修改歌曲的一部分" class="headerlink" title="自然语言可以只修改歌曲的一部分"></a>自然语言可以只修改歌曲的一部分</h2><p>v6 系列允许用户选中已有歌曲的一段，再用日常语言说明改法。系统可以替换这一段，同时保留歌曲其余部分。例如，用户可以要求改变副歌的演唱方式，也可以只替换歌词中的一个词或一行，不必从头生成整首歌。</p><p>这类局部编辑把“生成”和“修改”放进同一条工作流。用户先得到完整歌曲，再针对不满意的段落继续调整，适合需要反复修改歌词、演唱或编曲细节的创作。</p><h2 id="多首歌曲的元素可以在一次请求中组合"><a href="#多首歌曲的元素可以在一次请求中组合" class="headerlink" title="多首歌曲的元素可以在一次请求中组合"></a>多首歌曲的元素可以在一次请求中组合</h2><p>新系列可以在一次请求中组合多个来源。用户可指定从一首歌取人声、从另一首歌取鼓点，再添加新歌词和风格要求，生成新的混音结果。</p><p>采样处理也进入同一流程。用户可以指定时间点，从歌曲中提取一段乐器素材，再围绕它生成新的节拍。这比先导出音频、在其他软件中切片，再返回生成工具的步骤更短。</p><h2 id="文字、音频、图片和视频都能作为起点"><a href="#文字、音频、图片和视频都能作为起点" class="headerlink" title="文字、音频、图片和视频都能作为起点"></a>文字、音频、图片和视频都能作为起点</h2><p>v6 系列接受文字、音频、图片和视频作为创作输入。用户可以从一句描述、语音备忘录、视觉素材或视频开始，再让模型把这些参考转成音乐。图片和视频在这里提供情绪与氛围参考，并不是把画面直接转换成固定音效。</p><p>如果主要需求是通过 Gemini 或 API 从图文生成歌曲，可以对照阅读 <a href="/posts/2026/09/google-lyria-35-gemini-api/">Google Lyria 3.5 的使用入口与 API 价格</a>。Suno v6 这次更新的重点，是在生成之后继续局部编辑、混音和采样。</p><h2 id="普通用户怎么选"><a href="#普通用户怎么选" class="headerlink" title="普通用户怎么选"></a>普通用户怎么选</h2><p>免费账户先使用 v6-mini，适合从提示词或多模态素材快速开始一首歌。Pro 和 Premier 用户在目标清楚时可选择 v6；需要寻找不同方向时，可先用 v6-wild 生成方案，再把选中的结果交给 v6 继续调整。</p><p>三款模型共用局部编辑、多来源混音、采样与多模态输入能力。选择时先看账户权限，再看任务是精确执行还是探索方向，不需要把三个模型依次使用一遍。</p>]]></content>
    
    
    <summary type="html">Suno 发布 v6、v6-wild 和 v6-mini 三款音乐模型，加入自然语言局部改歌、多来源混音、采样分离及图文音视频生成入口。本文说明三款模型的适用场景、账户范围与当前订阅价格。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="audio-generation" scheme="https://51allai.com/tags/audio-generation/"/>
    
    <category term="suno" scheme="https://51allai.com/tags/suno/"/>
    
  </entry>
  
  <entry>
    <title>DeepSeek 预告 V4.1 Flash，Flash API 将同步降价</title>
    <link href="https://51allai.com/posts/2026/09/deepseek-v41-flash-release-plan/"/>
    <id>https://51allai.com/posts/2026/09/deepseek-v41-flash-release-plan/</id>
    <published>2026-09-09T11:19:10.000Z</published>
    <updated>2026-09-09T11:19:10.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>DeepSeek 计划于北京时间 9 月 10 日前后发布 V4.1 Flash。Flash 系列 API 将于 9 月 10 日 12:00 执行新价格；V4.1 Pro 上线前，指向 V4 Pro 的请求将自动路由到 V4.1 Flash，并按 Flash 单价计费。<br><img src="https://images.51allai.com/blog/deepseek-v41-flash-release-plan-cover_20260909_192627.png" alt="DeepSeek V4.1 Flash 发布计划与 Flash API 降价" fetchpriority="high" decoding="async"></p></blockquote><h2 id="V4-1-Flash-计划于-9-月-10-日前后发布"><a href="#V4-1-Flash-计划于-9-月-10-日前后发布" class="headerlink" title="V4.1 Flash 计划于 9 月 10 日前后发布"></a>V4.1 Flash 计划于 9 月 10 日前后发布</h2><p>DeepSeek 在 9 月 9 日公布 V4.1 Flash 的发布计划，时间窗口是北京时间 9 月 10 日前后。这次调整承接了前一天的 <a href="/posts/2026/09/deepseek-v41-flash-beta/">V4.1 Flash 中间版本内测</a>，临时模型名为 <code>deepseek-v4.1-flash-expires-on-0910</code>。</p><p>此次公布的过渡方案会直接影响现有 V4 Pro 用户：V4.1 Flash 上线后、V4.1 Pro 上线前，平台会把指向 V4 Pro 的 API 请求全部路由到 V4.1 Flash，费用也按 V4.1 Flash 的单价计算。已使用 <code>deepseek-v4-pro</code> 的应用不需要为这次路由切换修改请求地址。</p><h2 id="Flash-API-输入与输出单价下调"><a href="#Flash-API-输入与输出单价下调" class="headerlink" title="Flash API 输入与输出单价下调"></a>Flash API 输入与输出单价下调</h2><p>Flash 系列新价格将于 9 月 10 日 12:00 生效。每 100 万 Token 的价格如下：</p><table><thead><tr><th>计费项目</th><th align="right">新空闲时段</th><th align="right">新高峰时段</th><th align="right">调整前空闲时段</th><th align="right">调整前高峰时段</th></tr></thead><tbody><tr><td>缓存命中输入</td><td align="right">0.02 元</td><td align="right">0.04 元</td><td align="right">0.05 元</td><td align="right">0.10 元</td></tr><tr><td>缓存未命中输入</td><td align="right">1 元</td><td align="right">2 元</td><td align="right">1.5 元</td><td align="right">3 元</td></tr><tr><td>输出</td><td align="right">4 元</td><td align="right">8 元</td><td align="right">4.5 元</td><td align="right">9 元</td></tr></tbody></table><p>与调整前相比，缓存命中输入降价 60%，缓存未命中输入降价约 33.3%，输出降价约 11.1%。高峰时段仍为工作日 9:00–12:00 和 14:00–18:00，周末全天执行空闲时段单价。</p><p>Token 是模型读取输入和生成输出时使用的计量单位。如果一次任务分别消耗 100 万个缓存未命中的输入 Token 和 100 万个输出 Token，新价格下空闲时段费用为 5 元，高峰时段为 10 元。调整前两个时段分别需要 6 元和 12 元。</p><h2 id="现有-V4-Pro-项目需重新评估成本基线"><a href="#现有-V4-Pro-项目需重新评估成本基线" class="headerlink" title="现有 V4 Pro 项目需重新评估成本基线"></a>现有 V4 Pro 项目需重新评估成本基线</h2><p>自动路由保持了 V4 Pro 请求的接入方式，但后端实际处理模型和计费单价都会变化。对返回内容有稳定性要求的项目，可以在切换后重跑固定测试集，检查输出格式、工具调用和业务结果。</p><p>成本预算也应改用新单价。过去以 V4 Pro 价格估算的项目，在过渡期会按 Flash 价格扣费；可以沿用原有 Token 用量，分别代入缓存命中、未命中和输出单价，重新设定预算与告警阈值。</p>]]></content>
    
    
    <summary type="html">DeepSeek 计划于 9 月 10 日前后发布 V4.1 Flash，并从当日 12:00 起下调 Flash 系列 API 价格。本文梳理新旧价差、V4 Pro 请求的自动路由安排及对现有开发者的影响。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="deepseek" scheme="https://51allai.com/tags/deepseek/"/>
    
    <category term="deepseek-v4" scheme="https://51allai.com/tags/deepseek-v4/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 发布 ChatGPT Images 2.5，新增 Sketch 与两款 API 模型</title>
    <link href="https://51allai.com/posts/2026/09/chatgpt-images-25-sketch-api/"/>
    <id>https://51allai.com/posts/2026/09/chatgpt-images-25-sketch-api/</id>
    <published>2026-09-09T01:31:02.000Z</published>
    <updated>2026-09-09T01:31:02.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 于 9 月 8 日发布 ChatGPT Images 2.5，面向 ChatGPT、ChatGPT Work 和 Codex 全档位用户推出。新版加入 Sketch 草图生图、模板、图片批注和提示词分享；API 同步提供 Flare 与 Sunburst 两款模型，两款模型的 Token 单价均为 GPT-Image-2 的两倍。<br><img src="https://images.51allai.com/blog/chatgpt-images-25-sketch-api-cover_20260909_093602.png" alt="ChatGPT Images 2.5 Sketch 与 Flare、Sunburst API 模型" fetchpriority="high" decoding="async"></p></blockquote><h2 id="草图和图片批注进入生成流程"><a href="#草图和图片批注进入生成流程" class="headerlink" title="草图和图片批注进入生成流程"></a>草图和图片批注进入生成流程</h2><p>ChatGPT Images 2.5 把草图、模板和图片批注放进同一套创作流程。用户可以先选海报、Logo 等模板，再补充画面内容、文字和风格；也可以在生成后的图片上添加批注，把修改要求指向具体位置。</p><p>Sketch 目前在 ChatGPT 移动应用中使用。在输入框输入 <code>@</code> 并选择 Sketch 后，可以直接画出轮廓，确认草图，再补充主体、颜色或风格要求。它适合难以只靠文字说明的布局，例如商品摆放位置、海报分区或人物动作。</p><p>模板暂不支持 Work mode。普通对话中的图像生成与编辑仍可通过网页、iOS 和 Android 使用，ChatGPT Images 覆盖所有套餐。</p><h2 id="局部修改仍要检查选区之外的变化"><a href="#局部修改仍要检查选区之外的变化" class="headerlink" title="局部修改仍要检查选区之外的变化"></a>局部修改仍要检查选区之外的变化</h2><p>图片批注减少了反复重写完整提示词的需要。需要更换一个物体、背景或一段文字时，可以先标出区域，再描述修改内容；连续调整同一张图时，前一轮结果会保留在当前对话中，方便继续迭代。</p><p>选区不是像素级蒙版，修改可能延伸到标记范围之外。处理人物五官、商品标签、品牌图形或密集文字时，保存前仍要逐项检查未选区域、拼写、边缘和构图。</p><p>如果目标是制作贴纸、图标或商品抠图，可以继续使用<a href="/posts/2026/08/chatgpt-transparent-images/">透明背景图像的生成与编辑方法</a>。</p><h2 id="API-分为-Flare-与-Sunburst"><a href="#API-分为-Flare-与-Sunburst" class="headerlink" title="API 分为 Flare 与 Sunburst"></a>API 分为 Flare 与 Sunburst</h2><p>开发者可以通过 Images API 或 Responses API 调用两款新模型：</p><table><thead><tr><th>模型 ID</th><th>适合的工作流</th><th>取舍</th></tr></thead><tbody><tr><td><code>gpt-image-2.5-flare</code></td><td>日常生成、快速原型和批量任务</td><td>速度优先</td></tr><tr><td><code>gpt-image-2.5-sunburst</code></td><td>需要更细编辑控制的营销素材和产品图</td><td>精度优先，生成时间更长</td></tr></tbody></table><p>Images API 提供从文字生成新图片和编辑已有图片两个端点。Responses API 可以把图像生成放进多轮对话或多步骤流程，并继续使用前一轮图片做高保真编辑。</p><h2 id="两款新模型的-Token-单价相同"><a href="#两款新模型的-Token-单价相同" class="headerlink" title="两款新模型的 Token 单价相同"></a>两款新模型的 Token 单价相同</h2><p>Flare 与 Sunburst 使用同一组标准价格。它们不是按每张图片收取固定费用，而是按输入和输出 Token 计费；实际成本会随图片尺寸、质量、输入素材和生成内容变化。</p><table><thead><tr><th>计费项</th><th align="right">GPT-Image-2.5 Flare &#x2F; Sunburst</th><th align="right">GPT-Image-2</th><th align="right">变化</th></tr></thead><tbody><tr><td>图片输入</td><td align="right">8 美元&#x2F;百万 Token</td><td align="right">4 美元&#x2F;百万 Token</td><td align="right">2 倍</td></tr><tr><td>图片缓存输入</td><td align="right">2 美元&#x2F;百万 Token</td><td align="right">1 美元&#x2F;百万 Token</td><td align="right">2 倍</td></tr><tr><td>图片输出</td><td align="right">30 美元&#x2F;百万 Token</td><td align="right">15 美元&#x2F;百万 Token</td><td align="right">2 倍</td></tr><tr><td>文本输入</td><td align="right">5 美元&#x2F;百万 Token</td><td align="right">2.5 美元&#x2F;百万 Token</td><td align="right">2 倍</td></tr><tr><td>文本缓存输入</td><td align="right">1.25 美元&#x2F;百万 Token</td><td align="right">0.625 美元&#x2F;百万 Token</td><td align="right">2 倍</td></tr></tbody></table><p>普通用户无需选择 API 模型，直接在 ChatGPT 的对话或 Images 页面创建和编辑图片即可。开发者若更看重响应速度，可先测试 Flare；需要多轮局部精修时，再比较 Sunburst 带来的控制能力是否值得更长的生成时间。</p>]]></content>
    
    
    <summary type="html">OpenAI 发布 ChatGPT Images 2.5，加入 Sketch 草图生图、模板、图片批注和提示词分享。本文说明 ChatGPT 各端使用入口、Flare 与 Sunburst 两款 API 模型的定位，以及相较 GPT-Image-2 翻倍的 Token 价格。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
    <category term="image-generation" scheme="https://51allai.com/tags/image-generation/"/>
    
  </entry>
  
  <entry>
    <title>小米开放 MiMo Desktop 邀测，可体验两款 MiMo-X 预览模型</title>
    <link href="https://51allai.com/posts/2026/09/xiaomi-mimo-desktop-invite-test/"/>
    <id>https://51allai.com/posts/2026/09/xiaomi-mimo-desktop-invite-test/</id>
    <published>2026-09-08T10:58:46.000Z</published>
    <updated>2026-09-08T10:58:46.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>小米于 2026 年 9 月 8 日开放 Xiaomi MiMo Desktop 邀测。审核通过的用户可限时、限量、免费体验 MiMo-X-Pro-Preview 与 MiMo-X-Flash-Preview；客户端面向办公、编程、设计和调研任务，生成结果可预览、继续编辑和回退版本。<br><img src="https://images.51allai.com/blog/xiaomi-mimo-desktop-invite-test-cover_20260908_190312.png" alt="Xiaomi MiMo Desktop 邀测与 MiMo-X 预览模型" fetchpriority="high" decoding="async"></p></blockquote><h2 id="从聊天窗口转向可编辑成果"><a href="#从聊天窗口转向可编辑成果" class="headerlink" title="从聊天窗口转向可编辑成果"></a>从聊天窗口转向可编辑成果</h2><p>MiMo Desktop 是一款面向工作任务的桌面 AI 应用。用户可以直接导入表格、图片、视频、PDF、录音和压缩包，用自然语言说明目标，再由客户端拆解步骤并调用工具执行。</p><p>它交付的内容不只是一段回答，还包括可继续修改的文档、表格、幻灯片、网页、图片、音频、视频、3D 模型、App 和软件工程项目。成果可以直接在会话中预览；网页和演示类内容还可点击操作，不需要先搭建本地前端环境。</p><h2 id="局部修改和-Smart-调度进入同一工作台"><a href="#局部修改和-Smart-调度进入同一工作台" class="headerlink" title="局部修改和 Smart 调度进入同一工作台"></a>局部修改和 Smart 调度进入同一工作台</h2><p>生成成果后，用户可以选中文本、图表或表格区域，再描述修改要求。客户端只处理选定范围，并保留不同版本，方便比较和回退。</p><p>内置的 Smart 调度会评估任务类型、复杂程度、交付要求和执行成本，在不同模型、Agent 与执行框架之间选择路径。大型任务还可以拆给多个 Agent，分别处理调研、规划、执行和复核。用户不必在开始任务前手动决定模型或工作流。</p><h2 id="浏览器操控与电脑操控有版本差异"><a href="#浏览器操控与电脑操控有版本差异" class="headerlink" title="浏览器操控与电脑操控有版本差异"></a>浏览器操控与电脑操控有版本差异</h2><p>MiMo Desktop 可以控制浏览器，完成打开网页、检索信息、填写表单和提取素材等操作。网页中的信息可以直接进入当前任务，生成网页后也能在同一流程里检查关键交互。</p><p>更进一步的电脑操控包括读取屏幕、操作键盘和鼠标，以及跨应用传递信息。这项能力仅限海外版；国内版不能按海外版的桌面跨应用能力来理解。</p><h2 id="国内外用户均可提交申请"><a href="#国内外用户均可提交申请" class="headerlink" title="国内外用户均可提交申请"></a>国内外用户均可提交申请</h2><p>国内用户可前往 <a href="https://mimo.xiaomimimo.com/desktop/invite/">MiMo Desktop 国内邀测页</a> 提交申请，海外用户使用 <a href="https://mimo-ai.xiaomimimo.com/desktop/invite/">海外邀测页</a>。审核通过后才能下载和使用客户端，现阶段优先向 Xiaomi MiMo 开放平台已有用户开放。</p><p>邀测期间提供的两款模型是 MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview。它们仍属于 Preview 版本，本次开放的是申请通道，不是无需审核即可下载的公开测试。</p><p>与此前面向开发者的 <a href="https://www.51allai.com/posts/2026/05/xiaomi-mimo-v25-api-price-cut/">MiMo-V2.5 API 与 Token Plan</a> 不同，MiMo Desktop 把模型、工具调用、成果预览和修改放进一个桌面工作台，普通用户不需要先接入 API 才能参与这次邀测。</p>]]></content>
    
    
    <summary type="html">小米于 2026 年 9 月 8 日开放 Xiaomi MiMo Desktop 邀测，审核通过者可限时、限量、免费体验两款 MiMo-X 预览模型。本文梳理申请入口、可编辑成果、Smart 调度及国内外版本差异。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="desktop-agent" scheme="https://51allai.com/tags/desktop-agent/"/>
    
    <category term="xiaomi" scheme="https://51allai.com/tags/xiaomi/"/>
    
    <category term="mimo" scheme="https://51allai.com/tags/mimo/"/>
    
  </entry>
  
  <entry>
    <title>DeepSeek 开放 V4.1 Flash 中间版本内测，单账号限流 20 并发</title>
    <link href="https://51allai.com/posts/2026/09/deepseek-v41-flash-beta/"/>
    <id>https://51allai.com/posts/2026/09/deepseek-v41-flash-beta/</id>
    <published>2026-09-08T09:07:17.000Z</published>
    <updated>2026-09-08T09:07:17.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>DeepSeek 于 9 月 8 日开放 V4.1 Flash 中间版本内测。内测用户无需更换 API 基础地址，只需使用临时模型名 <code>deepseek-v4.1-flash-expires-on-0910</code>；价格沿用 V4 Flash，单账号限流 20 并发。<br><img src="https://images.51allai.com/blog/deepseek-v41-flash-beta-cover_20260908_171235.png" alt="DeepSeek V4.1 Flash 中间版本内测与 20 并发限制" fetchpriority="high" decoding="async"></p></blockquote><h2 id="内测使用临时模型名"><a href="#内测使用临时模型名" class="headerlink" title="内测使用临时模型名"></a>内测使用临时模型名</h2><p>这次内测没有替换现有的 <code>deepseek-v4-flash</code>。收到内测通知的 API 用户需要保持 <code>https://api.deepseek.com</code> 不变，把请求中的模型名改为：</p><figure class="highlight text"><table><tr><td class="gutter"><pre><span class="line">1</span><br></pre></td><td class="code"><pre><span class="line">deepseek-v4.1-flash-expires-on-0910</span><br></pre></td></tr></table></figure><p>使用 OpenAI Python SDK 时，只需要替换 <code>model</code> 参数：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">from</span> openai <span class="keyword">import</span> OpenAI</span><br><span class="line"></span><br><span class="line">client = OpenAI(</span><br><span class="line">    api_key=<span class="string">&quot;&lt;your DeepSeek API Key&gt;&quot;</span>,</span><br><span class="line">    base_url=<span class="string">&quot;https://api.deepseek.com&quot;</span>,</span><br><span class="line">)</span><br><span class="line"></span><br><span class="line">response = client.chat.completions.create(</span><br><span class="line">    model=<span class="string">&quot;deepseek-v4.1-flash-expires-on-0910&quot;</span>,</span><br><span class="line">    messages=[&#123;<span class="string">&quot;role&quot;</span>: <span class="string">&quot;user&quot;</span>, <span class="string">&quot;content&quot;</span>: <span class="string">&quot;请解释这段代码的作用。&quot;</span>&#125;],</span><br><span class="line">)</span><br><span class="line"></span><br><span class="line"><span class="built_in">print</span>(response.choices[<span class="number">0</span>].message.content)</span><br></pre></td></tr></table></figure><p>临时模型名包含 <code>expires-on-0910</code>。接入时应把它放在独立配置项中，不要直接替换生产环境的长期默认模型；内测入口变化后，只需改配置，不必重新修改业务代码。</p><h2 id="价格沿用-V4-Flash"><a href="#价格沿用-V4-Flash" class="headerlink" title="价格沿用 V4 Flash"></a>价格沿用 V4 Flash</h2><p>V4.1 Flash 中间版本按 V4 Flash 现行价格计费。每 100 万 Token 的人民币单价如下：</p><table><thead><tr><th>计费项目</th><th align="right">空闲时段</th><th align="right">高峰时段</th></tr></thead><tbody><tr><td>缓存命中输入</td><td align="right">0.05 元</td><td align="right">0.10 元</td></tr><tr><td>缓存未命中输入</td><td align="right">1.5 元</td><td align="right">3.0 元</td></tr><tr><td>输出</td><td align="right">4.5 元</td><td align="right">9.0 元</td></tr></tbody></table><p>Token 是模型处理文字时使用的计量单位。账单需要分别统计缓存命中输入、未命中输入和输出，不能只按请求次数估算。</p><h2 id="20-并发限制决定了测试范围"><a href="#20-并发限制决定了测试范围" class="headerlink" title="20 并发限制决定了测试范围"></a>20 并发限制决定了测试范围</h2><p>中间版本对每个账号限制 20 个并发请求；常规 V4 Flash 的官方并发上限为 2500。这个差距使中间版本更适合验证提示词、接口兼容性和小规模任务，不适合直接承接现有生产流量或高并发压测。</p><p>已有项目不会自动切换到本次内测。常规模型名 <code>deepseek-v4-flash</code> 仍对应 <a href="/posts/2026/07/deepseek-v4-flash-0731-codex/">DeepSeek-V4-Flash-0731 正式版 API</a>；只有主动改用临时模型名的请求才会进入 V4.1 Flash 中间版本。</p><h2 id="测试时保留回退路径"><a href="#测试时保留回退路径" class="headerlink" title="测试时保留回退路径"></a>测试时保留回退路径</h2><p>接入时可以把常规模型名和临时模型名分别写入配置，并保留一键回退。先用固定测试集检查返回格式、工具调用和业务输出，再逐步增加并发；需要长期运行的服务继续把 <code>deepseek-v4-flash</code> 作为稳定入口。</p>]]></content>
    
    
    <summary type="html">DeepSeek 开放 V4.1 Flash 中间版本内测，临时模型名为 deepseek-v4.1-flash-expires-on-0910，价格沿用 V4 Flash，单账号限流 20 并发。本文给出调用配置、峰谷单价和使用边界。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="deepseek" scheme="https://51allai.com/tags/deepseek/"/>
    
    <category term="deepseek-v4" scheme="https://51allai.com/tags/deepseek-v4/"/>
    
  </entry>
  
  <entry>
    <title>Qoder 发布 QoderWake 1.0，数字员工可组队并自动执行任务</title>
    <link href="https://51allai.com/posts/2026/09/qoderwake-1-0-digital-team/"/>
    <id>https://51allai.com/posts/2026/09/qoderwake-1-0-digital-team/</id>
    <published>2026-09-08T08:08:43.000Z</published>
    <updated>2026-09-08T08:08:43.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Qoder 于 9 月 3 日发布 QoderWake 1.0。新版支持用自然语言创建 Waker，将多个 Waker 组成 Group，并通过 IM、定时、事件或 API 启动任务；macOS 13+、Windows 10+ 和主流 Linux 均可安装。<br><img src="https://images.51allai.com/blog/qoderwake-1-0-digital-team-cover_20260908_161413.png" alt="QoderWake 1.0 数字员工组队与自动任务" fetchpriority="high" decoding="async"></p></blockquote><h2 id="从单个-Waker-扩展到固定协作团队"><a href="#从单个-Waker-扩展到固定协作团队" class="headerlink" title="从单个 Waker 扩展到固定协作团队"></a>从单个 Waker 扩展到固定协作团队</h2><p>QoderWake 把承担具体职责的数字员工称为 Waker。一个 Waker 对应一个稳定岗位或服务范围，其工作方式由角色配置、运行环境、记忆、Skills、连接器、知识库、项目和权限共同决定。1.0 支持用自然语言描述自定义角色，自动生成配置并保存为模板。</p><p>Group 用于把多位职责互补的 Waker 组成长期团队。团队需要指定 Leader 负责分工和汇总，也可以通过 <code>@</code> 指定成员参与。每位成员可单独配置模型和工作目录，任务页会集中展示执行进度与产物。遇到共享写入或前后依赖时，仍需明确执行顺序和人工确认点。</p><p>这与 <a href="/posts/2026/03/alibaba-qoderwork-windows/">QoderWork Windows 桌面智能体</a> 的使用重心不同：QoderWake 主要围绕持续岗位、多人协作和自动任务组织工作。</p><h2 id="群聊、定时与事件都能启动任务"><a href="#群聊、定时与事件都能启动任务" class="headerlink" title="群聊、定时与事件都能启动任务"></a>群聊、定时与事件都能启动任务</h2><p>Waker 可以接入钉钉、飞书等即时通信工具，在群聊或单聊中接受任务。长任务运行期间，用户仍可补充要求；系统会统一管理聊天配对、响应 Waker、工作目录和任务记录。</p><p>对重复工作，1.0 增加统一的“自主工作”入口。Waker 或 WakerFlow 可由定时、事件和 API 触发，任务看板则用列表或泳道集中展示对话、群聊、工作流和自动任务的状态。日报、巡检、外部事件处理等固定流程可以先手动验证，再切换为自动执行。</p><h2 id="WakerFlow-把多步骤任务固化成流程"><a href="#WakerFlow-把多步骤任务固化成流程" class="headerlink" title="WakerFlow 把多步骤任务固化成流程"></a>WakerFlow 把多步骤任务固化成流程</h2><p>WakerFlow 用来编排需要多个阶段或多个 Waker 的任务。用户可以通过自然语言生成可运行流程，也可以手动启动，或交给定时、事件和 API 触发。运行记录会保留各节点的输入、工具调用、输出和错误，流程还支持版本历史与回滚。</p><p>技能、连接器、知识库、WakerFlow 和公开项目统一放在“能力与资源”中心。资源安装后还要分配给目标 Waker，并通过新任务验证；给每位 Waker 堆入无关资源，会增加检索和权限风险。</p><h2 id="三类桌面系统都能安装"><a href="#三类桌面系统都能安装" class="headerlink" title="三类桌面系统都能安装"></a>三类桌面系统都能安装</h2><p>QoderWake 支持 macOS 13.0 及以上、Windows 10 及以上和主流 Linux 发行版，建议至少准备 4 GB 内存与 500 MB 磁盘空间。macOS 可下载安装包，Windows 使用 <code>.exe</code> 安装程序，macOS 与 Linux 也能通过命令行安装。启动后，控制台默认通过本机浏览器打开。</p><p>第一次使用时，先从角色市场选择预置角色或创建自定义 Waker，只绑定首个任务需要的目录、Skills、知识库和连接器。先执行只读任务并检查实际产物，再测试写操作、越界拒绝和高风险确认。单个岗位稳定后，再接入 Group、IM、WakerFlow 或自动触发。</p>]]></content>
    
    
    <summary type="html">Qoder 发布 QoderWake 1.0，把单个数字员工扩展为可协作的 Waker 团队。本文梳理 Group、WakerFlow、IM 接入、自动触发方式，以及 macOS、Windows 和 Linux 的安装要求。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="ai-agents" scheme="https://51allai.com/tags/ai-agents/"/>
    
    <category term="alibaba" scheme="https://51allai.com/tags/alibaba/"/>
    
    <category term="qoderwake" scheme="https://51allai.com/tags/qoderwake/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 发布 GPT-6 Astra 提示指南，五类行为需要单独约束</title>
    <link href="https://51allai.com/posts/2026/09/gpt-6-astra-prompting-guide/"/>
    <id>https://51allai.com/posts/2026/09/gpt-6-astra-prompting-guide/</id>
    <published>2026-09-08T05:53:15.000Z</published>
    <updated>2026-09-08T05:53:15.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 为 GPT-6 Astra 列出五类需要显式配置的行为：自主执行、指令优先级、写作格式、子智能体委派和测试范围。对于从旧模型迁移的 API 应用，提示词和请求参数都需要逐项检查。<br><img src="https://images.51allai.com/blog/gpt-6-astra-prompting-guide-cover_20260908_140229.png" alt="GPT-6 Astra 提示指南与五类行为配置" fetchpriority="high" decoding="async"></p></blockquote><h2 id="五类行为要写进系统提示词"><a href="#五类行为要写进系统提示词" class="headerlink" title="五类行为要写进系统提示词"></a>五类行为要写进系统提示词</h2><p>GPT-6 Astra 能够处理长任务和多步工具流程，它也会在结果可能因用户补充而发生实质变化时主动询问。应用希望模型自主完成常规步骤时，需要明确哪些缺口可以合理假设，哪些操作必须等待确认，以及什么状态才算完成。</p><table><thead><tr><th>行为</th><th>提示词需要写清的内容</th></tr></thead><tbody><tr><td>自主执行</td><td>哪些可逆操作可以直接做，哪些决定会改变目标或产生不可逆后果</td></tr><tr><td>指令优先级</td><td>用户要求、系统规则、Skill 和 <code>AGENTS.md</code> 冲突时如何处理</td></tr><tr><td>写作格式</td><td>篇幅、语气、段落与列表的使用条件</td></tr><tr><td>子智能体委派</td><td>什么情况应并行委派，同时允许多少个任务</td></tr><tr><td>测试与验证</td><td>小改动需要哪些测试，何时才扩大验证范围</td></tr></tbody></table><p>这些配置属于运行方式，与 <a href="/posts/2026/09/openai-gpt-6-astra/">GPT-6 Astra 的模型规格、API 价格和上下文窗口</a> 是两组问题。已经接入旧模型的应用，应先审计现有系统提示词和代码库内的指令文件。</p><h2 id="自主执行需要同时给出停止条件"><a href="#自主执行需要同时给出停止条件" class="headerlink" title="自主执行需要同时给出停止条件"></a>自主执行需要同时给出停止条件</h2><p>对“帮我修复”“实现这个功能”这类请求，系统提示词可以把它定义为执行指令，要求模型完成已授权的可逆步骤。完成条件也要具体，例如代码已修改、范围内测试已通过，并且结果可以交给用户检查。</p><p>确认点放在实际外部变更之前，例如部署、合并、发布或其他不可逆操作。模型可以先完成读取、分析、修改、本地验证等已授权工作，再把具体产物交给用户决定。</p><p>可以把这部分压缩成三句中文配置：</p><figure class="highlight text"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">从对话上下文推断用户已经明确的目标与范围。</span><br><span class="line">已授权的可逆步骤直接完成，遇到会改变目标或产生不可逆后果的决定时再询问。</span><br><span class="line">以产物完成且范围内验证通过作为停止条件。</span><br></pre></td></tr></table></figure><h2 id="长指令更需要明确优先级"><a href="#长指令更需要明确优先级" class="headerlink" title="长指令更需要明确优先级"></a>长指令更需要明确优先级</h2><p>GPT-6 Astra 对长指令的遵循能力更强，也会更敏感地受 Skill、<code>AGENTS.md</code> 和其他可访问文件影响。一份旧 Skill 中的审批规则，或两份范围不一致的项目说明，都可能让任务提前停止。</p><p>迁移时要搜索应用会加载的所有指令文件，查找重复、冲突和过时规则。系统提示词还可以要求模型在因某个 Skill 而暂停或改变方向时，说明具体文件、规则和影响。这样更容易定位隐藏的指令冲突。</p><h2 id="写作、委派和测试要分开配置"><a href="#写作、委派和测试要分开配置" class="headerlink" title="写作、委派和测试要分开配置"></a>写作、委派和测试要分开配置</h2><p>GPT-6 Astra 默认倾向使用较多列表、表格和 Markdown，也可能在不同会话中重复相似短语。面向普通用户的产品可以直接规定语气、段落长度和列表的使用条件。“简洁”这类形容词很难独立约束格式，应换成可检查的规则，例如每段只解释一个主题，只在需要比较或展示步骤时列表。</p><p>支持子智能体的应用需要单独规定委派条件。可以按任务是否独立、并行是否能节省时间或提高质量，决定是否启动子任务，并限定同时数量。模型不会自动知道应用希望多积极地委派。</p><p>编码任务则要把测试强度与改动风险连起来。低风险小改动可以只运行直接相关的检查；出现新的失败、修改高风险路径或依赖关系较复杂时，再扩大验证范围。这能减少小修改重复跑完整测试套件的情况。</p><h2 id="API-迁移不只是替换模型名"><a href="#API-迁移不只是替换模型名" class="headerlink" title="API 迁移不只是替换模型名"></a>API 迁移不只是替换模型名</h2><p>接入时把 <code>model</code> 设为 <code>gpt-6-astra</code>。工具调用使用 Responses API；Chat Completions 仍可调用 GPT-6 Astra，但不支持该模型的工具调用。</p><p>迁移检查可按下面进行：</p><ul><li>旧配置使用 <code>none</code> 或 <code>minimal</code> 推理档位时，从 <code>low</code> 开始对比；其他情况先保留现有的有效档位。</li><li>删除 <code>temperature</code>、<code>top_p</code> 和 <code>top_logprobs</code>；Chat Completions 还要删除 <code>logprobs</code>。</li><li>需要在对话中改变推理强度时，标准单智能体请求使用 <code>configuration_update</code> 输入项，请求级 <code>reasoning.effort</code> 保持不变，以便继续复用提示前缀缓存。</li><li>从 GPT-5.5 或更旧模型迁移时，把 <code>prompt_cache_retention</code> 换成 <code>prompt_cache_options.ttl: &quot;30m&quot;</code>。</li></ul><p>完成参数迁移后，再用业务自己的任务集对比结果质量、工具调用和任务是否完成。系统提示词的行为约束与 API 参数需要一起迁移。</p>]]></content>
    
    
    <summary type="html">OpenAI 发布 GPT-6 Astra 提示指南，要求开发者明确自主执行边界、指令优先级、写作风格、子智能体委派与测试范围。本文给出可直接改写系统提示词的方法和 API 迁移检查项。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="ai-agents" scheme="https://51allai.com/tags/ai-agents/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="astra" scheme="https://51allai.com/tags/astra/"/>
    
  </entry>
  
  <entry>
    <title>抖音内测 AI 工坊，创作者可用文字生成兴趣卡</title>
    <link href="https://51allai.com/posts/2026/09/douyin-ai-workshop-interest-cards/"/>
    <id>https://51allai.com/posts/2026/09/douyin-ai-workshop-interest-cards/</id>
    <published>2026-09-07T06:38:48.000Z</published>
    <updated>2026-09-07T06:38:48.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>抖音在创作者中心 PC 端内测 AI 工坊，受邀创作者输入邀请码后可制作“兴趣卡”。这类内容可以在抖音内以卡片或落地页呈现，已展示互动问答、单词学习、颜色鉴赏和宠物问答等样例。<br><img src="https://images.51allai.com/blog/douyin-ai-workshop-interest-cards-cover_20260907_144427.png" alt="抖音 AI 工坊兴趣卡创作界面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="AI-工坊是兴趣卡的创作入口"><a href="#AI-工坊是兴趣卡的创作入口" class="headerlink" title="AI 工坊是兴趣卡的创作入口"></a>AI 工坊是兴趣卡的创作入口</h2><p>AI 工坊已经出现在抖音创作者中心 PC 端，与“首页”“AI 分身”并列。当前页面要求先输入邀请码，并提供问卷报名入口，说明它仍是面向部分创作者的测试功能，不是所有账号都能直接使用的常规工具。</p><p>兴趣卡的制作从一句文字描述开始。创作者先说明想做的内容，再由 AI 工坊调用工具、Skill 和模型完成制作。这里的 Skill 指可复用的任务能力，例如协助设计页面或组织交互逻辑。<br><img src="https://images.51allai.com/blog/%E6%88%AA%E5%B1%8F2026-09-07_14.43.04_20260907_144513.png" alt="抖音 AI 工坊兴趣卡创作界面" loading="lazy" decoding="async"></p><h2 id="兴趣卡可以进入推荐流，也能打开落地页"><a href="#兴趣卡可以进入推荐流，也能打开落地页" class="headerlink" title="兴趣卡可以进入推荐流，也能打开落地页"></a>兴趣卡可以进入推荐流，也能打开落地页</h2><p>兴趣卡不是普通视频模板。创作流程图把成品分成两种形态：一种是出现在 Feed 或侧边栏中的卡片，另一种是基于抖音原生框架打开的落地页。用户看到内容后，可以继续点击或选择，而不只是播放和暂停。</p><p>制作过程中可以调用抖音开放的接口、组件和数据。创作者不必先搭建独立网站，再把链接引到站外；兴趣卡的创作、呈现和交互都围绕抖音内的内容场景展开。</p><p><img src="https://images.51allai.com/blog/%E6%88%AA%E5%B1%8F2026-09-07_14.42.23_20260907_144531.png" alt="抖音 AI 工坊兴趣卡创作界面" loading="lazy" decoding="async"></p><h2 id="已展示五类互动样例"><a href="#已展示五类互动样例" class="headerlink" title="已展示五类互动样例"></a>已展示五类互动样例</h2><p>AI 工坊案例页已经展示“答案之书”“单词学习”“中国色鉴赏”“恋爱回复挑战”和“猜猜小狗品种”。这些样例覆盖随机问答、语言学习、文化知识、对话选择和宠物问答。</p><p>它们的共同点是每次打开都需要用户操作。例如，单词学习提供选项，宠物识别需要根据图片作答，颜色鉴赏通过卡片继续浏览。兴趣卡因此更接近一个轻量互动页面，而不是一条预先剪好的短视频。</p><h2 id="当前需要邀请码才能创作"><a href="#当前需要邀请码才能创作" class="headerlink" title="当前需要邀请码才能创作"></a>当前需要邀请码才能创作</h2><p>获得体验资格后，创作者可以在 PC 端抖音创作者中心进入 AI 工坊。没有邀请码的账号可以通过页面问卷报名。页面把“AI 分身”和“AI 工坊”分成两个入口：前者围绕虚拟身份互动，后者用于制作兴趣卡，两者不是同一个创作功能。</p><p>对普通用户而言，兴趣卡的变化在于内容可以直接接收操作并返回结果；对创作者而言，AI 工坊把原本需要页面设计和交互开发的工作，压缩为文字描述、选择能力与调整成品的流程。</p>]]></content>
    
    
    <summary type="html">抖音正在创作者中心 PC 端内测 AI 工坊，受邀创作者可用文字描述制作兴趣卡。本文梳理邀请码入口、卡片与落地页两种形态，以及目前展示的互动内容样例。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="ai-agents" scheme="https://51allai.com/tags/ai-agents/"/>
    
    <category term="bytedance" scheme="https://51allai.com/tags/bytedance/"/>
    
    <category term="douyin" scheme="https://51allai.com/tags/douyin/"/>
    
  </entry>
  
  <entry>
    <title>开源项目 WeChat Intelligence Hub，把本地微信聊天整理成日报与待办</title>
    <link href="https://51allai.com/posts/2026/09/wechat-intelligence-hub/"/>
    <id>https://51allai.com/posts/2026/09/wechat-intelligence-hub/</id>
    <published>2026-09-07T01:32:18.000Z</published>
    <updated>2026-09-07T01:32:18.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>开源项目 WeChat Intelligence Hub 由 Rion Wu 独立开发，把本人电脑上的微信聊天接入两个 Codex Skill，可检索联系人和群聊，并生成日报、待回复、承诺、商机与复联线索。首发版本为 v0.9.2-preview.2，完整历史读取需要本人授权的本地数据库和访问材料。<br><img src="https://images.51allai.com/blog/wechat-intelligence-hub-cover-v2_20260907_094302.png" alt="WeChat Intelligence Hub 微信个人情报库" fetchpriority="high" decoding="async"></p></blockquote><h2 id="两个-Skill-分别负责读取和整理"><a href="#两个-Skill-分别负责读取和整理" class="headerlink" title="两个 Skill 分别负责读取和整理"></a>两个 Skill 分别负责读取和整理</h2><p>WeChat Intelligence Hub 是 Rion Wu 独立开发的社区项目，不属于腾讯或微信官方。项目在 2026 年 9 月 4 日发布 <code>v0.9.2-preview.2</code>，把数据读取与情报整理拆成两个 Codex Skill。</p><p>项目地址：<a href="https://github.com/Rion-Wu-tech/wechat-intelligence-hub">github.com&#x2F;Rion-Wu-tech&#x2F;wechat-intelligence-hub</a></p><p><code>wechat-cli</code> 是只读数据入口，负责会话、联系人、聊天时间线、关键词搜索、上下文、未读消息、群成员和本地媒体索引等查询。<code>wechat-intelligence-hub</code> 在这些记录之上生成联系人进展、群聊主题、待回复事项、未完成承诺、商机候选和复联提醒。</p><p>这里的“只读”指不会发送、删除、转发或修改微信消息，也不会自动操作微信界面。回复建议只生成草稿，金额、日期和承诺仍由用户核对。</p><h2 id="日报可同时输出-Markdown-和交互式-HTML"><a href="#日报可同时输出-Markdown-和交互式-HTML" class="headerlink" title="日报可同时输出 Markdown 和交互式 HTML"></a>日报可同时输出 Markdown 和交互式 HTML</h2><p>用户可以指定过去 24 小时、一周、一个月或明确的起止日期。完整多会话报告会保留 Markdown 和 HTML 两种版本：Markdown 适合归档和继续编辑，HTML 提供搜索、分区导航、群聊筛选、明暗主题、打印与当前分区下载。</p><p>除了日报，这套工具也能围绕某个人、群聊、微信标签、项目或关键词定向检索。系统先定位消息和相邻上下文，再按会话与时间整理；商机线索先进入待审核候选，用户确认后才会进入持续跟进的机会列表。</p><p>项目还允许用户建立本地 Profile，把当前计划、重点联系人标签和关注主题用于日报排序。Profile、聊天数据库和生成报告被配置为留在本机工作目录，不应提交到公开仓库。</p><h2 id="可以先用虚构数据验证完整流程"><a href="#可以先用虚构数据验证完整流程" class="headerlink" title="可以先用虚构数据验证完整流程"></a>可以先用虚构数据验证完整流程</h2><p>手动安装需要先克隆仓库，再运行安装脚本：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">git <span class="built_in">clone</span> https://github.com/Rion-Wu-tech/wechat-intelligence-hub.git</span><br><span class="line"><span class="built_in">cd</span> wechat-intelligence-hub</span><br><span class="line">./scripts/install.sh --with-sqlcipher</span><br></pre></td></tr></table></figure><p>安装脚本会部署 <code>wechat-cli</code>、<code>wechat-intelligence-hub</code> 及其本地引擎。没有真实数据库接入条件时，可以先运行全虚构 Demo：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br></pre></td><td class="code"><pre><span class="line">bash projects/wechat-intelligence-hub/scripts/run_demo.sh</span><br></pre></td></tr></table></figure><p>本次在当前仓库提交上复现了这条 Demo，完成 8 条虚构消息的文件扫描和 3 条虚构 vault 消息的处理。Hub 的 119 项测试执行通过，其中 1 项 SQLCipher 加密集成测试因本机未安装驱动而跳过；Reader 的 81 项测试执行通过，其中 5 项 SQLCipher 或 Zstandard 相关测试跳过。能力对照脚本列出的 29 个只读工具均有对应实现。</p><h2 id="安装完成不等于已经读到完整历史"><a href="#安装完成不等于已经读到完整历史" class="headerlink" title="安装完成不等于已经读到完整历史"></a>安装完成不等于已经读到完整历史</h2><p>完整聊天历史和持续数据库读取只覆盖已经同步到本人电脑、且用户有权访问的数据。它需要本地数据库和相应访问材料；Reader 核心不会从微信进程提取密钥，也不执行重签名、注入或 Hook。</p><p>macOS 用户在没有完整数据库条件时，可以读取系统仍保留的微信通知预览。这个模式只包含部分入站通知，不包括静音聊天、完整历史、附件或自己发出的消息，不能当作完整记录。</p><p>项目另有实验性接入助手。它与日常只读 Reader 分开，只有在用户审核并确认后才会调用外部本地工具；相关操作可能需要 macOS 管理员授权，并可能重启微信或重签名影子副本。普通安装和日报不会自动触发这条流程。</p><p>代码采用 AGPL-3.0-only 许可证。遵守许可证时可以运行、修改和用于商业活动；闭源集成、专有发行、OEM 或白标需要单独商业授权。</p>]]></content>
    
    
    <summary type="html">开源项目 WeChat Intelligence Hub 把本人电脑上的微信记录接入 Codex，整理成日报、待回复、承诺、商机和复联线索。本文说明两个 Skill 的分工、安装方法、实测结果及完整历史读取条件。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="ai-agents" scheme="https://51allai.com/tags/ai-agents/"/>
    
    <category term="codex" scheme="https://51allai.com/tags/codex/"/>
    
    <category term="open-source" scheme="https://51allai.com/tags/open-source/"/>
    
    <category term="wechat-intelligence-hub" scheme="https://51allai.com/tags/wechat-intelligence-hub/"/>
    
  </entry>
  
  <entry>
    <title>智谱开放 ZCode 周末额度，免费领取 3 亿 Token</title>
    <link href="https://51allai.com/posts/2026/09/zhipu-zcode-300m-token-weekend/"/>
    <id>https://51allai.com/posts/2026/09/zhipu-zcode-300m-token-weekend/</id>
    <published>2026-09-06T04:45:29.000Z</published>
    <updated>2026-09-06T04:45:29.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>智谱 ZCode 的 WEEKEND BUILD IV 向新老用户开放 3 亿 GLM-5.3-Flash Token。额度于 9 月 5 日 09:00 生效，9 月 6 日 23:00 到期，先到先得；用户需在最新版 ZCode 内领取和使用，这不是 BigModel 通用 API 额度。<br><img src="https://images.51allai.com/blog/zhipu-zcode-300m-token-cover_20260906_125049.png" alt="智谱 ZCode 免费领取 3 亿 GLM-5.3-Flash Token 周末额度" fetchpriority="high" decoding="async"></p></blockquote><h2 id="在-ZCode-左下角领取活动额度"><a href="#在-ZCode-左下角领取活动额度" class="headerlink" title="在 ZCode 左下角领取活动额度"></a>在 ZCode 左下角领取活动额度</h2><p>领取需要使用 ZCode 桌面端。打开最新版 ZCode，登录 BigModel 或 Z.ai 账号，再点击左下角的 Weekend Build 活动卡片完成领取。新用户、老用户和已购买 Coding Plan 的用户都能参加，不需要重新注册账号。</p><p>领取后进入“设置 → 模型设置”，选择 <code>GLM-5.3-Flash</code>，并确认周末活动卡片已经生效。ZCode 支持 macOS、Windows 和 Linux，安装包可从<a href="https://zcode.z.ai/cn">官方 ZCode 页面</a>下载。</p><h2 id="本轮额度在-9-月-6-日-23-00-到期"><a href="#本轮额度在-9-月-6-日-23-00-到期" class="headerlink" title="本轮额度在 9 月 6 日 23:00 到期"></a>本轮额度在 9 月 6 日 23:00 到期</h2><p>这 3 亿 Token 的有效窗口是北京时间 2026 年 9 月 5 日 09:00 至 9 月 6 日 23:00。活动采用先到先得方式，活动期间曾追加名额；能否领取应以客户端卡片的实时状态为准。</p><p>Token 是模型读取输入和生成输出时使用的计量单位。3 亿 Token 指活动期内可累计消耗的额度，不是模型单次可以装入 3 亿 Token 内容。GLM-5.3-Flash 的单次上下文窗口为 100 万 Token，模型参数、图像输入和 API 价格可查看站内的 <a href="/posts/2026/08/zhipu-glm-53-flash/">GLM-5.3-Flash 模型说明</a>。</p><h2 id="额度只能在-ZCode-中使用"><a href="#额度只能在-ZCode-中使用" class="headerlink" title="额度只能在 ZCode 中使用"></a>额度只能在 ZCode 中使用</h2><p>活动额度绑定 ZCode，不能当作 BigModel 开放平台的通用 API 余额，也不能复制到其他编程工具中消费。领取后需要在 ZCode 中选中 GLM-5.3-Flash，再把代码目录、任务说明和验收条件交给 Agent。</p><p>适合在截止前处理的任务包括跨文件修改、测试补全、代码解释和截图分析。对会改动文件或执行命令的任务，应先保留 Git 状态，并在完成后运行测试或构建；模型给出的完成说明不能代替实际结果。</p><p>ZCode 也可通过 Coding Plan 连接 GLM 模型，但 Coding Plan 套餐、开放平台 API 余额和这次周末体验额度是不同通道。此前的 <a href="/posts/2026/08/zhipu-glm-53-coding-plan/">GLM-5.3 与 ZCode 使用入口</a> 可用于了解长期使用方式。</p>]]></content>
    
    
    <summary type="html">智谱 ZCode 向新老用户开放 3 亿 GLM-5.3-Flash Token 周末额度，9 月 6 日 23:00 截止。本文说明领取入口、启用步骤和仅限 ZCode 使用的额度边界。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="coding-agent" scheme="https://51allai.com/tags/coding-agent/"/>
    
    <category term="zhipu" scheme="https://51allai.com/tags/zhipu/"/>
    
    <category term="glm-5.3" scheme="https://51allai.com/tags/glm-5-3/"/>
    
  </entry>
  
  <entry>
    <title>微软开放 MAI-Image-2.6 公测，Flash 图片输出单价减半</title>
    <link href="https://51allai.com/posts/2026/09/mai-image-26-foundry-flash/"/>
    <id>https://51allai.com/posts/2026/09/mai-image-26-foundry-flash/</id>
    <published>2026-09-05T09:14:46.000Z</published>
    <updated>2026-09-05T09:14:46.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>微软于 9 月 4 日在 Microsoft Foundry 开放 MAI-Image-2.6 和 Flash 版公开预览。两款模型支持文字生图、图片编辑、多图参考和联网检索；Flash 的图片输出价格为每百万 Token 19 美元，是标准版的一半，也可通过 MAI Playground 体验。<br><img src="https://images.51allai.com/blog/mai-image-26-foundry-flash-cover_20260905_172042.png" alt="微软 MAI-Image-2.6 与 Flash 图像生成和编辑主题封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="可以从文字生成图片，也能修改已有图片"><a href="#可以从文字生成图片，也能修改已有图片" class="headerlink" title="可以从文字生成图片，也能修改已有图片"></a>可以从文字生成图片，也能修改已有图片</h2><p>MAI-Image-2.6 是微软自研的图像生成模型。用户可以用文字描述画面，也可以提交已有图片，要求移除或替换物体、修改属性、局部重绘和更新图中文字。Flash 版提供相同的生成与编辑功能范围。</p><p>这次开放的两款模型都支持多图参考：一次创作可以结合不同图片中的人物、产品、风格和场景。对于已经有产品照片、还需要制作不同场景素材的用户，这比只用文字描述多了一种输入方式。</p><p>两款模型还提供联网检索和自动宽高比。开启联网检索后，模型可以使用 Bing Search 获取当前信息，作为生成图片时的补充上下文；自动宽高比则让模型根据提示词和参考图选择画面比例。开发者可分别通过 <code>web_grounding</code> 和 <code>auto_aspect_ratio</code> 控制这两项功能。</p><h2 id="Flash-的图片输出-Token-单价减半"><a href="#Flash-的图片输出-Token-单价减半" class="headerlink" title="Flash 的图片输出 Token 单价减半"></a>Flash 的图片输出 Token 单价减半</h2><p>Foundry 的公开起始价格按文字输入、图片输入和图片输出分开计算。Token 是服务用来计量输入、输出内容的单位，图片也会转换成对应的计费量。</p><table><thead><tr><th>计费项目</th><th align="right">MAI-Image-2.6</th><th align="right">MAI-Image-2.6-Flash</th></tr></thead><tbody><tr><td>文字输入</td><td align="right">5 美元／百万 Token</td><td align="right">1.75 美元／百万 Token</td></tr><tr><td>图片输入</td><td align="right">8 美元／百万 Token</td><td align="right">2.50 美元／百万 Token</td></tr><tr><td>图片输出</td><td align="right">38 美元／百万 Token</td><td align="right">19 美元／百万 Token</td></tr></tbody></table><p>按这组单价计算，Flash 的文字输入便宜 65%，图片输入便宜 68.75%，图片输出便宜 50%。例如，两款模型各产生 100 万个图片输出 Token，单独这一项费用分别为 38 美元和 19 美元。</p><p><strong>单价减半针对图片输出这一项。</strong> 一次调用的总费用还取决于实际输入和输出用量，不能把每百万 Token 的价格直接当成每张图片的固定价格。</p><p>如果正在比较不同生图服务的计费方式，也可以参考<a href="/posts/2026/07/google-nano-banana-2-lite/">站内对 Nano Banana 2 Lite 的价格与输出规格梳理</a>，对照时应区分每张图片价格和每百万 Token 价格。</p><h2 id="网页体验与-API-接入分开选择"><a href="#网页体验与-API-接入分开选择" class="headerlink" title="网页体验与 API 接入分开选择"></a>网页体验与 API 接入分开选择</h2><p>想直接试用，可进入 <a href="https://playground.microsoft.ai/">MAI Playground</a> 选择模型。需要把生图和图片编辑接入自己的应用，则通过 <a href="https://ai.azure.com/">Microsoft Foundry</a> 部署 MAI-Image-2.6 或 MAI-Image-2.6-Flash；两款在 Foundry 中均为公开预览。</p><p>接入后，文字生图使用 <code>/mai/v1/images/generations</code>，图片编辑使用 <code>/mai/v1/images/edits</code>。请求中的 <code>model</code> 填写实际部署名称；服务返回 PNG 图片数据。</p><p>批量任务还需要考虑调用配额。Foundry 当前的免费层对这两款模型均为每分钟 0 次请求，第 1 层为每分钟 2 次，第 6 层为每分钟 12 次；可用层级取决于订阅和部署配置。评估批量制作素材的成本时，应同时查看单价、每次用量和每分钟可调用次数。</p>]]></content>
    
    
    <summary type="html">微软将 MAI-Image-2.6 和 Flash 版开放至 Foundry 公开预览，支持文字生图、多图参考编辑、联网检索与自动宽高比。本文梳理网页体验和 API 接入入口、两款模型的计费差异，以及图片输出单价减半的具体含义。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="image-generation" scheme="https://51allai.com/tags/image-generation/"/>
    
    <category term="microsoft" scheme="https://51allai.com/tags/microsoft/"/>
    
    <category term="mai-image" scheme="https://51allai.com/tags/mai-image/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 向 Plus、Pro 和 Business 用户发放完整 Codex 可存重置</title>
    <link href="https://51allai.com/posts/2026/09/codex-full-reset-plus-pro-business/"/>
    <id>https://51allai.com/posts/2026/09/codex-full-reset-plus-pro-business/</id>
    <published>2026-09-05T01:24:40.000Z</published>
    <updated>2026-09-05T01:24:40.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 宣布向 Plus、Pro 和 Business 用户发放一次完整 Codex 可存重置。此次覆盖范围不再限于等待 Astra 权限的账户；在北京时间 2026 年 9 月 5 日 11:00 前新建或升级至适用套餐的用户，也在本轮安排之内。<br><img src="https://images.51allai.com/blog/codex-full-reset-plus-pro-business-cover_20260905_093408.png" alt="Codex 完整可存重置覆盖 Plus、Pro 和 Business 用户" fetchpriority="high" decoding="async"></p></blockquote><h2 id="本轮覆盖三个套餐，不再以等待-Astra-为条件"><a href="#本轮覆盖三个套餐，不再以等待-Astra-为条件" class="headerlink" title="本轮覆盖三个套餐，不再以等待 Astra 为条件"></a>本轮覆盖三个套餐，不再以等待 Astra 为条件</h2><p>这次安排接续<a href="/posts/2026/09/codex-daily-banked-reset-astra/">此前等待 Astra 权限期间的每日重置</a>，但发放对象扩大到 Plus、Pro 和 Business 用户。已经获得 Astra 权限的用户也包含在内。</p><p>本轮按太平洋时间 9 月 4 日计算，计划当天结束前发放。新建或升级账户的截止点是当天 20:00，换算为北京时间是 <strong>9 月 5 日 11:00</strong>，不是北京时间当天晚上。</p><p>Business 包括标准与高级席位。现有账户需处于正常状态，具体资格还受地区和可用性影响；重置显示到账可能需要数小时。</p><h2 id="完整重置会恢复两个用量窗口"><a href="#完整重置会恢复两个用量窗口" class="headerlink" title="完整重置会恢复两个用量窗口"></a>完整重置会恢复两个用量窗口</h2><p>可存重置（banked reset）是一份保存在账户中的单次用量恢复机会，由用户决定何时启用。完整重置会刷新 Codex 的 5 小时和每周用量窗口，并改变每周重置日期。</p><p>它不会增加 API 余额，也不永久提高套餐限额。正在安排连续任务的用户，可以先检查剩余用量和有效期，再决定使用时间。</p><h2 id="在用量设置中查看并使用"><a href="#在用量设置中查看并使用" class="headerlink" title="在用量设置中查看并使用"></a>在用量设置中查看并使用</h2><p>打开 <strong>Settings → Usage（设置 → 用量）</strong>，找到可用重置提示，例如“1 reset available”或“Full reset”，查看到期时间后确认使用。</p><p>使用后重新查看用量和下次重置时间。若页面没有及时更新，可刷新并确认当前账户或工作区。未使用的重置过期后不能补发，因此保留备用时也要留意账户显示的期限。</p>]]></content>
    
    
    <summary type="html">OpenAI 向 Plus、Pro 和 Business 用户发放一次完整 Codex 可存重置，覆盖范围不再限于等待 Astra 权限的用户。本文说明新建或升级账户的北京时间截止点、Business 席位范围，以及重置的使用入口和用量变化。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="codex" scheme="https://51allai.com/tags/codex/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
  </entry>
  
  <entry>
    <title>Google 将 Lyria 3.5 接入 Gemini，API 每首 0.08 美元</title>
    <link href="https://51allai.com/posts/2026/09/google-lyria-35-gemini-api/"/>
    <id>https://51allai.com/posts/2026/09/google-lyria-35-gemini-api/</id>
    <published>2026-09-04T16:24:25.000Z</published>
    <updated>2026-09-04T16:24:25.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Google 将 Lyria 3.5 接入 Gemini，用户可选择曲风、人声或纯音乐，通过文字、图片生成短片段或最长 3 分钟音轨。开发者可调用模型 ID <code>lyria-3.5</code>，每首收费 0.08 美元。<br><img src="https://images.51allai.com/blog/google-lyria-35-gemini-api-cover_20260905_002802.png" alt="Google Lyria 3.5 接入 Gemini 与 API 音乐生成" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Lyria-3-5-接入-Gemini-音乐生成"><a href="#Lyria-3-5-接入-Gemini-音乐生成" class="headerlink" title="Lyria 3.5 接入 Gemini 音乐生成"></a>Lyria 3.5 接入 Gemini 音乐生成</h2><p>Google 在 9 月 4 日宣布将 Lyria 3.5 接入 Gemini。用户可以先选择音乐流派，再决定生成带人声的歌曲或纯音乐；模板库提供现成的创作起点，也可以直接输入自己的描述。</p><p>这次更新不是 Lyria 系列第一次进入 Gemini。2 月发布的 <a href="https://www.51allai.com/posts/2026/02/deepmind-lyria-3-gemini-vertex/">Lyria 3 已把文字、图片和视频生成音乐带入 Gemini</a>，Lyria 3.5 延续了这套入口，并把重点放在更丰富的编曲、人声表现和音质上。</p><p>Gemini 的音乐工具支持文字和图片提示。免费用户选择“Fast”可生成最长 30 秒音轨；选择“Thinking”或“Pro”可生成最长 3 分钟音轨，Google AI Plus、Pro 和 Ultra 订阅方案提供更高额度。生成结果可以下载为 MP3 或带封面的 MP4。</p><p>这项功能面向 Gemini 已开放国家和地区的年满 18 岁用户。用户可在提示词中写明流派、年代、节奏、乐器、人声类型和歌词主题，也可以提交自己的歌词，并用 <code>[Verse]</code>、<code>[Chorus]</code>、<code>[Bridge]</code> 标记主歌、副歌和桥段。</p><h2 id="Gemini-API-新增-lyria-3-5-模型"><a href="#Gemini-API-新增-lyria-3-5-模型" class="headerlink" title="Gemini API 新增 lyria-3.5 模型"></a>Gemini API 新增 <code>lyria-3.5</code> 模型</h2><p>开发者可以通过 Gemini API 的 Interactions API 调用 <code>lyria-3.5</code>。模型接受文字或图片输入，输出 44.1 kHz 立体声 MP3，并可同时生成带时间信息的歌词和歌曲结构。</p><p><code>lyria-3.5</code> 面向包含主歌、副歌和桥段的完整歌曲。生成时长可以写进提示词，也可以用时间戳安排各段结构。若只需要循环、预览或测试提示词，可先用 <code>lyria-3-clip-preview</code> 生成固定 30 秒片段。</p><p>API 免费层不提供 Lyria 3.5。付费层按请求计费，每首完整歌曲 0.08 美元；生成 100 首的模型调用费用是 8 美元。</p><h2 id="当前版本一次生成一首，不能连续改同一音轨"><a href="#当前版本一次生成一首，不能连续改同一音轨" class="headerlink" title="当前版本一次生成一首，不能连续改同一音轨"></a>当前版本一次生成一首，不能连续改同一音轨</h2><p>Lyria 3.5 的 API 音乐生成采用单轮流程。一次请求会生成一首歌曲，但不能在后续对话里继续要求“只改副歌”或“保留人声并替换鼓组”。需要修改时，应调整提示词后重新生成。</p><p>安全过滤会拦截模仿特定艺人声音或生成受版权保护歌词的请求。同一提示词重复调用也可能得到不同结果。所有生成音频都包含人耳难以察觉的 SynthID 水印，用于识别内容是否由 Google AI 生成或编辑。</p>]]></content>
    
    
    <summary type="html">Google 将 Lyria 3.5 音乐生成模型接入 Gemini，并向开发者开放 Gemini API。本文梳理长短音轨入口、图文生成方式、每首 0.08 美元的 API 价格，以及单轮生成与 SynthID 水印限制。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="google" scheme="https://51allai.com/tags/google/"/>
    
    <category term="lyria" scheme="https://51allai.com/tags/lyria/"/>
    
    <category term="audio-generation" scheme="https://51allai.com/tags/audio-generation/"/>
    
  </entry>
  
</feed>
