<?xml version="1.0" encoding="utf-8"?>
<feed xmlns="http://www.w3.org/2005/Atom">
  <title>51AllAI</title>
  
  <subtitle>探索 AI 的无限可能</subtitle>
  <link href="https://51allai.com/atom.xml" rel="self"/>
  
  <link href="https://51allai.com/"/>
  <updated>2026-09-02T16:23:19.000Z</updated>
  <id>https://51allai.com/</id>
  
  <author>
    <name>51AllAI</name>
    
  </author>
  
  <generator uri="https://hexo.io/">Hexo</generator>
  
  <entry>
    <title>努比亚 NaviX Ultra 9 月开售，搭载豆包手机助手</title>
    <link href="https://51allai.com/posts/2026/09/nubia-navix-ultra-doubao-phone/"/>
    <id>https://51allai.com/posts/2026/09/nubia-navix-ultra-doubao-phone/</id>
    <published>2026-09-02T16:23:19.000Z</published>
    <updated>2026-09-02T16:23:19.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>努比亚 NaviX Ultra 已取得入网许可，计划于 2026 年 9 月上市开售。新机将搭载豆包手机助手，定位量产旗舰；此前的 nubia M153 则是供行业用户和尝鲜者体验技术预览版的工程样机。<br><img src="https://images.51allai.com/blog/nubia-navix-ultra-doubao-phone-cover_20260903_002826.png" alt="努比亚 NaviX Ultra 豆包手机助手量产旗舰" fetchpriority="high" decoding="async"></p></blockquote><h2 id="NaviX-Ultra-9-月开售"><a href="#NaviX-Ultra-9-月开售" class="headerlink" title="NaviX Ultra 9 月开售"></a>NaviX Ultra 9 月开售</h2><p>这次上市的产品正式名称为努比亚 NaviX Ultra。努比亚已宣布该机取得电信设备进网许可，并将于 9 月上市。它搭载豆包手机助手，硬件产品归属努比亚，并不是豆包推出的自有品牌手机。</p><p>NaviX Ultra 已从技术展示进入量产产品阶段。入网许可对应手机作为通信终端进入市场的准入要求；其搭载的“努比亚豆包手机大模型”也已列入手机端侧生成式人工智能服务备案信息。</p><h2 id="它不是-M153-工程样机的再次发售"><a href="#它不是-M153-工程样机的再次发售" class="headerlink" title="它不是 M153 工程样机的再次发售"></a>它不是 M153 工程样机的再次发售</h2><p>nubia M153 于 2025 年 12 月作为豆包手机助手技术预览版的体验设备少量发售，面向行业用户和愿意尝鲜的人群。豆包手机助手官网对它的定位是工程样机，并提示软件完整度可能与成熟旗舰手机存在差距。</p><p>NaviX Ultra 的定位改为量产旗舰。对普通消费者来说，两者最直接的区别不是名称变化，而是产品阶段不同：M153 用来收集真实使用反馈，NaviX Ultra 则按正式上市产品推进销售。</p><h2 id="豆包手机助手进入系统级合作"><a href="#豆包手机助手进入系统级合作" class="headerlink" title="豆包手机助手进入系统级合作"></a>豆包手机助手进入系统级合作</h2><p>豆包手机助手不是单独安装的一款聊天应用。它由豆包与手机厂商在操作系统层面合作，基于豆包大模型能力和手机厂商提供的系统授权，让用户通过自然语言发起手机任务。</p><p>“智能体”指的是能够理解目标、拆分步骤并调用工具执行任务的 AI。放到手机上，它的重点不只是回答问题，还包括操作手机任务。豆包手机助手的技术预览版已经展示过识别屏幕内容、整理信息、调用功能和串联多个操作步骤等形态。</p><h2 id="四种配色和实体-AI-键已经亮相"><a href="#四种配色和实体-AI-键已经亮相" class="headerlink" title="四种配色和实体 AI 键已经亮相"></a>四种配色和实体 AI 键已经亮相</h2><p>努比亚公开展示的 NaviX Ultra 包含蓝境、幻梦、黑色和白色四种配色。机身采用横向后置摄像模组，侧面设有橙色实体 AI 键，用于快速唤起智能体。</p><p>这颗按键把 AI 助手从应用入口移到硬件交互入口。用户不必先找到并打开豆包 App，而是可以直接从机身按键发起对话或任务。</p>]]></content>
    
    
    <summary type="html">努比亚 NaviX Ultra 已取得入网许可并计划于 2026 年 9 月开售，新机将搭载豆包手机助手，定位从 M153 工程样机走向量产旗舰。本文梳理已确认的上市进度、系统级 AI 助手形态、四种配色与实体 AI 键，帮助消费者分清本次量产机和上一代体验设备。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="ai-agents" scheme="https://51allai.com/tags/ai-agents/"/>
    
    <category term="bytedance" scheme="https://51allai.com/tags/bytedance/"/>
    
    <category term="doubao" scheme="https://51allai.com/tags/doubao/"/>
    
  </entry>
  
  <entry>
    <title>Google 上线 Gemini 3.8 Flash，Antigravity Agent 默认切换新模型</title>
    <link href="https://51allai.com/posts/2026/09/google-gemini-38-flash/"/>
    <id>https://51allai.com/posts/2026/09/google-gemini-38-flash/</id>
    <published>2026-09-02T15:49:59.000Z</published>
    <updated>2026-09-02T15:49:59.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Google 于 9 月 2 日上线 Gemini 3.8 Flash 稳定版，模型 ID 为 <code>gemini-3.8-flash</code>。它已可用于生产环境，支持百万 Token 输入与 64K Token 输出；Gemini Managed Agents 中的 Antigravity Agent 也已默认切换到该模型。<br><img src="https://images.51allai.com/blog/google-gemini-38-flash-cover_20260902_235750.png" alt="Google Gemini 3.8 Flash 与 Antigravity Agent 默认模型升级" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Gemini-3-8-Flash-已进入稳定版"><a href="#Gemini-3-8-Flash-已进入稳定版" class="headerlink" title="Gemini 3.8 Flash 已进入稳定版"></a>Gemini 3.8 Flash 已进入稳定版</h2><p>Gemini 3.8 Flash 以 GA（正式可用）状态上线，开发者可以在生产应用中指定稳定模型 ID <code>gemini-3.8-flash</code>。在 Google AI Studio 中可直接试用，也可通过 Gemini API 接入应用。</p><p>模型单次请求最多可接收 1,048,576 个 Token，最多输出 65,536 个 Token。它能读取文字、图片、视频、音频和 PDF，返回形式为文字。Token 是模型处理内容和计费的基本单位，百万 Token 窗口可用于放入较长的代码库、文档集或多媒体材料。</p><h2 id="Antigravity-Agent-默认切换至-3-8-Flash"><a href="#Antigravity-Agent-默认切换至-3-8-Flash" class="headerlink" title="Antigravity Agent 默认切换至 3.8 Flash"></a>Antigravity Agent 默认切换至 3.8 Flash</h2><p>Gemini Managed Agents 里的 Antigravity Agent 现在默认使用 Gemini 3.8 Flash。这是一个由 Google 托管的通用智能体，能在隔离的远程环境中浏览网页、运行代码、调用工具并生成文件。开发者也可以通过 <code>agent_config</code> 选择它底层使用的 Gemini 模型。</p><p>3.8 Flash 支持函数调用、代码执行、文件搜索、Google 搜索与地图接地、URL 上下文、结构化输出和上下文缓存。“接地”指模型在回答时调用外部检索，再把检索结果带回当前任务。计算机使用功能仍标记为 Preview；模型本身 GA 不代表每项配套工具都已进入稳定版。</p><h2 id="思考档位与输出范围没有混在一起"><a href="#思考档位与输出范围没有混在一起" class="headerlink" title="思考档位与输出范围没有混在一起"></a>思考档位与输出范围没有混在一起</h2><p>Gemini 3.8 Flash 默认使用 <code>medium</code> 思考档位，还可选 <code>low</code> 或 <code>high</code>。思考档位用来调整模型在给出答案前的推理强度，会同时影响延迟和 Token 消耗。<code>minimal</code> 不在支持范围内，传入该值会返回错误。</p><p>模型可以理解图片和音视频，但不直接生成图片或音频，也不支持 Live API。需要生图、语音合成或实时语音对话时，仍需使用对应的专用模型和接口。</p><h2 id="API-限时价延续到-2026-年底"><a href="#API-限时价延续到-2026-年底" class="headerlink" title="API 限时价延续到 2026 年底"></a>API 限时价延续到 2026 年底</h2><p>Gemini Developer API 的标准付费档在 2026 年 12 月 31 日前按每百万输入 Token 0.75 美元、每百万输出 Token 3.75 美元计费，输出价格包含思考 Token。2027 年 1 月 1 日起，两项价格分别调整为 1.50 美元和 7.50 美元。</p><p>免费层的输入和输出 Token 不收费，但实际可用量受免费层配额限制。Batch 和 Flex 的限时付费价均为每百万输入 Token 0.375 美元、输出 Token 1.875 美元，适合对即时返回要求较低的批量任务。</p><h2 id="迁移时要调整这些参数"><a href="#迁移时要调整这些参数" class="headerlink" title="迁移时要调整这些参数"></a>迁移时要调整这些参数</h2><p>将应用切换到 Gemini 3.8 Flash 时，首先把模型字符串改为 <code>gemini-3.8-flash</code>。生成配置中需要移除 <code>temperature</code>、<code>top_p</code>、<code>top_k</code> 和 <code>candidate_count</code>，并用字符串枚举 <code>thinking_level</code> 取代 <code>thinking_budget</code>。</p><p>多轮交互建议通过服务端 <code>previous_interaction_id</code> 串联上下文，同时移除预填充的模型回复轮次。使用 <code>generateContent</code> API 时，每个 <code>FunctionResponse</code> 还需包含 <code>call_id</code> 和 <code>name</code>，否则工具调用链路无法正确对应请求与结果。</p>]]></content>
    
    
    <summary type="html">Google 上线 Gemini 3.8 Flash 稳定版，并将 Antigravity Agent 默认模型切换至新版本。普通用户可在 Google AI Studio 试用，开发者可通过稳定模型 ID 接入生产应用。本文梳理百万 Token 输入、内置工具、2026 年底前限时 API 价格和旧版迁移参数，并说明计算机使用仍处预览、图像与音频生成不在该模型范围内。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="ai-agents" scheme="https://51allai.com/tags/ai-agents/"/>
    
    <category term="google" scheme="https://51allai.com/tags/google/"/>
    
    <category term="gemini" scheme="https://51allai.com/tags/gemini/"/>
    
  </entry>
  
  <entry>
    <title>腾讯上线 WorkBuddy 开放平台，开放 Skill、连接器与 Open API</title>
    <link href="https://51allai.com/posts/2026/09/workbuddy-open-platform/"/>
    <id>https://51allai.com/posts/2026/09/workbuddy-open-platform/</id>
    <published>2026-09-02T09:47:52.000Z</published>
    <updated>2026-09-02T09:47:52.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>腾讯 WorkBuddy 开放平台于 9 月 2 日上线，首期开放 Buddy 应用、专家、Skill、连接器与硬件五类能力。个人和企业开发者完成认证后，可创建生态资产，经过测试与审核后发布到 WorkBuddy。<br><img src="https://images.51allai.com/blog/workbuddy-open-platform-cover_20260902_192415.png" alt="WorkBuddy 开放平台五类生态能力封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="WorkBuddy-从办公工具扩展到开放平台"><a href="#WorkBuddy-从办公工具扩展到开放平台" class="headerlink" title="WorkBuddy 从办公工具扩展到开放平台"></a>WorkBuddy 从办公工具扩展到开放平台</h2><p>这次上线的重点不是增加一种办公任务，而是把 WorkBuddy 的能力开放给外部开发者。开发者可以在同一个工作台管理技能、专家、专家团、连接器和外部应用接入，把已有的行业知识、业务系统或服务做成 WorkBuddy 内可调用的产品。</p><p>平台首期提供五类入口。Buddy 应用用于封装垂直行业的完整工作台；专家承载特定领域的角色和工作方法；Skill 把一套任务步骤做成可复用能力；连接器负责接入外部服务与数据；硬件入口则面向需要把设备能力接入 WorkBuddy 的厂商。</p><p>对普通用户来说，这些能力会出现在 WorkBuddy 的应用或能力市场中。用户可以安装 Skill，在对话中调用；也可以选择专家或 Buddy 应用，直接进入已经配置好场景、工具和工作方式的工作台。</p><h2 id="开发者需要经过认证、测试和审核"><a href="#开发者需要经过认证、测试和审核" class="headerlink" title="开发者需要经过认证、测试和审核"></a>开发者需要经过认证、测试和审核</h2><p>个人与企业开发者均可从 <a href="https://open.workbuddy.cn/">WorkBuddy 开放平台</a> 入驻。标准流程包括注册、主体认证、创建业务类型、填写基础信息和能力配置、在测试环境调试、提交审核，以及审核通过后发布。发布后还可以查看运行数据并维护版本。</p><p>企业认证支持企业法人实名认证、腾讯云企业账号授权，以及微信公众号或小程序账号授权。个人认证需要完成实名信息和人脸识别。平台把创建、测试和发布分开，生态资产不会在提交后直接面向用户开放。</p><h2 id="Skill、专家和-Buddy-应用分别解决不同问题"><a href="#Skill、专家和-Buddy-应用分别解决不同问题" class="headerlink" title="Skill、专家和 Buddy 应用分别解决不同问题"></a>Skill、专家和 Buddy 应用分别解决不同问题</h2><p>Skill 采用 <code>SKILL.md</code> 描述用途和执行方法，还可以附带参考资料、脚本与模板。开发者可以把报告生成、数据处理或固定工作流打包为一个技能，用户安装后在对话中调用。</p><p>专家使用独立配置文件和 Agent 定义文件，适合封装专业角色、初始化提示词和依赖能力。专家团则把多个专家组合起来处理分工任务。</p><p>Buddy 应用的范围更大。它可以配置工作模式、推荐场景、模型、Skill、专家和连接器，把这些组件组合成面向金融、教育、法律等垂直场景的工作台。开发者不必重新制作一套桌面产品，但需要为具体场景配置入口、权限和能力组合。</p><h2 id="连接器支持-MCP-与命令行两条接入路线"><a href="#连接器支持-MCP-与命令行两条接入路线" class="headerlink" title="连接器支持 MCP 与命令行两条接入路线"></a>连接器支持 MCP 与命令行两条接入路线</h2><p>已有网络 API 的服务可以使用 MCP 与 Skill 接入。MCP 是让 AI 调用外部工具的标准协议；WorkBuddy 支持远程 HTTPS 服务，也支持通过标准输入输出启动本地进程。平台要求涉及用户数据的服务提供认证，并按最小权限原则开放能力。</p><p>已有成熟命令行工具的开发者可以选择 CLI 与 Skill 方案，由 WorkBuddy 安装并调度命令行程序。命令行工具需要提供非交互式安装方式，并自行管理登录状态和凭证。</p><p>第三方应用还有另一条路线：通过 OAuth 2.1 获得用户授权，再调用 Open API。当前接口覆盖个人资料、本地助理消息、云端任务、实时任务通道、会话产物和兑换码核销。应用必须先在开放平台登记回调地址和权限范围，用户确认授权后才能访问对应数据。</p>]]></content>
    
    
    <summary type="html">腾讯上线 WorkBuddy 开放平台，首期开放 Buddy 应用、专家、Skill、连接器与硬件五类生态能力。开发者可完成资质认证，创建并提交资产审核，还可通过 OAuth 2.1 和 Open API 接入本地助理、云端任务与会话产物。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="ai-agents" scheme="https://51allai.com/tags/ai-agents/"/>
    
    <category term="ecosystem" scheme="https://51allai.com/tags/ecosystem/"/>
    
    <category term="tencent" scheme="https://51allai.com/tags/tencent/"/>
    
    <category term="workbuddy" scheme="https://51allai.com/tags/workbuddy/"/>
    
  </entry>
  
  <entry>
    <title>Anthropic 推出 Claude Fable 5.1 与 Mythos 5.1，缓存读取降价 75%</title>
    <link href="https://51allai.com/posts/2026/09/claude-fable-5-1-mythos-5-1/"/>
    <id>https://51allai.com/posts/2026/09/claude-fable-5-1-mythos-5-1/</id>
    <published>2026-09-02T02:18:07.000Z</published>
    <updated>2026-09-02T06:10:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Anthropic 推出 Claude Fable 5.1 与 Claude Mythos 5.1。两者使用同一底层模型，Fable 5.1 面向普通用户和开发者开放，Mythos 5.1 仅限受信机构。API 输入和输出价格保持不变，缓存读取价格从每百万 Token 1 美元降至 0.25 美元。<br><img src="https://images.51allai.com/blog/claude-fable-5-1-mythos-5-1-cover-v2_20260902_103143.png" alt="Claude Fable 5.1 与 Mythos 5.1 模型发布封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="同一模型，两套访问范围"><a href="#同一模型，两套访问范围" class="headerlink" title="同一模型，两套访问范围"></a>同一模型，两套访问范围</h2><p>Claude Fable 5.1 和 Claude Mythos 5.1 使用同一底层模型，区别在安全限制和开放范围。Fable 5.1 是面向通用用户的版本，可用于长时间运行的编码、研究和文档任务。Mythos 5.1 面向网络安全与生命科学等受限场景，只向 Project Glasswing 的获批机构开放。</p><p>Fable 5.1 已进入 Claude Pro、Max、Team 和 Enterprise 计划。开发者可通过 Claude API 调用 <code>claude-fable-5-1</code>，也可在 Amazon Bedrock、Google Cloud 和 Microsoft Foundry 使用。Mythos 5.1 的 API ID 为 <code>claude-mythos-5-1</code>，访问需要通过机构审核。</p><h2 id="规格不变，缓存读取降至四分之一"><a href="#规格不变，缓存读取降至四分之一" class="headerlink" title="规格不变，缓存读取降至四分之一"></a>规格不变，缓存读取降至四分之一</h2><p>两款模型都支持 100 万 Token 上下文，单次最多输出 128K Token，并默认开启自适应思考。上下文窗口决定模型一次能处理多少材料，适合大型代码库、长文档和跨多轮的复杂任务。</p><p>API 基础价格沿用 Fable 5：每百万输入 Token 10 美元，每百万输出 Token 50 美元。变化集中在提示词缓存。缓存读取从每百万 Token 1 美元降至 0.25 美元，适合需要反复读取同一段项目背景、代码或文档的长任务。5 分钟和 1 小时缓存写入价格分别为 12.50 美元和 20 美元。</p><h2 id="开发者迁移要处理三项兼容变化"><a href="#开发者迁移要处理三项兼容变化" class="headerlink" title="开发者迁移要处理三项兼容变化"></a>开发者迁移要处理三项兼容变化</h2><p>从 Fable 5 切换时，修改模型 ID 还不够。Fable 5.1 不支持强制工具调用；把 <code>tool_choice</code> 设为 <code>any</code> 或指定某个工具会返回 400 错误。需要固定输出结构时，应使用自动工具选择配合严格模式，或改用结构化输出。</p><p>模型的思考块也要求对话历史保持连续。旧模型不能读取 Fable 5.1 生成的思考块，修改较早的对话内容会让后续思考块失效。已经自行拼装 <code>messages</code> 数组的应用，需要检查是否会改写历史消息。</p><p>新增能力包括按消息调整思考强度、只对当前轮生效的系统消息，以及工具调用之间的进度更新。这些接口中有多项处于 Beta，接入时需要使用对应的测试版请求头。</p><h2 id="安全回退会改变实际响应模型"><a href="#安全回退会改变实际响应模型" class="headerlink" title="安全回退会改变实际响应模型"></a>安全回退会改变实际响应模型</h2><p>Fable 5.1 对网络安全和生物领域继续采用分类与回退机制。触发网络安全限制的请求可切换到 Claude Opus 4.8，生物领域请求可切换到 Claude Opus 5。开发者需要在 API 集成中处理 <code>refusal</code> 状态，并配置服务端回退、中间件或自己的重试逻辑。</p><p>两款模型默认保留请求与输出 30 天，用于安全监测。需要零数据保留的企业必须获得 Anthropic 明确授权，不能沿用其他 Claude 模型的默认数据策略。</p><h2 id="适合重复上下文较多的长任务"><a href="#适合重复上下文较多的长任务" class="headerlink" title="适合重复上下文较多的长任务"></a>适合重复上下文较多的长任务</h2><p>Fable 5.1 的直接变化不是基础 Token 单价下调，而是降低重复读取上下文的成本。代码智能体、持续研究和多阶段文档处理会多次读取同一份项目材料，缓存价格下降能直接减少这部分支出。</p><p>普通用户可在支持的 Claude 订阅中选择 Fable 5.1。开发团队迁移前应先检查工具调用方式、对话历史处理和数据保留要求，再用现有评测集比较任务完成质量与总成本。Mythos 5.1 不属于普通账户可直接选择的模型。</p>]]></content>
    
    
    <summary type="html">Anthropic 推出 Claude Fable 5.1 与 Claude Mythos 5.1。两者共享 100 万 Token 上下文与 128K 输出规格，Fable 面向普通用户和开发者开放，Mythos 仅限受信机构；API 输入输出价格不变，缓存读取价格降至原来的四分之一。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="anthropic" scheme="https://51allai.com/tags/anthropic/"/>
    
    <category term="claude-fable" scheme="https://51allai.com/tags/claude-fable/"/>
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
  </entry>
  
  <entry>
    <title>微软语音AI VibeVoice，新增 1.58GB CPU 语音识别模型</title>
    <link href="https://51allai.com/posts/2026/09/microsoft-vibevoice-asr-bitnet/"/>
    <id>https://51allai.com/posts/2026/09/microsoft-vibevoice-asr-bitnet/</id>
    <published>2026-09-02T01:34:17.000Z</published>
    <updated>2026-09-02T06:10:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>微软为 VibeVoice 新增 VibeVoice-ASR-BitNet，把语音识别模型从 4.62GB 压缩到 1.58GB，并公开 MIT 许可的 C++ 运行时。它可在 x86 和 ARM CPU 上本地转写音频，无需 GPU；当前采用离线批处理，不支持流式识别。<br><img src="https://images.51allai.com/blog/microsoft-vibevoice-asr-bitnet-cover_20260902_094001.png" alt="微软 VibeVoice-ASR-BitNet 本地 CPU 语音识别" fetchpriority="high" decoding="async"></p></blockquote><h2 id="1-58GB-模型把转写留在本地"><a href="#1-58GB-模型把转写留在本地" class="headerlink" title="1.58GB 模型把转写留在本地"></a>1.58GB 模型把转写留在本地</h2><p>VibeVoice-ASR-BitNet 把录音转成文字，运行时针对 x86 和 ARM 处理器编写。完成模型下载和编译后，转写在本机进行，不需要专用 GPU 或调用云端语音接口。</p><p>这个版本以 Qwen2.5-1.5B 作为语言模型部分，再分别压缩声音编码器和语言模型。声音编码器使用 8 位量化，语言模型使用 BitNet 三值权重，也就是用更少数字位保存模型参数。两部分合计从 FP16 版的 4.62GB 降到 1.58GB，下载和内存压力都更低。</p><h2 id="支持七种语言，但不是实时字幕引擎"><a href="#支持七种语言，但不是实时字幕引擎" class="headerlink" title="支持七种语言，但不是实时字幕引擎"></a>支持七种语言，但不是实时字幕引擎</h2><p>VibeVoice-ASR-BitNet 覆盖英语、中文、法语、意大利语、韩语、葡萄牙语和越南语。它适合本地处理会议录音、访谈、播客和视频声轨，也可作为开发者自建语音转写工具的底层引擎。</p><p>当前实现仅支持离线批处理，不能直接用于视频会议的流式字幕或实时语音助手。</p><h2 id="用-VibeASR-cpp-在本机运行"><a href="#用-VibeASR-cpp-在本机运行" class="headerlink" title="用 VibeASR.cpp 在本机运行"></a>用 VibeASR.cpp 在本机运行</h2><p>项目需要 Python 3.9 或更高版本、CMake 3.14 或更高版本，以及 GCC 或 Clang。代码和量化模型需要约 2GB 磁盘空间。</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br></pre></td><td class="code"><pre><span class="line">git <span class="built_in">clone</span> --recursive https://github.com/microsoft/VibeASR.cpp.git</span><br><span class="line"><span class="built_in">cd</span> VibeASR.cpp</span><br><span class="line">pip install -r requirements.txt</span><br><span class="line">python setup_env.py</span><br></pre></td></tr></table></figure><p><code>setup_env.py</code> 会编译 C++ 运行时并下载预量化模型。完成后，把待转写的音频文件交给命令行程序：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br></pre></td><td class="code"><pre><span class="line">./build/bin/asr_infer \</span><br><span class="line">  --vae-model models/vibeasr/vibeasr-vae-encoder-i8_s.gguf \</span><br><span class="line">  --lm-model models/vibeasr/vibeasr-lm-i2_s-embed-q6_k.gguf \</span><br><span class="line">  --audio input.wav -t 4</span><br></pre></td></tr></table></figure><p>需要可视化操作时，仓库还提供 Gradio 网页演示。Windows 版需要 MinGW-w64 等 GCC&#x2F;Clang 环境，目前不支持直接用 MSVC 构建。</p><h2 id="VibeVoice-同时包含识别和合成模型"><a href="#VibeVoice-同时包含识别和合成模型" class="headerlink" title="VibeVoice 同时包含识别和合成模型"></a>VibeVoice 同时包含识别和合成模型</h2><p>VibeVoice 不是单一的语音合成模型，当前仓库同时整理文字转语音（TTS）和语音转文字（ASR）两条产品线。VibeVoice-ASR-BitNet 属于 ASR，只负责识别已有录音，不生成声音。</p><p>2025 年 9 月，微软因发现初版 VibeVoice-TTS 被用于与研究意图不符的场景，从主仓库移除了该 TTS 代码。目前仓库仍包含 VibeVoice-Realtime-0.5B 实时语音合成模型的使用路径。按早期教程寻找初版 TTS 文件时，当前目录结构会与旧教程不同。</p><ul><li>项目地址：<a href="https://github.com/microsoft/VibeVoice">https://github.com/microsoft/VibeVoice</a></li></ul>]]></content>
    
    
    <summary type="html">微软语音AI VibeVoice 开源语音家族，新增 1.58GB 的 VibeVoice-ASR-BitNet 语音识别模型和 C++ 运行时。它面向 x86 与 ARM CPU 本地转写，无需 GPU，本文梳理量化方式、安装步骤与已确认限制。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="open-source" scheme="https://51allai.com/tags/open-source/"/>
    
    <category term="microsoft" scheme="https://51allai.com/tags/microsoft/"/>
    
    <category term="vibevoice" scheme="https://51allai.com/tags/vibevoice/"/>
    
    <category term="speech-recognition" scheme="https://51allai.com/tags/speech-recognition/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 推出 ChatGPT 礼品卡，首批仅限美国购买和兑换</title>
    <link href="https://51allai.com/posts/2026/09/openai-chatgpt-gift-cards/"/>
    <id>https://51allai.com/posts/2026/09/openai-chatgpt-gift-cards/</id>
    <published>2026-09-01T12:32:46.000Z</published>
    <updated>2026-09-02T06:10:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 已开放美元计价的 ChatGPT 礼品卡，当前仅限美国购买和兑换，常规购买金额为 15 至 250 美元。兑换后余额进入 OpenAI 钱包，可支付 ChatGPT 网页版订阅、续费和符合条件的积分购买，但不能用于 App Store、Google Play 或 API 预付费。<br><img src="https://images.51allai.com/blog/openai-chatgpt-gift-cards-cover_20260901_205243.png" alt="OpenAI ChatGPT 礼品卡与美元钱包余额" fetchpriority="high" decoding="async"></p></blockquote><h2 id="礼品卡首批只在美国提供"><a href="#礼品卡首批只在美国提供" class="headerlink" title="礼品卡首批只在美国提供"></a>礼品卡首批只在美国提供</h2><p>ChatGPT 礼品卡是以美元计价、不可充值的储值卡。用户可从参与销售的授权零售商购买数字卡，自用或转送给亲友。除非零售商的购买页面另有说明，可选金额为 15 至 250 美元。</p><p>购买和兑换都要在美国完成，接收余额的 ChatGPT 账户也必须以美元结算。把数字卡发往其他国家，不会改变这两项条件。礼品卡本身不过期，但使用前仍要核对账户所在地和计费币种。</p><h2 id="兑换后进入-OpenAI-钱包"><a href="#兑换后进入-OpenAI-钱包" class="headerlink" title="兑换后进入 OpenAI 钱包"></a>兑换后进入 OpenAI 钱包</h2><p>兑换需要在浏览器打开 <code>chatgpt.com/redeem</code>，登录准备接收余额的 ChatGPT 账户，输入礼品卡 PIN 并确认。完成后，个人用户可在“设置 &gt; 账单”查看钱包余额和交易记录；Business 工作区所有者则在“工作区设置 &gt; 账单”查看。</p><p>礼品卡会一次性把全部金额充入当前账户，不能只兑换其中一部分，也不能在两个账户之间拆分。确认兑换前要检查登录邮箱和当前工作区：一旦充入，余额不能转到其他账户。PIN 应当像密码一样保管，不要在公开场合展示。</p><h2 id="可支付订阅、续费和部分积分购买"><a href="#可支付订阅、续费和部分积分购买" class="headerlink" title="可支付订阅、续费和部分积分购买"></a>可支付订阅、续费和部分积分购买</h2><p>钱包余额可用于 ChatGPT 网页端直接计费的订阅、升级和续费，也可支付符合条件的积分购买，包括部分一次性 ChatGPT Work 或 Codex 用量积分。兑换礼品卡只是增加美元余额，不会自动开通付费订阅，也不等于已经购买了用量积分。</p><p>符合条件的 Free、Go、Plus 和 Pro 个人账户可以兑换。ChatGPT Business 工作区只有所有者能把礼品卡充入工作区余额；管理员和成员不能操作。个人钱包与 Business 工作区钱包分开保存，切换工作区不会移动余额。</p><p>符合条件的付款会自动优先扣减钱包余额，用户不能指定某次只使用其中一部分。余额不足时，差额从其他付款方式扣除；没有可用的备用付款方式时，订阅可能无法续费。</p><h2 id="手机内购和-API-不能使用礼品卡余额"><a href="#手机内购和-API-不能使用礼品卡余额" class="headerlink" title="手机内购和 API 不能使用礼品卡余额"></a>手机内购和 API 不能使用礼品卡余额</h2><p>礼品卡余额只支持 ChatGPT 网页端的符合条件交易。通过 Apple App Store 或 Google Play 计费的订阅不会扣减该余额，兑换礼品卡也不会自动取消现有的手机端订阅。想改用网页端计费，需要先在原应用商店取消订阅，等当前计费周期结束后再从 ChatGPT 网页端订阅。</p><p>礼品卡余额也不能充值 API 预付费账户。此外，美元钱包不会抵扣以欧元、英镑或其他币种结算的购买。</p><h2 id="兑换后不能转移、提现或退回礼品卡"><a href="#兑换后不能转移、提现或退回礼品卡" class="headerlink" title="兑换后不能转移、提现或退回礼品卡"></a>兑换后不能转移、提现或退回礼品卡</h2><p>礼品卡一旦兑换，余额不能退回原卡、转换为现金、提现到银行卡，也不能退到其他付款方式。如果用礼品卡余额支付的 ChatGPT 购买符合退款条件，对应部分会退回同一个 OpenAI 钱包，而不是退回礼品卡或换成现金。</p><p>未使用礼品卡的配送、激活和退款问题由销售该卡的零售商处理。已兑换余额的使用问题，则通过 OpenAI 客服处理。</p><h2 id="礼品卡与“赠送-ChatGPT-积分”不是同一个功能"><a href="#礼品卡与“赠送-ChatGPT-积分”不是同一个功能" class="headerlink" title="礼品卡与“赠送 ChatGPT 积分”不是同一个功能"></a>礼品卡与“赠送 ChatGPT 积分”不是同一个功能</h2><p>ChatGPT 礼品卡通过零售商销售，使用 PIN 兑换成美元钱包余额。“赠送 ChatGPT 积分”则是在 ChatGPT 网页端单独购买积分并分享一次性领取链接，不是礼品卡。</p><p>两者的期限也不同。礼品卡本身不过期；赠送积分的领取链接需在 30 天内兑换，领取后的积分需在 12 个月内使用。如果收到的是链接而不是礼品卡 PIN，应按“赠送 ChatGPT 积分”的条件检查账户和币种。</p>]]></content>
    
    
    <summary type="html">OpenAI 推出 ChatGPT 礼品卡，当前仅限美国、美元账户购买和兑换，常规金额为 15 至 250 美元。本文梳理兑换入口、可支付的订阅与积分、网页端限制，以及余额不能转移或提现等注意事项，并说明礼品卡与赠送 ChatGPT 积分的区别，避免买错或充进错误账户。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
  </entry>
  
  <entry>
    <title>Codex with ChatGPT 开源，让 ChatGPT 规划、Codex 执行</title>
    <link href="https://51allai.com/posts/2026/08/codex-with-chatgpt-bridge/"/>
    <id>https://51allai.com/posts/2026/08/codex-with-chatgpt-bridge/</id>
    <published>2026-08-31T01:57:09.000Z</published>
    <updated>2026-09-02T06:10:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>社区项目 Codex with ChatGPT，让 ChatGPT 网页端负责规划和审查，本地 Codex 继续改代码、跑命令和测试。ChatGPT 通过 8 个只读 MCP 工具按需读取工作区，不能借此写文件或执行命令。<br><img src="https://images.51allai.com/blog/codex-with-chatgpt-bridge-cover_20260831_100631.png" alt="Codex with ChatGPT 规划与本地执行桥接" fetchpriority="high" decoding="async"></p></blockquote><h2 id="ChatGPT-规划，Codex-保留执行权"><a href="#ChatGPT-规划，Codex-保留执行权" class="headerlink" title="ChatGPT 规划，Codex 保留执行权"></a>ChatGPT 规划，Codex 保留执行权</h2><p>Codex with ChatGPT 是一个非 OpenAI 官方的社区项目。它没有用网页端 ChatGPT 取代 Codex，而是把一次编码任务拆成两个角色：ChatGPT 理解需求、制定计划并审查结果；Codex 使用本地工具编辑文件、运行测试、查看 Git 状态并处理失败。</p><p>两端通过几种状态消息协调流程。ChatGPT 需要了解项目时，再从 MCP 连接中读取文件、搜索结果、代码差异或测试记录。MCP 是让 AI 调用外部数据和工具的标准接口，这里只负责从当前项目取回信息。</p><h2 id="8-个工具只读取项目与执行记录"><a href="#8-个工具只读取项目与执行记录" class="headerlink" title="8 个工具只读取项目与执行记录"></a>8 个工具只读取项目与执行记录</h2><p>当前 v0.1.0 提供 8 个 MCP 工具：查看工作区信息、列出目录、读取文件、搜索工作区、查看 Git 状态、查看 Git 差异、读取测试状态和执行摘要。服务端没有写文件、删除文件、运行 Shell、安装依赖或提交 Git 的工具。</p><p>读取范围以单个工作区为边界。路径会在读取前解析为真实位置，用来拦截 <code>..</code>、绝对路径和符号链接越界。<code>.env</code> 文件、密钥、SSH 凭据和云端凭据等默认被排除，用户还可以用 <code>.c2cignore</code> 增加项目自己的忽略规则。</p><p>我们在最新 v0.1.0 代码上安装锁定依赖后，125 项自动化测试全部通过，TypeScript 类型检查也通过。测试覆盖了工作区越界、敏感文件排除、一次性配对码、OAuth、MCP 调用、Git 差异和连接恢复等路径。</p><h2 id="一段指令可以交给-Codex-安装"><a href="#一段指令可以交给-Codex-安装" class="headerlink" title="一段指令可以交给 Codex 安装"></a>一段指令可以交给 Codex 安装</h2><p>项目要求 Node.js 20 或更高版本、Git、Codex 和 <code>cloudflared</code>。用户可以克隆仓库，用 pnpm 安装依赖并构建，再把仓库里的 <code>skill/SKILL.md</code> 复制到 Codex 的 skills 目录。也可以把 README 提供的安装指令整段交给 Codex，让它完成环境检查、下载、构建和 Skill 安装。</p><p>首次配置会启动本地桥接，再把它添加为 ChatGPT 的自定义 MCP App。连接使用 OAuth 授权和有效期 5 分钟的一次性配对码。设置完成后，用户可以直接告诉 Codex“使用 Codex with ChatGPT 帮我实现……”，Skill 会负责启动连接、请 ChatGPT 制定计划，再把执行结果交给 ChatGPT 审查。</p><p>ChatGPT 账号需要具备自定义 MCP App 和开发者模式权限。Codex 的 ChatGPT 登录与这条桥接是两件事：前者让 Codex 使用账号套餐，后者让 ChatGPT 网页端读取当前工作区并参与规划。它不会把现有 Codex 额度改成无限使用。</p><h2 id="只读不等于代码没有离开电脑"><a href="#只读不等于代码没有离开电脑" class="headerlink" title="只读不等于代码没有离开电脑"></a>只读不等于代码没有离开电脑</h2><p>这套架构不会把整个仓库打包上传，但 ChatGPT 通过 MCP 请求的文件片段、搜索结果、Git 差异和测试记录仍会离开本地环境，用于规划和审查。只读限制解决的是“ChatGPT 能否借连接修改项目”，不是“ChatGPT 能否看到代码”。</p><p>默认连接使用 Cloudflare Quick Tunnel，它会给本地桥接生成临时公网地址。该地址还需要有效的 OAuth 令牌才能读取数据，但 Quick Tunnel 本身是 Cloudflare 面向测试和开发的临时服务，地址会在进程重启后改变，也没有可用性保证。项目另外支持绑定 Cloudflare 账号和自有域名的固定地址。</p><p>对个人开源项目或可恢复的测试仓库，这种角色分工可以将规划和本地执行串起来。处理公司私有代码、客户数据或受合规要求约束的仓库时，应先检查 ChatGPT 套餐的数据规则、组织的外部服务政策、<code>.c2cignore</code> 以及实际暴露的 MCP 工具。</p><ul><li>访问项目：<a href="https://github.com/XiaoDuoYa/codex-with-chatgpt">https://github.com/XiaoDuoYa/codex-with-chatgpt</a></li></ul>]]></content>
    
    
    <summary type="html">Codex with ChatGPT 开源，把 ChatGPT 网页端用于规划和代码审查，本地 Codex 负责编辑、命令与测试。本文说明 8 个只读 MCP 工具、安装步骤、Cloudflare 连接方式、125 项测试结果，以及代码片段仍会传给 ChatGPT 的隐私边界，帮助开发者判断它是否适合个人或团队代码仓库。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="codex" scheme="https://51allai.com/tags/codex/"/>
    
    <category term="agent-framework" scheme="https://51allai.com/tags/agent-framework/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
    <category term="codex-with-chatgpt" scheme="https://51allai.com/tags/codex-with-chatgpt/"/>
    
  </entry>
  
  <entry>
    <title>Google Research 发布 WikiSkill，用持久 Wiki 进化 Agent 技能</title>
    <link href="https://51allai.com/posts/2026/08/google-wikiskill-agent-skills/"/>
    <id>https://51allai.com/posts/2026/08/google-wikiskill-agent-skills/</id>
    <published>2026-08-30T16:10:20.000Z</published>
    <updated>2026-09-02T06:10:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Google Research 团队发布 WikiSkill 研究框架，把智能体的执行记录整理成持久 Wiki，再用这些知识持续创建和修改 Agent 技能。实验覆盖 5 类任务和 5 个模型；Qwen 9B 搭配进化技能后的平均成绩为 47.4%，超过无技能 Qwen 27B 的 39.4%。<br><img src="https://images.51allai.com/blog/google-wikiskill-agent-skills-cover_20260831_001729.png" alt="Google WikiSkill 持久知识库与 Agent 技能进化流程" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Wiki-不是给执行-Agent-直接查答案"><a href="#Wiki-不是给执行-Agent-直接查答案" class="headerlink" title="Wiki 不是给执行 Agent 直接查答案"></a>Wiki 不是给执行 Agent 直接查答案</h2><p>WikiSkill 处理的是一个常见问题：智能体完成任务后会留下大量执行记录，包括推理步骤、工具调用、返回结果和最终答案，但这些经验容易散落在日志里。下一轮改技能时，系统可能重新分析同类错误，也可能重复已经失败的修改。</p><p>它把工作区拆成三层。<code>raw/</code> 保存不可修改的原始执行记录；<code>wiki/</code> 用 Markdown 页面整理反复出现的失败模式、有效策略、历次修改和验证结果；<code>skills/</code> 存放真正交给执行 Agent 使用的流程指令。模型参数不需要更新，积累发生在工作区里的知识和技能文件中。</p><p>这里的 Wiki 更像技能维护者的工作笔记，不是执行 Agent 的外接记忆。在默认设置里，执行 Agent 只能读取当前技能，不能直接访问 Wiki。这样生成的执行记录会更清楚地暴露技能缺少哪些步骤。</p><h2 id="四步循环把经验变成可验证的技能修改"><a href="#四步循环把经验变成可验证的技能修改" class="headerlink" title="四步循环把经验变成可验证的技能修改"></a>四步循环把经验变成可验证的技能修改</h2><p>每轮进化从执行任务开始。Inference Agent 使用当前技能完成训练任务，并把过程写入 Raw 层。Wiki Maintainer 随后分析成功和失败记录，把原因、策略与历史结果整理进 Wiki。</p><p>Skill Proposer 再读取 Wiki 和相关原始记录，每轮只创建一个技能或对一个技能做增量修改。候选技能会在独立验证集上评分；成绩高于此前最佳结果才会保留，否则回滚技能。无论修改是否通过，Wiki 都会保存提案、差异、得分和接受结果，避免后续再次提交同一种无效改法。</p><p>这套设计把“发生过什么”“从中总结出什么”“下一次具体怎么做”分开管理。原始记录用于追溯，Wiki 用于积累判断，Skill 保持为执行时需要的简洁步骤。</p><h2 id="9B-模型配合技能超过无技能-27B-模型"><a href="#9B-模型配合技能超过无技能-27B-模型" class="headerlink" title="9B 模型配合技能超过无技能 27B 模型"></a>9B 模型配合技能超过无技能 27B 模型</h2><p>实验覆盖数学推理、网页搜索、电子表格处理、长文档问答和文本交互环境 5 类任务，测试了 Qwen、Gemma 与 Gemini 系列的 5 个模型。所有方法都从空技能集开始，最终成绩取 3 次完整进化流程的平均值。</p><p>Qwen 3.5 9B 不使用技能时平均成绩为 29.9%，使用 WikiSkill 进化出的技能后达到 47.4%。无技能 Qwen 3.6 27B 的平均成绩为 39.4%。在 Qwen 3.6 27B 上，WikiSkill 把 5 类任务的平均成绩从 39.4% 提到 63.3%；Gemini 3.5 Flash 则从 49.5% 提到 68.1%。</p><p>持久 Wiki 的作用也经过拆分测试。当执行 Agent 不读取 Wiki 时，让 Skill Proposer 使用持久 Wiki，4 类任务平均成绩从 48.7% 提到 63.7%。如果执行 Agent 也能读取 Wiki，平均成绩反而降到 60.9%。这个结果只说明该实验配置下的访问分工，不等同于所有智能体系统都应禁止执行端读取长期知识。</p><h2 id="技能能迁移，但不保证换模型后继续有效"><a href="#技能能迁移，但不保证换模型后继续有效" class="headerlink" title="技能能迁移，但不保证换模型后继续有效"></a>技能能迁移，但不保证换模型后继续有效</h2><p>WikiSkill 生成的技能可以跨模型使用。Qwen 3.6 27B 进化出的电子表格技能交给 Qwen 3.5 9B 后，成绩达到 50.5%，高于其自进化技能的 33.6%。在 ALFWorld 交互任务中，同一迁移把 Qwen 3.5 9B 的成绩从自进化技能下的 63.4% 提到 70.2%。</p><p>迁移也可能变差。Qwen 3.5 4B 生成的电子表格技能让 Gemini 3.5 Flash 的成绩从无技能时的 50.5% 降到 18.1%。这些技能包含适合小模型规避执行错误的低层操作和碎片化检查步骤，放到更强模型上会限制完整脚本的使用，并消耗更多工具调用次数。</p><p>对开发团队来说，Skill 可以成为独立于模型参数的可审计资产，但不能把某个模型验证过的技能直接视为通用流程。换模型、换工具或换任务环境后，仍要用独立验证集重新评分，并保留回滚能力。</p><h2 id="目前适合研究技能维护流程"><a href="#目前适合研究技能维护流程" class="headerlink" title="目前适合研究技能维护流程"></a>目前适合研究技能维护流程</h2><p>WikiSkill 评估的是技能质量，没有测试技能库变大后如何自动检索和触发合适的技能。实验会把当前技能全文放入执行 Agent 的提示词，这与拥有大量技能的实际系统不同。</p><p>Wiki 还会持续增加模式页面、历史日志和修改差异，当前方法没有自动清理机制。实验任务包含长文档与多步工具调用，但没有覆盖持续数小时或数百次环境操作的超长任务。现阶段更适合把它看作一套技能演化与验证方法，而不是一个下载后即可接入现有 Agent 的成品服务。</p>]]></content>
    
    
    <summary type="html">Google Research 发布 WikiSkill 研究框架，把智能体的原始执行记录、持久知识与可执行技能分层管理，再通过验证和回滚持续改进技能。实验覆盖五类任务和五个模型，Qwen 9B 搭配进化技能的平均成绩超过无技能的 27B 模型，部分技能还能跨模型迁移。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="agent-framework" scheme="https://51allai.com/tags/agent-framework/"/>
    
    <category term="ai-agents" scheme="https://51allai.com/tags/ai-agents/"/>
    
    <category term="google" scheme="https://51allai.com/tags/google/"/>
    
    <category term="wikiskill" scheme="https://51allai.com/tags/wikiskill/"/>
    
  </entry>
  
  <entry>
    <title>WorkBuddy 国际版接入 Hy4 preview，770B 开源模型限免两周</title>
    <link href="https://51allai.com/posts/2026/08/workbuddy-hy4-preview-global/"/>
    <id>https://51allai.com/posts/2026/08/workbuddy-hy4-preview-global/</id>
    <published>2026-08-30T05:52:23.000Z</published>
    <updated>2026-09-02T06:10:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>WorkBuddy 国际版已接入腾讯混元 Hy4 preview。该模型总参数 770B、每次推理激活 49B，支持超过 100 万 Token 上下文；全球用户可直接在 WorkBuddy 中使用，首发两周免费，不必自行下载和部署模型。<br><img src="https://images.51allai.com/blog/workbuddy-hy4-preview-global-cover-original_20260830_135459.png" alt="WorkBuddy 国际版接入 Hy4 preview 模型封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="WorkBuddy-国际版新增-Hy4-preview"><a href="#WorkBuddy-国际版新增-Hy4-preview" class="headerlink" title="WorkBuddy 国际版新增 Hy4 preview"></a>WorkBuddy 国际版新增 Hy4 preview</h2><p>Hy4 preview 已进入 WorkBuddy 国际版的模型阵容。全球用户可以通过 <a href="https://www.workbuddy.ai/">WorkBuddy 国际版</a> 直接使用，不需要先下载模型文件、配置推理框架或接入 API。</p><p>WorkBuddy 是面向办公任务的智能体工作台，可以根据自然语言要求处理研究、数据分析、文档、演示文稿和表格等任务。接入 Hy4 preview 后，用户仍在同一个工作台里发起任务，只是多了一个可选模型。</p><h2 id="770B-总参数，每次激活-49B"><a href="#770B-总参数，每次激活-49B" class="headerlink" title="770B 总参数，每次激活 49B"></a>770B 总参数，每次激活 49B</h2><p>Hy4 preview 采用混合专家架构（MoE），总参数为 770B，处理每个 Token 时激活 49B 参数。MoE 会根据当前输入调度部分“专家”参与计算，因此 49B 描述的是每一步推理调用的参数量，不等于模型文件只有 49B。</p><p>模型支持超过 100 万 Token 的上下文。上下文决定模型在一次任务中能读取多少文字、代码和历史步骤；对 WorkBuddy 用户来说，这项规格适合处理较长文档、多个文件和持续多轮的工作任务。</p><p>Hy4 preview 已开源。需要自己部署的团队可以选择开源版本，但只想完成办公任务的用户可以直接从 WorkBuddy 使用托管服务。</p><h2 id="Hy4-preview-首发免费两周"><a href="#Hy4-preview-首发免费两周" class="headerlink" title="Hy4 preview 首发免费两周"></a>Hy4 preview 首发免费两周</h2><p>Hy4 preview 在 WorkBuddy 和 CodeBuddy 上提供两周免费体验，限免从模型发布时开始。两款产品中的 Hy3 免费使用期同时延长至 9 月 30 日，用户可以在相同任务上比较两个模型的输出与执行过程。</p><p>免费体验适合先测试长文档整理、跨文件分析、报告与演示文稿制作等现有工作流。比较时可以记录任务是否完成、耗时、需要人工修改的次数和最终产物质量，再决定后续使用哪个模型。</p>]]></content>
    
    
    <summary type="html">WorkBuddy 国际版接入腾讯混元 Hy4 preview，全球用户可直接选择这款 770B 总参数、49B 激活参数和 1M 上下文的开源模型。本文梳理两周限免、产品入口，以及它对文档、表格和演示文稿任务的实际使用方式，帮助办公用户判断是否值得在限免期内切换模型试用。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="tencent" scheme="https://51allai.com/tags/tencent/"/>
    
    <category term="workbuddy" scheme="https://51allai.com/tags/workbuddy/"/>
    
    <category term="hunyuan" scheme="https://51allai.com/tags/hunyuan/"/>
    
  </entry>
  
  <entry>
    <title>腾讯开源 Hy4 preview：770B 总参数、1M 上下文，API 输入价 6 元/百万 Token</title>
    <link href="https://51allai.com/posts/2026/08/tencent-hy4-preview/"/>
    <id>https://51allai.com/posts/2026/08/tencent-hy4-preview/</id>
    <published>2026-08-28T11:54:41.000Z</published>
    <updated>2026-09-02T06:10:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>腾讯于 2026 年 8 月 28 日开源 Hy4 preview。模型拥有 770B 总参数、49B 激活参数和 100 万 Token 上下文，并已接入腾讯产品、腾讯云 TokenHub 与 OpenRouter；API 输入价格为 6 元&#x2F;百万 Token。<br><img src="https://images.51allai.com/blog/tencent-hy4-preview-cover_20260828_195812.png" alt="腾讯 Hy4 preview 770B 参数与 1M 上下文封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="770B-参数中每次激活-49B"><a href="#770B-参数中每次激活-49B" class="headerlink" title="770B 参数中每次激活 49B"></a>770B 参数中每次激活 49B</h2><p>Hy4 preview 是一款混合专家模型（MoE）。它拥有 770B 总参数，处理每个 Token 时激活 49B 参数。MoE 会按输入选择一部分“专家”参与计算，避免每次生成都调用全部参数；49B 激活参数描述的是单步计算量，不等于下载或部署时只需加载 49B 权重。</p><p>模型主干共 78 层。第一层使用标准前馈网络，其余 77 层各有 256 个路由专家和 1 个共享专家，每个 Token 会调用其中 8 个路由专家及共享专家。主干外还带有一层 MTP，用于一次预测后续多个 Token，配合推理框架提高生成效率。</p><p>上下文长度为 100 万 Token。上下文决定模型一次请求能读取多少文字、代码和历史步骤；容量增加后，开发者可以在同一任务中放入更长的代码仓库、文档集合或多轮操作记录。</p><h2 id="API-输入-6-元，输出-18-元"><a href="#API-输入-6-元，输出-18-元" class="headerlink" title="API 输入 6 元，输出 18 元"></a>API 输入 6 元，输出 18 元</h2><p>Hy4 preview 的 API 按每 100 万 Token 计费：普通输入 6 元、输出 18 元，命中缓存的输入为 0.3 元。缓存适合多次请求重复使用相同的系统提示词、文档或代码前缀，可以减少重复输入的费用。</p><p>按这个单价计算，一次请求如果输入 10 万 Token、输出 1 万 Token，费用约为 0.78 元；其中输入 0.6 元，输出 0.18 元。实际账单仍取决于每次请求的输入、输出和缓存命中量。</p><p>国内开发者可以通过腾讯云 TokenHub 接入，海外入口包括 OpenRouter。OpenRouter 的实时模型目录列出 1,048,576 Token 上下文，并支持工具调用、结构化输出和推理强度参数。</p><h2 id="应用入口覆盖办公、代码与日常问答"><a href="#应用入口覆盖办公、代码与日常问答" class="headerlink" title="应用入口覆盖办公、代码与日常问答"></a>应用入口覆盖办公、代码与日常问答</h2><p>不写代码的用户可以在 WorkBuddy、CodeBuddy、元宝和 ima 中选择 Hy4 preview。WorkBuddy 面向桌面办公任务，CodeBuddy 用于代码开发，元宝和 ima 提供日常问答与知识处理入口。发布日起，WorkBuddy 与 CodeBuddy 提供两周免费体验。</p><p>需要把模型接入软件的开发者可以使用 TokenHub 或 OpenRouter API。需要在自有环境运行的团队，可以从 Hugging Face、ModelScope、GitCode 或 CNB 下载 Hy4 preview 与 FP8 版本，并通过 vLLM 或 SGLang 部署。模型采用 Apache 2.0 许可证。</p><h2 id="Preview-版本适合先按任务试用"><a href="#Preview-版本适合先按任务试用" class="headerlink" title="Preview 版本适合先按任务试用"></a>Preview 版本适合先按任务试用</h2><p>Hy4 preview 默认使用高推理强度，适合数学、代码和复杂推理任务。需要直接回答时，自建服务可以通过 <code>reasoning_effort</code> 关闭深度思考，以缩短不必要的推理过程。</p><p>模型说明列出的已知问题包括：处理复杂任务时可能思考过久，也可能反复检查自己的结果。普通用户可以先在腾讯产品中比较实际体验；开发者则可通过 API 记录延迟、Token 用量和任务成功率，再决定是否用于稳定业务。</p>]]></content>
    
    
    <summary type="html">腾讯开源 Hy4 preview，模型采用 770B 总参数、49B 激活参数的混合专家架构，支持 100 万 Token 上下文。本文梳理 Apache 2.0 许可证、应用与 API 入口，以及输入 6 元、输出 18 元每百万 Token 的调用成本。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="open-source" scheme="https://51allai.com/tags/open-source/"/>
    
    <category term="tencent" scheme="https://51allai.com/tags/tencent/"/>
    
    <category term="hunyuan" scheme="https://51allai.com/tags/hunyuan/"/>
    
  </entry>
  
  <entry>
    <title>Grok Bot 扩大使用范围，SuperGrok 与 Cursor Pro 均可使用</title>
    <link href="https://51allai.com/posts/2026/08/grok-bot-paid-plans/"/>
    <id>https://51allai.com/posts/2026/08/grok-bot-paid-plans/</id>
    <published>2026-08-28T02:13:12.000Z</published>
    <updated>2026-09-02T06:10:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Grok Bot 于 8 月 11 日进入测试，8 月 26 日扩展到 SuperGrok、SuperGrok Plus、SuperGrok Heavy、Cursor Pro、Cursor Pro+、Cursor Ultra 和 Cursor Teams 付费套餐。每个账号获得一台持续运行的云电脑，多个 Bot 可以共享登录状态并并行处理任务。<br><img src="https://images.51allai.com/blog/grok-bot-paid-plans-cover_20260828_102109.png" alt="Grok Bot 云电脑智能体与付费套餐扩展" fetchpriority="high" decoding="async"></p></blockquote><h2 id="从聊天窗口变成持续运行的云端工作环境"><a href="#从聊天窗口变成持续运行的云端工作环境" class="headerlink" title="从聊天窗口变成持续运行的云端工作环境"></a>从聊天窗口变成持续运行的云端工作环境</h2><p>Grok Bot 不只在对话里返回文字。它运行在持续存在的云端虚拟机中，可以使用浏览器、文件系统和终端，也能通过连接器或 MCP 访问已授权的工具。MCP 是让 AI 工具连接外部服务的通用协议；没有合适接口的网站，Bot 则可直接操作页面。</p><p>一个账号下的所有 Bot 共用同一台云电脑，共享文件、浏览器会话和应用登录状态。每个 Bot 有独立的屏幕和对话，可以并行执行工作，也能在线程或群聊中传递上下文和交接任务。用户关闭笔记本或手机后，已开始的后台任务和例行任务仍可继续运行。</p><h2 id="所有付费个人-Cursor-套餐和自助团队席位都已包含访问权限"><a href="#所有付费个人-Cursor-套餐和自助团队席位都已包含访问权限" class="headerlink" title="所有付费个人 Cursor 套餐和自助团队席位都已包含访问权限"></a>所有付费个人 Cursor 套餐和自助团队席位都已包含访问权限</h2><p>8 月 26 日的调整把 Grok Bot 纳入了 SuperGrok、SuperGrok Plus、SuperGrok Heavy，以及 Cursor Pro、Pro+、Ultra 和 Cursor Teams 套餐。已有这些订阅的用户不需再购买单独的 Grok Bot 订阅。SuperGrok 用户可以把个人订阅链接到 Cursor 账号；Cursor 用户直接用同一账号登录。</p><p>Grok Bot 的用量每周重置，与用户在 Grok 或 Cursor 中的原有用量分开计算。不同套餐对应不同的每周额度，Pro、Pro+ 和 Ultra 依次提供更高的 Grok Bot 用量。自助购买的 Cursor Teams 中，每个成员都有访问权限，管理员无需额外分配 Premium 席位。</p><h2 id="桌面端负责初始配置，iPhone-可以接续同一对话"><a href="#桌面端负责初始配置，iPhone-可以接续同一对话" class="headerlink" title="桌面端负责初始配置，iPhone 可以接续同一对话"></a>桌面端负责初始配置，iPhone 可以接续同一对话</h2><p>Grok Bot 桌面应用支持 Apple 芯片和 Intel 芯片的 macOS，也支持 x64 和 Arm64 架构的 Windows。iPhone 客户端需要 iOS 18 或更高版本。同一 Bot 的对话和状态会在已登录设备间同步，用户可以在电脑上创建任务，再用手机查看进度或处理审批。</p><p>初次使用时，先创建一个职责明确的 Bot，再给它一项有明确交付物的真实任务。稳定的处理步骤可以保存成 skill，也就是可重用的任务说明；需要定时执行时，再把它设为 routine。示范式教学可记录最长 10 分钟的可见操作，生成的流程仍应先用安全样例测试。</p><h2 id="多个-Bot-共用登录状态，不能当作权限隔离"><a href="#多个-Bot-共用登录状态，不能当作权限隔离" class="headerlink" title="多个 Bot 共用登录状态，不能当作权限隔离"></a>多个 Bot 共用登录状态，不能当作权限隔离</h2><p>云电脑按用户账号分配，而不是按 Bot 分配。在其中登录的网站、放入的文件和命令行凭证，会对同一账号下的其他 Bot 可用。因此，把财务、客户资料和普通调研分成多个 Bot，并不会自动形成安全边界。</p><p>密码、通行密钥、二次验证码、验证码和支付确认应由用户接管云电脑后亲自完成，不应发到普通聊天中。发送消息、发布内容、付款、删除数据、修改权限和生产环境变更可以设为必须审批的动作。Grok Bot 需要云端数据存储，无法在 Cursor 的 Legacy Privacy Mode 下运行；绑定工作账号前，应先核对组织的数据设置和安全要求。</p>]]></content>
    
    
    <summary type="html">Grok Bot 已扩展到 SuperGrok 三档个人套餐、Cursor 三档付费个人套餐和自助 Teams。本文说明它如何借助共享云电脑跨应用持续执行任务、桌面与 iOS 使用入口、独立周用量机制，以及登录凭证、审批与数据存储边界。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="xai" scheme="https://51allai.com/tags/xai/"/>
    
    <category term="grok" scheme="https://51allai.com/tags/grok/"/>
    
    <category term="cloud-agent" scheme="https://51allai.com/tags/cloud-agent/"/>
    
  </entry>
  
  <entry>
    <title>智谱开放 GLM-5.3-Flash 权重，支持图像输入与百万 Token 上下文</title>
    <link href="https://51allai.com/posts/2026/08/zhipu-glm-53-flash/"/>
    <id>https://51allai.com/posts/2026/08/zhipu-glm-53-flash/</id>
    <published>2026-08-27T01:32:34.000Z</published>
    <updated>2026-09-02T06:10:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>智谱于 2026 年 8 月 26 日发布 GLM-5.3-Flash，并以 MIT 许可证开放模型权重。该模型有 320B 总参数、18B 激活参数，支持图像输入和 100 万 Token 上下文，同时提供 API、Coding Plan 与本地部署入口。<br><img src="https://images.51allai.com/blog/zhipu-glm-53-flash-cover_20260827_093559.png" alt="智谱 GLM-5.3-Flash 开放权重与多模态能力封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="320B-参数中每次激活-18B"><a href="#320B-参数中每次激活-18B" class="headerlink" title="320B 参数中每次激活 18B"></a>320B 参数中每次激活 18B</h2><p>GLM-5.3-Flash 采用混合专家模型架构，总参数为 320B，生成每个 Token 时激活 18B 参数。Token 是模型读取和生成内容时的基本计量单位；“激活 18B”表示每次计算只调用部分专家参数，不代表本地运行时只需加载 18B 权重。</p><p>模型文件以 Safetensors 格式提供，主分支文件页显示体积约 328 GB，权重分为 62 个分片。这个规模超出多数普通个人电脑的直接加载能力。个人用户先用 API 或 Coding Plan 试用，比下载完整权重更省事；自建推理更适合已经具备多卡服务器和模型部署经验的团队。</p><h2 id="图像输入进入同一套模型"><a href="#图像输入进入同一套模型" class="headerlink" title="图像输入进入同一套模型"></a>图像输入进入同一套模型</h2><p>GLM-5.3-Flash 可以在同一个请求中接收文字与图像，并输出文字。开发者可在 <code>messages[].content[]</code> 中添加 <code>image_url</code> 内容块，传入公开图片地址或 Base64 数据；一次请求也可包含多张图片。</p><p>这个输入方式可用于分析界面截图、文档页面、图表和代码运行结果。100 万 Token 上下文则让一次任务容纳更多代码、长文档、图片和历史步骤。模型还支持函数调用、JSON 结构化输出、流式响应和上下文缓存，可接入需要多步操作的开发工具。</p><h2 id="API-限时半价，本地权重采用-MIT-许可证"><a href="#API-限时半价，本地权重采用-MIT-许可证" class="headerlink" title="API 限时半价，本地权重采用 MIT 许可证"></a>API 限时半价，本地权重采用 MIT 许可证</h2><p>GLM-5.3-Flash 的 API 模型代码为 <code>glm-5.3-flash</code>。标准单价按每 100 万 Token 计算：输入 0.15 美元、缓存命中输入 0.03 美元、输出 0.50 美元。2026 年 9 月 9 日 24:00（UTC+8）前为五折，对应单价是 0.075、0.015 和 0.25 美元。</p><p>Coding Plan 也已经接入该模型，可用额度是 GLM-5.3 的 3 倍。需要自建服务的团队可从模型仓库下载权重，通过 Transformers、vLLM、SGLang、KTransformers 或 Docker Model Runner 部署。MIT 许可证允许使用、修改、再分发和商业使用，再分发时需保留原版权与许可声明。</p><h2 id="怎么选试用入口"><a href="#怎么选试用入口" class="headerlink" title="怎么选试用入口"></a>怎么选试用入口</h2><p>只想比较图像理解、长文档处理或代码任务的用户，可以先用 API，按实际输入和输出量计费。需要在编程工具中连续完成多步任务时，Coding Plan 更容易控制套餐额度。</p><p>对数据不能离开自有环境、需要修改模型或已经有推理集群的团队，MIT 权重提供了自主部署路径。部署前需把权重存储、运行时显存、KV 缓存和最大上下文需求分开计算，不能只用 18B 激活参数估算机器配置。</p>]]></content>
    
    
    <summary type="html">智谱开放 GLM-5.3-Flash 模型权重，提供 320B 总参数、18B 激活参数、图像输入和 100 万 Token 上下文。本文梳理 MIT 许可证、API 价格、Coding Plan 和本地部署入口，帮助用户判断试用方式与硬件门槛。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="open-source" scheme="https://51allai.com/tags/open-source/"/>
    
    <category term="multimodal" scheme="https://51allai.com/tags/multimodal/"/>
    
    <category term="zhipu" scheme="https://51allai.com/tags/zhipu/"/>
    
    <category term="glm-5.3" scheme="https://51allai.com/tags/glm-5-3/"/>
    
  </entry>
  
  <entry>
    <title>ChatGPT 支持生成透明背景图像，可直接制作可复用素材</title>
    <link href="https://51allai.com/posts/2026/08/chatgpt-transparent-images/"/>
    <id>https://51allai.com/posts/2026/08/chatgpt-transparent-images/</id>
    <published>2026-08-25T16:44:20.000Z</published>
    <updated>2026-08-25T16:44:20.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>ChatGPT Images 现在可以按指令生成透明背景图像，也能把现有图片的背景改为透明。该能力覆盖所有 ChatGPT 套餐，并可在网页、iOS 和 Android 使用，适合制作贴纸、图标、商品抠图和演示文稿素材。<br><img src="https://images.51allai.com/blog/chatgpt-transparent-images-cover-v2_20260826_004830.png" alt="ChatGPT 透明背景图像生成与可复用素材" fetchpriority="high" decoding="async"></p></blockquote><h2 id="透明背景可以在生成时直接指定"><a href="#透明背景可以在生成时直接指定" class="headerlink" title="透明背景可以在生成时直接指定"></a>透明背景可以在生成时直接指定</h2><p>在 ChatGPT 对话中描述要制作的对象，并明确要求背景透明即可。也可以从“更多”菜单进入 Images，再输入生成要求。为了减少模型补出场景或底色，提示词应围绕单个主体展开。</p><p>例如，要制作一枚用于网页的图标，可以直接输入：</p><blockquote><p>生成一枚圆角 3D 咖啡杯图标，完整显示主体，背景透明，不要场景、桌面和投影。</p></blockquote><p>透明区域让同一张素材能直接叠加到不同颜色的网页、幻灯片或商品图上，不再需要先用抠图工具清除白底。贴纸、应用图标、商品主体和印花图案都适合这种工作方式。</p><h2 id="已有图片也能改成透明背景"><a href="#已有图片也能改成透明背景" class="headerlink" title="已有图片也能改成透明背景"></a>已有图片也能改成透明背景</h2><p>ChatGPT Images 支持编辑已经生成的图片，也可以先上传本地图片，再描述要修改的内容。用户可以框选背景区域后要求删除，也可以跳过框选，直接在对话中说明“保留主体，把背景改为透明”。</p><p>编辑器的选区不是像素级边界，修改有时会延伸到框选范围之外。处理头发、玻璃、半透明材质或柔和阴影时，保存后最好把图片分别放到深色和浅色背景上检查边缘，避免残留白边或误删细节。</p><h2 id="所有套餐均可使用"><a href="#所有套餐均可使用" class="headerlink" title="所有套餐均可使用"></a>所有套餐均可使用</h2><p>ChatGPT Images 2.0 面向所有套餐开放，网页、iOS 和 Android 都能创建和编辑图片。生成完成后，图片会保存在 Images 页面；打开图片后可以复制、保存到设备或分享。</p><p>这一入口不要求用户理解图层或蒙版。日常使用时，把主体、用途和透明背景写清楚即可；如果要修改局部，则补充具体位置，例如“只删除商品四周的背景，保留瓶身、标签和透明玻璃边缘”。</p><h2 id="GPT-image-2-API-同步支持透明输出"><a href="#GPT-image-2-API-同步支持透明输出" class="headerlink" title="GPT-image-2 API 同步支持透明输出"></a>GPT-image-2 API 同步支持透明输出</h2><p>需要批量制作素材的开发者可以在 GPT-image-2 API 中把 <code>background</code> 设为 <code>transparent</code>，并请求 PNG 输出。该能力目前处于预览阶段，适合把商品图、图标、贴纸和装饰元素接入自动化设计流程。</p><p>提示词仍会影响最终结果。如果提示词同时要求房间、桌面、天空或纯色底图，模型可能优先生成这些背景。要获得透明素材，应明确要求孤立主体、完整轮廓和真实透明区域，并删除与背景场景冲突的描述。</p>]]></content>
    
    
    <summary type="html">ChatGPT 现已支持按指令生成透明背景图像，免费与付费套餐均可使用。本文介绍网页端和移动端的操作入口、适合制作的素材类型，以及 GPT-image-2 API 的透明背景参数和使用注意事项。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
    <category term="image-generation" scheme="https://51allai.com/tags/image-generation/"/>
    
  </entry>
  
  <entry>
    <title>豆包发布“豆包工作”，桌面 Agent 接入飞书协作</title>
    <link href="https://51allai.com/posts/2026/08/doubao-work-desktop-agent/"/>
    <id>https://51allai.com/posts/2026/08/doubao-work-desktop-agent/</id>
    <published>2026-08-25T06:14:00.000Z</published>
    <updated>2026-08-25T06:14:00.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>豆包正式推出面向生产力场景的独立产品与品牌“豆包工作”。用户可下载独立电脑版，也可在最新豆包电脑版中使用；它能生成文档、表格、PPT 和网页，并在授权后连接飞书工作上下文。<br><img src="https://images.51allai.com/blog/doubao-work-desktop-agent-cover-5x2_20260825_141917.png" alt="豆包工作桌面 Agent 与飞书协作" fetchpriority="high" decoding="async"></p></blockquote><h2 id="从“工作任务”升级为独立产品"><a href="#从“工作任务”升级为独立产品" class="headerlink" title="从“工作任务”升级为独立产品"></a>从“工作任务”升级为独立产品</h2><p>8 月 25 日，豆包正式发布“豆包工作”。它不再只是豆包客户端里的一种任务模式，而是面向生产力场景的独立产品和品牌。用户可从<a href="https://www.doubao.com/work">豆包工作官网</a>下载电脑版，也可更新豆包电脑版后直接使用。</p><p>这里的 Agent 指能够根据一个目标拆分步骤、调用工具并继续执行的智能体。用户可以直接描述需要交付的结果，不必把每一步操作都改写成单独指令。</p><h2 id="从内容生成延伸到电脑操作"><a href="#从内容生成延伸到电脑操作" class="headerlink" title="从内容生成延伸到电脑操作"></a>从内容生成延伸到电脑操作</h2><p>豆包工作可以交付文档、表格、PPT、网页和创意内容。对已生成的文档、表格、PPT 或网页，用户可选中具体部分继续修改，不用每次重新生成整份内容。</p><p>在用户授权后，它还能操作浏览器和电脑，执行收集公开信息、填写表单、比对资料和跨软件处理等步骤。定时任务可用于周期性整理信息；需要长时间运行的工作可交给此前上线的<a href="/posts/2026/08/doubao-cloud-computer-work-tasks/">云电脑工作任务</a>继续处理。</p><h2 id="飞书连接提供企业工作上下文"><a href="#飞书连接提供企业工作上下文" class="headerlink" title="飞书连接提供企业工作上下文"></a>飞书连接提供企业工作上下文</h2><p>豆包工作团队版可连接飞书消息、日历、文档、表格和知识库。在用户授权和企业权限范围内，Agent 可结合项目资料、会议纪要和日程理解任务，减少用户反复上传文件和介绍项目背景的操作。</p><p>生成的文档、表格和汇报材料可继续在飞书中编辑和协作。原有文档权限仍用于控制访问范围，企业管理员可管理接入、权限和使用范围。</p><h2 id="技能、连接器和工作伙伴可按任务组合"><a href="#技能、连接器和工作伙伴可按任务组合" class="headerlink" title="技能、连接器和工作伙伴可按任务组合"></a>技能、连接器和工作伙伴可按任务组合</h2><p>豆包工作提供技能和连接器，用户可按数据分析、内容策划、科研或其他任务选择工具。“工作伙伴”则是面向专业分工的 Agent，多个工作伙伴可组成小队，分别处理同一任务中的不同环节。</p><p>个人用户不需要使用飞书才能运行普通工作任务。团队本来就在飞书中管理消息、文档和项目时，连接后才能直接利用这些已有工作上下文。</p><h2 id="下载后可领取-30-天订阅权益"><a href="#下载后可领取-30-天订阅权益" class="headerlink" title="下载后可领取 30 天订阅权益"></a>下载后可领取 30 天订阅权益</h2><p>用户可访问<a href="https://www.doubao.com/work">豆包工作官网</a>下载电脑版，或将豆包电脑版升级到最新版本。此次发布期间，下载登录或升级的用户可领取 30 天订阅权益。</p><p>首次交给 Agent 的任务适合从可验证的内部工作开始，例如整理一组文档、制作汇报初稿或比对表格数据。涉及对外发送、修改共享权限、提交表单或覆盖原文件时，在执行前检查目标、账号和交付内容。</p>]]></content>
    
    
    <summary type="html">豆包正式发布独立办公智能体“豆包工作”，提供文档、表格、PPT、网页生成及电脑和浏览器操作，并与飞书消息、日历、文档和知识库衔接。本文整理下载入口、协作方式与30天订阅权益。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="desktop-agent" scheme="https://51allai.com/tags/desktop-agent/"/>
    
    <category term="bytedance" scheme="https://51allai.com/tags/bytedance/"/>
    
    <category term="doubao" scheme="https://51allai.com/tags/doubao/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 为美国大学生提供 4 个月免费 ChatGPT Plus</title>
    <link href="https://51allai.com/posts/2026/08/openai-chatgpt-plus-student-offer/"/>
    <id>https://51allai.com/posts/2026/08/openai-chatgpt-plus-student-offer/</id>
    <published>2026-08-25T02:09:08.000Z</published>
    <updated>2026-08-25T02:09:08.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 面向美国符合条件的高校在读生提供 4 个月免费 ChatGPT Plus，价值 80 美元，须在 2026 年 10 月 31 日前领取。申请需通过 SheerID 验证；新订阅者需添加付款方式，App Store 和 Google Play 代扣用户不能把优惠应用到现有订阅。<br><img src="https://images.51allai.com/blog/openai-chatgpt-plus-student-offer-cover_20260825_101158.png" alt="OpenAI 美国大学生 4 个月免费 ChatGPT Plus 优惠" fetchpriority="high" decoding="async"></p></blockquote><h2 id="4-个月优惠覆盖完整-Plus-方案"><a href="#4-个月优惠覆盖完整-Plus-方案" class="headerlink" title="4 个月优惠覆盖完整 Plus 方案"></a>4 个月优惠覆盖完整 Plus 方案</h2><p>活动页的主标题把赠送内容写为 4 个月 ChatGPT Work，常见问题部分则明确为 4 个月 ChatGPT Plus，其中包含 ChatGPT Work 和其他 Plus 功能。这不是一份只能使用 Work 的独立套餐。</p><p>Plus 当前提供更高的消息和文件上传额度，以及扩展的图像生成、深度研究、记忆和上下文。学生也能使用项目、定时任务、自定义 GPT、Codex，以及桌面端、网页端和移动端的 ChatGPT Work。各项功能仍受 Plus 方案用量限制。</p><h2 id="全日制和非全日制学生都可申请"><a href="#全日制和非全日制学生都可申请" class="headerlink" title="全日制和非全日制学生都可申请"></a>全日制和非全日制学生都可申请</h2><p>申请人需是美国符合条件的学位授予高校在读生，全日制和非全日制都在活动范围内。资格由 SheerID 验证，具体可能通过可信的在读记录、学校单点登录（SSO）或证明文件完成。</p><p>ChatGPT 账号不必使用学校邮箱注册。用户可以登录想要领取优惠的个人账号，再使用学校发放的邮箱完成学生身份验证。</p><h2 id="领取时要注意订阅渠道"><a href="#领取时要注意订阅渠道" class="headerlink" title="领取时要注意订阅渠道"></a>领取时要注意订阅渠道</h2><p>领取入口会先要求用户登录 ChatGPT，然后进入 SheerID 验证流程。新开通 Plus 的用户需要添加付款方式，4 个月免费期内不收费。</p><p>已有 Plus 订阅也可以领取，前提是订阅由 ChatGPT 直接计费。通过 Apple App Store 或 Google Play 付费的订阅不支持直接套用此优惠。如果在 4 个月优惠结束前取消，免费 Plus 只会保留到当前计费周期结束，剩余免费月份不再继续。</p><h2 id="从课程材料直接开始学习任务"><a href="#从课程材料直接开始学习任务" class="headerlink" title="从课程材料直接开始学习任务"></a>从课程材料直接开始学习任务</h2><p>ChatGPT Work 可连接邮箱、文件和日历，用于查找课程材料并组织后续任务。上传笔记、阅读材料和数据后，可以制作演示文稿、构建应用或处理多步项目。</p><p>学生还可用语音对话练习面试和演示，或把学习内容转成交互式测验、图表和信息图。对需要处理长文档、资料整理和课程项目的学生，这些是与免费方案最直接的差异。</p><p>符合条件的学生可从<a href="https://chatgpt.com/students/2026">活动页面</a>登录账号并开始验证。</p>]]></content>
    
    
    <summary type="html">OpenAI 面向美国符合条件的高校在读生提供 4 个月免费 ChatGPT Plus，领取截止 2026 年 10 月 31 日。本文梳理 SheerID 验证、付款方式、现有订阅限制，以及 ChatGPT Work、Codex 和深度研究等可用功能。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 为 Plus 恢复五小时用量窗口，Codex 与 ChatGPT Work 共享额度</title>
    <link href="https://51allai.com/posts/2026/08/openai-plus-codex-five-hour-limit/"/>
    <id>https://51allai.com/posts/2026/08/openai-plus-codex-five-hour-limit/</id>
    <published>2026-08-25T02:00:16.000Z</published>
    <updated>2026-08-25T02:00:16.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 为 ChatGPT Plus 恢复五小时用量窗口，适用于 ChatGPT Work 与 Codex。100 美元和 200 美元 Pro 套餐未来数月暂不启用该窗口；各档套餐仍按自己的每周额度计算用量。<br><img src="https://images.51allai.com/blog/openai-plus-codex-five-hour-limit-cover_20260825_100350.png" alt="OpenAI Plus 恢复 Codex 五小时用量窗口" fetchpriority="high" decoding="async"></p></blockquote><h2 id="本轮只为-Plus-恢复五小时窗口"><a href="#本轮只为-Plus-恢复五小时窗口" class="headerlink" title="本轮只为 Plus 恢复五小时窗口"></a>本轮只为 Plus 恢复五小时窗口</h2><p>ChatGPT Plus 用户使用 Codex 和 ChatGPT Work 时，将再次受到五小时用量窗口约束。此前恢复计划曾被延后，用户可以连续消耗套餐内的每周用量；新规则生效后，Plus 在短时间内可使用的额度重新受到限制。</p><p>五小时窗口不是固定的消息条数。同一条指令需要读取多少上下文、调用哪些工具、在本地还是云端执行，都会影响消耗。长时间运行的任务、大型代码库和包含图片的会话，通常比短脚本或单个函数更快用完额度。</p><p>五小时窗口也不会替代每周上限。用户即使没有耗尽当前窗口，仍可能因为一周内的累计使用量达到套餐上限而暂停使用。</p><p>100 美元和 200 美元 Pro 套餐未来数月继续不启用五小时窗口。Pro 用户仍有套餐对应的每周额度，这项临时安排不等于不限量使用。</p><p><img src="https://images.51allai.com/blog/%E6%88%AA%E5%B1%8F_2026-08-25_10.00.54@2x_20260825_100426.png" alt="OpenAI Plus 恢复 Codex 五小时用量窗口" loading="lazy" decoding="async"></p><h2 id="ChatGPT-Work-与-Codex-共用额度"><a href="#ChatGPT-Work-与-Codex-共用额度" class="headerlink" title="ChatGPT Work 与 Codex 共用额度"></a>ChatGPT Work 与 Codex 共用额度</h2><p>ChatGPT Work 是 ChatGPT 中面向长任务和工具操作的工作模式。它与 Codex 使用同一套价格、ChatGPT 额度和用量限制。在 ChatGPT Work 中启动任务，会消耗原本可用于 Codex 的额度，反过来也一样。</p><p>Codex 的本地消息与云端任务同样共用五小时窗口。本地消息包括桌面应用、命令行和 IDE 扩展中的交互；云端任务则在远程环境中执行。用户同时在多个入口运行任务时，需要把它们视为同一份用量，而不是几套独立额度。</p><h2 id="Plus-每月-20-美元，Pro-提供更高周额度"><a href="#Plus-每月-20-美元，Pro-提供更高周额度" class="headerlink" title="Plus 每月 20 美元，Pro 提供更高周额度"></a>Plus 每月 20 美元，Pro 提供更高周额度</h2><p>Plus 价格为每月 20 美元，包含网页版、命令行、IDE 扩展和 iOS 上的 Codex。100 美元 Pro 提供 Plus 的 5 倍 Codex 用量，200 美元 Pro 提供 20 倍用量。</p><p>用量不是按提示词数量等额扣除。模型选择、任务复杂度、上下文长度、推理、工具调用、检索和缓存都会改变一次任务的实际消耗，因此两个看起来相近的任务也可能占用不同额度。</p><h2 id="达到限额后怎么继续"><a href="#达到限额后怎么继续" class="headerlink" title="达到限额后怎么继续"></a>达到限额后怎么继续</h2><p>如果在一次任务执行过程中达到限额，当前回合可以继续完成。后续任务需要等待额度恢复，或购买额外的 ChatGPT 额度。</p><p>用户也可以切换到 GPT-5.6 Luna。Luna 面向高频、范围明确的任务，同样的套餐额度通常可以支持更多消息。需要继续使用其他模型时，还可以在本地 Codex 中改用 API 密钥，按 API 的 Token 用量单独计费；这部分不占用 ChatGPT 套餐额度。</p>]]></content>
    
    
    <summary type="html">OpenAI 为 ChatGPT Plus 恢复 Codex 五小时用量窗口，ChatGPT Work 与 Codex 共用额度；100 美元和 200 美元 Pro 套餐未来数月暂不启用该窗口。本文说明 Plus 与 Pro 的规则差异、每周上限和达到限额后的继续使用方式。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="codex" scheme="https://51allai.com/tags/codex/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
  </entry>
  
  <entry>
    <title>阿里云正式上线 Wan3.0，API 首月限时七折</title>
    <link href="https://51allai.com/posts/2026/08/alibaba-wan3-api-discount/"/>
    <id>https://51allai.com/posts/2026/08/alibaba-wan3-api-discount/</id>
    <published>2026-08-24T07:49:02.000Z</published>
    <updated>2026-08-24T07:49:02.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>阿里云于 2026 年 8 月 24 日正式上线 Wan3.0。标准版 API 至 9 月 23 日限时七折，480P、720P、1080P 折后分别为 0.21、0.42、0.84 元&#x2F;秒；模型支持生成最长 30 秒的视频。<br><img src="https://images.51allai.com/blog/alibaba-wan3-api-discount-cover_20260824_155550.png" alt="阿里云 Wan3.0 正式上线与 API 限时七折封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="从公测转入正式服务"><a href="#从公测转入正式服务" class="headerlink" title="从公测转入正式服务"></a>从公测转入正式服务</h2><p>Wan3.0 的 API 模型 ID 为 <code>wan3.0-video</code>。它把文生视频、首帧或首尾帧图生视频、参考生视频放在同一个模型中，可接收文字、图像、视频、音频、文件和网页链接。输出分辨率支持 480P、720P 和 1080P，视频时长最长 30 秒。本站此前已整理<a href="/posts/2026/08/alibaba-wan3-public-beta/">公测阶段的功能范围</a>，正式服务沿用了这些主要输入与输出能力。</p><p>正式上线后，开发者可以在<a href="https://help.aliyun.com/zh/model-studio/wan3-0-video">阿里云百炼 Wan3.0 模型文档</a>核对模型规格和当前价格，创建 API Key 并调用异步视频生成接口。异步调用会先返回任务 ID，应用再轮询任务状态取得成片，适合把生成步骤接入现有内容工具或工作流。</p><h2 id="七折活动持续至-9-月-23-日"><a href="#七折活动持续至-9-月-23-日" class="headerlink" title="七折活动持续至 9 月 23 日"></a>七折活动持续至 9 月 23 日</h2><p>Wan3.0 标准版 API 的中国内地原价按分辨率计算：480P 为 0.3 元&#x2F;秒，720P 为 0.6 元&#x2F;秒，1080P 为 1.2 元&#x2F;秒。8 月 24 日至 9 月 23 日，阿里云百炼和千问 AI 平台提供限时七折，折后价分别是 0.21、0.42 和 0.84 元&#x2F;秒。</p><table><thead><tr><th>分辨率</th><th align="right">原价</th><th align="right">七折价</th><th align="right">30 秒输出原价</th><th align="right">30 秒输出折后价</th></tr></thead><tbody><tr><td>480P</td><td align="right">0.30 元&#x2F;秒</td><td align="right">0.21 元&#x2F;秒</td><td align="right">9 元</td><td align="right">6.3 元</td></tr><tr><td>720P</td><td align="right">0.60 元&#x2F;秒</td><td align="right">0.42 元&#x2F;秒</td><td align="right">18 元</td><td align="right">12.6 元</td></tr><tr><td>1080P</td><td align="right">1.20 元&#x2F;秒</td><td align="right">0.84 元&#x2F;秒</td><td align="right">36 元</td><td align="right">25.2 元</td></tr></tbody></table><p>表中 30 秒成本只计算输出视频。如果任务还输入了视频素材，计费时长为输入视频时长与成功输出时长之和。例如，使用 5 秒参考视频生成 30 秒 720P 成片，七折期间按 35 秒计费，费用为 14.7 元。</p><h2 id="调用前先确定分辨率和输入时长"><a href="#调用前先确定分辨率和输入时长" class="headerlink" title="调用前先确定分辨率和输入时长"></a>调用前先确定分辨率和输入时长</h2><p>480P 适合快速打样和验证提示词；720P 可用于多数网络视频工作流；1080P 的单价是 720P 的两倍，更适合已确定内容和镜头的成片。批量生成时，先用较低分辨率确认构图、动作和时长，再对选定方案输出高分辨率版本，更容易控制试错成本。</p><p>百炼的中国内地服务使用华北 2（北京）地域。调用时，模型、API Key 和接口地域需要保持一致；跨地域组合会导致请求失败。对于需要处理参考视频的任务，还要把输入时长纳入预算，而不是只按成片秒数估算。</p>]]></content>
    
    
    <summary type="html">阿里云正式上线 Wan3.0 视频生成模型，标准版 API 于 2026 年 8 月 24 日至 9 月 23 日限时七折。本文整理三档分辨率的原价与折后价、30 秒视频成本、计费方式和百炼接入要点，说明输入参考视频时如何计算总时长，帮助开发者避免低估实际调用费用。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="video-generation" scheme="https://51allai.com/tags/video-generation/"/>
    
    <category term="alibaba" scheme="https://51allai.com/tags/alibaba/"/>
    
    <category term="wan" scheme="https://51allai.com/tags/wan/"/>
    
  </entry>
  
  <entry>
    <title>ChatGPT Search 大幅增加定向网站检索，GEO 策略转向官网内容</title>
    <link href="https://51allai.com/posts/2026/08/chatgpt-search-site-query-geo/"/>
    <id>https://51allai.com/posts/2026/08/chatgpt-search-site-query-geo/</id>
    <published>2026-08-24T02:28:07.000Z</published>
    <updated>2026-08-24T02:28:07.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>ChatGPT Search 的第三方监测样本显示，限定特定域名的后台检索占比在 8 月 8 日由 0.37% 升至 16.8%，每次回答的平均后台检索数也从约 1.08 次增至 1.83 次。对网站而言，官网内容能否被搜索服务收录、单页能否独立回答问题，开始直接影响进入 AI 答案的机会。<br><img src="https://images.51allai.com/blog/chatgpt-search-site-query-geo-cover_20260824_103808.png" alt="ChatGPT Search 定向网站检索与 GEO 策略变化" fetchpriority="high" decoding="async"></p></blockquote><h2 id="一天内从-0-37-升至-16-8"><a href="#一天内从-0-37-升至-16-8" class="headerlink" title="一天内从 0.37% 升至 16.8%"></a>一天内从 0.37% 升至 16.8%</h2><p>ChatGPT Search 会把用户的问题拆成若干条后台搜索词，再用检索结果组织答案。这些搜索词通常被称为 query fanout，中文可理解为“查询分流”：一个问题可以触发多次不同角度的搜索。</p><p><a href="https://promptwatch.com/data/chatgpt-site-operator-fanouts">Promptwatch 公布的连续监测样本</a>记录到，包含 <code>site:</code> 限定符的查询占比在 2026 年 8 月 7 日为 0.37%，8 月 8 日升至 16.8%。<code>site:example.com 关键词</code> 只在指定域名中找页面，相当于先选定信息来源，再检索相关内容。</p><p><img src="https://images.51allai.com/blog/chatgpt-search-site-query-share-chart_20260824_103808.png" alt="ChatGPT Search site 限定查询占比变化折线图" loading="lazy" decoding="async"></p><p>同一天，每次回答触发的平均后台检索数从约 1.08 次升至 1.83 次，随后几天仍处于接近水平。两组曲线同步变化，说明定向网站查询更像是新增的检索步骤，而不是简单替换原有的开放网页搜索。</p><p><img src="https://images.51allai.com/blog/chatgpt-search-query-fanouts-chart_20260824_103808.png" alt="ChatGPT Search 每次回答平均后台检索数变化折线图" loading="lazy" decoding="async"></p><p>这组数据覆盖的是第三方平台持续追踪的提示词样本，不代表所有 ChatGPT 对话，也不能单独证明 OpenAI 更换了搜索架构。能够确认的是：样本中的可观测检索行为在同一天发生了明显变化，而且持续了数日。</p><h2 id="“定向检索”不等于直接抓取网站"><a href="#“定向检索”不等于直接抓取网站" class="headerlink" title="“定向检索”不等于直接抓取网站"></a>“定向检索”不等于直接抓取网站</h2><p><code>site:</code> 是搜索查询限定符。ChatGPT 可以把这类查询发送给合作搜索服务，从已经建立的网页索引中查找指定域名的内容。它和爬虫直接访问网站是两个环节。</p><p><a href="https://help.openai.com/en/articles/12627856-publishers-and-developers-faq">OpenAI 面向发布者的说明</a>将搜索相关访问分为不同用途。OAI-SearchBot 用于发现和收录可能出现在 ChatGPT 搜索结果中的网页；ChatGPT-User 负责响应用户触发的网页访问；GPTBot 则与模型训练数据收集相关。站长可以单独允许搜索收录，同时拒绝训练用途的抓取。</p><p>因此，把这次变化称为“大规模定点搜刮”并不准确。现有证据指向的是后台查询更频繁地限定域名，不代表 ChatGPT 绕过搜索索引，对这些网站进行整站抓取。</p><h2 id="GEO-的重心回到第一方官网"><a href="#GEO-的重心回到第一方官网" class="headerlink" title="GEO 的重心回到第一方官网"></a>GEO 的重心回到第一方官网</h2><p>当后台搜索先指定域名，再寻找价格、功能、比较或使用条件时，官网不再只是品牌介绍页。它会成为 AI 搜索的直接检索面。</p><p>站点需要先解决可访问和可收录问题：允许 OAI-SearchBot，确认防火墙或 CDN 没有误拦 OpenAI 公布的搜索爬虫 IP，并让重要页面返回可解析的正文。仅在首页堆放品牌口号，无法替代独立的产品页、价格页、功能说明和限制说明。</p><p>每个页面还要能单独成立。AI 搜索可能通过一条限定域名的查询直接落到深层页面，不会先阅读首页再补齐背景。页面开头应直接写清对象、结论和适用范围；标题与小标题使用用户会搜索的产品名和问题；关键数字带单位、时间和比较对象。</p><p>站内内容覆盖也需要从“核心关键词”扩展到真实决策问题。价格、功能差异、适用人群、兼容范围和常见限制，可能分别触发不同的后台查询。把这些信息全部藏在一篇宽泛长文里，会降低单次检索命中准确答案的机会。</p><h2 id="GEO-监测不能只看引用次数"><a href="#GEO-监测不能只看引用次数" class="headerlink" title="GEO 监测不能只看引用次数"></a>GEO 监测不能只看引用次数</h2><p>一次平台更新就能改变后台查询组合。固定提示词在更新前后的结果，可能来自不同数量、不同范围的检索，因此只看某天的引用排名容易误判内容效果。</p><p>更稳妥的监测方式是把四类数据放在一起：固定提示词的引用变化、<code>chatgpt.com</code> 引荐访问、OAI-SearchBot 与 ChatGPT-User 的服务器日志，以及重要页面在搜索服务中的收录状态。出现波动时，先判断检索机制、索引覆盖还是页面内容发生了变化，再决定是否重写内容。</p><p>第三方社区、评测站和媒体仍能提供信任与口碑信号，但官网是品牌可以直接维护的事实来源。定向网站检索增加后，缺失的价格页、过期的产品说明和无法抓取的 JavaScript 内容，都会变成具体的 GEO 缺口。</p>]]></content>
    
    
    <summary type="html">ChatGPT Search 的第三方监测样本显示，限定特定域名的后台检索占比在一天内由 0.37% 升至 16.8%。本文解释 site: 定向检索与网页抓取的区别，并梳理官网收录、内容结构、第一方信息和 GEO 监测指标需要做出的调整，给出可执行的检查清单。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
    <category term="ai-search" scheme="https://51allai.com/tags/ai-search/"/>
    
  </entry>
  
  <entry>
    <title>DeepSeek 调整 API 峰谷计费，周末全天执行低谷价</title>
    <link href="https://51allai.com/posts/2026/08/deepseek-api-weekend-off-peak-pricing/"/>
    <id>https://51allai.com/posts/2026/08/deepseek-api-weekend-off-peak-pricing/</id>
    <published>2026-08-22T15:20:59.000Z</published>
    <updated>2026-08-22T15:20:59.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>DeepSeek API 将于北京时间 2026 年 8 月 23 日 00:00 调整峰谷计费。周六、周日全天统一按低谷价收费；工作日仍按 9:00–12:00、14:00–18:00 为高峰时段，其余时间执行低谷价。<br><img src="https://images.51allai.com/blog/deepseek-api-weekend-off-peak-pricing-cover_20260822_232514.png" alt="DeepSeek API 周末全天低谷价计费调整" fetchpriority="high" decoding="async"></p></blockquote><h2 id="周末不再设置高峰价"><a href="#周末不再设置高峰价" class="headerlink" title="周末不再设置高峰价"></a>周末不再设置高峰价</h2><p>DeepSeek 把 API 峰谷计费拆成了工作日和周末两套规则。新规则生效后，周一至周五继续在北京时间 9:00–12:00、14:00–18:00 按高峰价计费，其余时段为低谷价。周六和周日则不再按时钟切换价格，24 小时都执行低谷价。</p><p>调整从 8 月 23 日 00:00 起生效。这一时点是周日，因此首个适用日是 8 月 23 日；之后的完整周末都按新规则计费。</p><h2 id="每个完整周末有-14-小时从高峰价切换为低谷价"><a href="#每个完整周末有-14-小时从高峰价切换为低谷价" class="headerlink" title="每个完整周末有 14 小时从高峰价切换为低谷价"></a>每个完整周末有 14 小时从高峰价切换为低谷价</h2><p>按现行时段划分，每天原有 7 小时高峰时段，一个完整周末共 14 小时。低谷价是高峰价的一半，所以在这 14 小时内发起同等 Token 用量的请求，单价会比调整前低 50%。</p><p>这一变化对可延后执行的任务更直接。批量摘要、离线分析、索引更新和自动评测可以放到周末任意时段，不必再避开白天的两段高峰时间。</p><h2 id="V4-Flash-与-V4-Pro-周末按同一张低谷价表扣费"><a href="#V4-Flash-与-V4-Pro-周末按同一张低谷价表扣费" class="headerlink" title="V4 Flash 与 V4 Pro 周末按同一张低谷价表扣费"></a>V4 Flash 与 V4 Pro 周末按同一张低谷价表扣费</h2><p>价格按每 100 万 Token 计算。Token 是模型处理文本时的计量单位；输入又根据是否命中缓存分为两档。</p><table><thead><tr><th>模型</th><th align="right">输入（缓存命中）</th><th align="right">输入（缓存未命中）</th><th align="right">输出</th></tr></thead><tbody><tr><td>DeepSeek V4 Flash</td><td align="right">0.05 元</td><td align="right">1.5 元</td><td align="right">4.5 元</td></tr><tr><td>DeepSeek V4 Pro</td><td align="right">0.15 元</td><td align="right">4.5 元</td><td align="right">13.5 元</td></tr></tbody></table><p>DeepSeek V4 Flash Vision Exp 的三项低谷单价与 V4 Flash 相同。它接收的图片会先按尺寸换算成 Token，再与文本 Token 一起计费。</p><h2 id="调整对象是-DeepSeek-API-调用"><a href="#调整对象是-DeepSeek-API-调用" class="headerlink" title="调整对象是 DeepSeek API 调用"></a>调整对象是 DeepSeek API 调用</h2><p>这套规则作用于通过 API Key 发起、按 Token 扣费的 DeepSeek API 请求。使用网页端或 App 对话的用户，不需要把这张 API 价格表直接换算成客户端费用。</p><p>对已经记录 Token 用量的项目，可以保持现有的输入、输出和缓存命中统计方式，再按请求发生的工作日或周末重新计算预算。</p>]]></content>
    
    
    <summary type="html">DeepSeek API 将于 2026 年 8 月 23 日起调整峰谷计费，周六、周日全天统一按低谷价收费。本文梳理生效时间、工作日高峰时段、V4 Flash 与 V4 Pro 单价，并说明周末批处理任务如何按缓存命中、未命中输入与输出分别估算成本，帮助开发者调整任务时间和预算。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="deepseek" scheme="https://51allai.com/tags/deepseek/"/>
    
    <category term="deepseek-v4" scheme="https://51allai.com/tags/deepseek-v4/"/>
    
  </entry>
  
  <entry>
    <title>DeepSeek 上线 V4-Flash-Vision-Exp，API 新增图像输入</title>
    <link href="https://51allai.com/posts/2026/08/deepseek-v4-flash-vision-exp/"/>
    <id>https://51allai.com/posts/2026/08/deepseek-v4-flash-vision-exp/</id>
    <published>2026-08-21T14:32:36.000Z</published>
    <updated>2026-08-21T14:32:36.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API。开发者把模型名设为 <code>deepseek-v4-flash-vision-exp</code>，即可在请求中同时发送文字与图片；图片按输入 Token 计费，单张最多折算 384 Token，价格与 V4 Flash 相同。<br><img src="https://images.51allai.com/blog/deepseek-v4-flash-vision-exp-cover-5x2_20260821_223449.png" alt="DeepSeek V4 Flash Vision Exp 图像输入 API 封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="实验模型把图像输入接入-V4-Flash"><a href="#实验模型把图像输入接入-V4-Flash" class="headerlink" title="实验模型把图像输入接入 V4 Flash"></a>实验模型把图像输入接入 V4 Flash</h2><p>DeepSeek-V4-Flash-Vision-Exp 是面向 API 的实验性视觉理解模型。它可以接收图片和文字，用于描述图片、读取截图中的文字、分析图表等任务。<a href="https://api-docs.deepseek.com/zh-cn/guides/vision">DeepSeek 图像输入文档</a>列出了传图方式和请求限制；调用地址仍为 <code>https://api.deepseek.com</code>，模型参数需要写成 <code>deepseek-v4-flash-vision-exp</code>。</p><p>模型支持 100 万 Token 上下文和 38.4 万 Token 最大输出，同时提供思考与非思考模式。JSON 输出、工具调用、Responses API 和 Anthropic API 均可使用；FIM 补全不在支持范围内。FIM 是根据光标前后内容补写中间文本或代码的接口能力。</p><p>对于已经通过 OpenAI 兼容接口调用 DeepSeek 的项目，这次接入不需要更换基础地址。下面的 Chat Completions 请求通过公开图片 URL 传入一张图片：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">from</span> openai <span class="keyword">import</span> OpenAI</span><br><span class="line"></span><br><span class="line">client = OpenAI(</span><br><span class="line">    api_key=<span class="string">&quot;&lt;your DeepSeek API Key&gt;&quot;</span>,</span><br><span class="line">    base_url=<span class="string">&quot;https://api.deepseek.com&quot;</span>,</span><br><span class="line">)</span><br><span class="line"></span><br><span class="line">response = client.chat.completions.create(</span><br><span class="line">    model=<span class="string">&quot;deepseek-v4-flash-vision-exp&quot;</span>,</span><br><span class="line">    messages=[&#123;</span><br><span class="line">        <span class="string">&quot;role&quot;</span>: <span class="string">&quot;user&quot;</span>,</span><br><span class="line">        <span class="string">&quot;content&quot;</span>: [</span><br><span class="line">            &#123;<span class="string">&quot;type&quot;</span>: <span class="string">&quot;text&quot;</span>, <span class="string">&quot;text&quot;</span>: <span class="string">&quot;请描述这张图片。&quot;</span>&#125;,</span><br><span class="line">            &#123;</span><br><span class="line">                <span class="string">&quot;type&quot;</span>: <span class="string">&quot;image_url&quot;</span>,</span><br><span class="line">                <span class="string">&quot;image_url&quot;</span>: &#123;<span class="string">&quot;url&quot;</span>: <span class="string">&quot;https://example.com/image.jpg&quot;</span>&#125;,</span><br><span class="line">            &#125;,</span><br><span class="line">        ],</span><br><span class="line">    &#125;],</span><br><span class="line">)</span><br><span class="line"></span><br><span class="line"><span class="built_in">print</span>(response.choices[<span class="number">0</span>].message.content)</span><br></pre></td></tr></table></figure><h2 id="图片可以通过三种方式传入"><a href="#图片可以通过三种方式传入" class="headerlink" title="图片可以通过三种方式传入"></a>图片可以通过三种方式传入</h2><p>本地图片可以转成 Base64 后直接放进请求，公开图片可以使用 HTTP 或 HTTPS 地址，也可以先上传到 Files API，再通过 <code>file_id</code> 引用。重复分析同一张图片时，Files API 能避免每次请求都重新传输完整文件。</p><p>支持的格式包括 JPEG、PNG、GIF 和 WebP。服务会根据文件实际内容判断格式，不依赖文件扩展名或请求中声明的 MIME 类型。通过 Base64 或外部 URL 传入时，单张图片上限为 32 MiB；使用 Files API 的 <code>file_id</code> 时，单张上限为 64 MiB。</p><p>图片只能放在 <code>user</code> 消息中。把图片放进 <code>system</code> 或 <code>assistant</code> 消息会返回 400 错误，其他不支持视觉输入的 DeepSeek 模型也会拒绝图片请求。</p><h2 id="单张图片最多计入-384-Token"><a href="#单张图片最多计入-384-Token" class="headerlink" title="单张图片最多计入 384 Token"></a>单张图片最多计入 384 Token</h2><p>图片会先按尺寸缩放，再转换成输入 Token。较大的图片会保持宽高比缩小到总像素量约等于 800×800，因此单张图片最多计入 384 Token。一个请求包含多张图片时，每张图分别计算，没有额外的多图合并计费公式。</p><p>计费单价与 V4 Flash 相同。按每 100 万 Token 计算，非高峰期缓存命中输入为 0.007 美元、未命中输入为 0.22 美元、输出为 0.66 美元；高峰期分别为 0.014 美元、0.44 美元和 1.32 美元。图片 Token 与文字输入 Token 合并计费。</p><p>对不需要细节的图片，可以把 <code>detail</code> 设为 <code>low</code>。服务会先把图片缩放到 512×512，以减少处理时间和输入成本；需要读取小字或观察细节时，可使用保留原图的 <code>original</code> 模式。</p><h2 id="对开发者的影响：请求规模取决于传图方式"><a href="#对开发者的影响：请求规模取决于传图方式" class="headerlink" title="对开发者的影响：请求规模取决于传图方式"></a>对开发者的影响：请求规模取决于传图方式</h2><p>Base64 图片会占用 48 MiB 的请求体限额。外部图片 URL 最长为 8192 个字符，下载必须在 60 秒内完成。单次请求最多可以包含 600 张图片；不含 Files API 图片时，图片总大小上限为 64 MiB，包含 <code>file_id</code> 图片后总上限可以达到 200 MiB。</p><p>单张图片每边最长为 8192 像素。当一次请求包含 15 张或更多图片时，每边上限降至 4096 像素。批量处理截图、扫描件或图表时，需要在客户端先检查数量、尺寸和总文件大小，避免请求在模型处理前被接口拒绝。</p>]]></content>
    
    
    <summary type="html">DeepSeek-V4-Flash-Vision-Exp 已上线 API，支持图片与文本混合输入，价格与 V4 Flash 相同。本文梳理模型调用方式、三种图片传入方法、单图 384 Token 计费上限、文件格式与请求限制，帮助开发者快速评估图像理解、截图识别和图表分析场景的接入成本。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="deepseek" scheme="https://51allai.com/tags/deepseek/"/>
    
    <category term="deepseek-v4" scheme="https://51allai.com/tags/deepseek-v4/"/>
    
    <category term="multimodal" scheme="https://51allai.com/tags/multimodal/"/>
    
  </entry>
  
</feed>
