<?xml version="1.0" encoding="utf-8"?>
<feed xmlns="http://www.w3.org/2005/Atom">
  <title>51AllAI</title>
  
  <subtitle>探索 AI 的无限可能</subtitle>
  <link href="https://51allai.com/atom.xml" rel="self"/>
  
  <link href="https://51allai.com/"/>
  <updated>2026-07-31T07:24:39.000Z</updated>
  <id>https://51allai.com/</id>
  
  <author>
    <name>51ALLAI</name>
    
  </author>
  
  <generator uri="https://hexo.io/">Hexo</generator>
  
  <entry>
    <title>字节跳动发布 Seedance 2.5，单次生成 30 秒并支持定向编辑</title>
    <link href="https://51allai.com/posts/2026/07/seedance-25-video-editing/"/>
    <id>https://51allai.com/posts/2026/07/seedance-25-video-editing/</id>
    <published>2026-07-31T07:24:39.000Z</published>
    <updated>2026-07-31T07:24:39.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>字节跳动正式发布视频创作模型 Seedance 2.5。新模型单次可生成 30 秒视频，支持多轮延长、图片视频音频混合参考和时间戳定向编辑，正在陆续上线即梦 AI 网页端与豆包专业版。<br><img src="https://images.51allai.com/blog/seedance-25-video-editing-cover_20260731_152935.png" alt="Seedance 2.5 视频生成与定向编辑能力" fetchpriority="high" decoding="async"></p></blockquote><h2 id="单次生成时长提升到-30-秒"><a href="#单次生成时长提升到-30-秒" class="headerlink" title="单次生成时长提升到 30 秒"></a>单次生成时长提升到 30 秒</h2><p>Seedance 2.5 延续统一的音视频联合生成架构，一次生成画面与声音。单次视频长度从 Seedance 2.0 的 15 秒提升到 30 秒，创作者可以在一个结果中安排更多镜头和更完整的情节，不必先把内容拆成多个短片段。</p><p>模型还支持在已有结果上继续延长视频。延长不是简单重复最后一帧，而是接着原有主体、场景和叙事节奏生成后续镜头。对剧情短片、广告分镜和教学演示来说，这种方式可以减少手工拼接片段和处理转场的步骤。</p><p>“支持多轮延长”不等于一次直接生成数分钟视频。用户先生成最长 30 秒的片段，再以已有结果为基础继续生成后续内容。</p><h2 id="一次最多参考-50-个素材"><a href="#一次最多参考-50-个素材" class="headerlink" title="一次最多参考 50 个素材"></a>一次最多参考 50 个素材</h2><p>Seedance 2.5 单次最多可接收 30 张图片、10 段视频和 10 段音频。图片可以用来指定角色、场景或视觉风格，视频可以提供动作与运镜参考，音频则可用于表达节奏、对白或声音方向。</p><p>多种素材可以在同一次创作中组合使用。例如，用户可以用角色图片锁定人物外观，用一段视频指定镜头运动，再加入音频控制整体节奏。相比只用文字提示词，这种输入方式更适合需要多个主体、多个场景或连续镜头的内容。</p><p>模型也加强了白模、运动和创意参考。白模是没有贴图材质的 3D 场景或物体，创作者可以先用它确定空间结构、主体姿态、运动轨迹和镜头位置，再让模型生成带有材质、色彩和光照的画面。这样做的重点是先固定构图与调度，再处理视觉表现。</p><h2 id="可以按时间段修改音视频内容"><a href="#可以按时间段修改音视频内容" class="headerlink" title="可以按时间段修改音视频内容"></a>可以按时间段修改音视频内容</h2><p>Seedance 2.5 加入时间戳控制。生成前，用户可以在提示词中说明某个时间段应出现的情节、视角、运镜和节奏；生成后，也可以选择指定片段，修改其中的角色、动作、声音或剧情，而不必从头生成整条视频。</p><p>模型同时支持绿幕编辑、视角与运镜编辑、参考编辑。绿幕素材可以保留主体并替换背景；视角与运镜编辑用于调整观察方向和镜头运动；参考编辑则让新结果按照给定图片或视频的内容进行修改。对只需要更换商品、背景或部分动作的任务，定向编辑比整段重做更直接。</p><p>这些能力把“生成”和“修改”放进同一套流程。用户可以先得到一版视频，再针对不符合要求的时间段继续调整，适合需要反复修改的广告、短片和演示内容。</p><h2 id="普通用户可以从两个入口体验"><a href="#普通用户可以从两个入口体验" class="headerlink" title="普通用户可以从两个入口体验"></a>普通用户可以从两个入口体验</h2><p>Seedance 2.5 正在陆续上线即梦 AI 网页端和豆包专业版。进入对应产品的视频生成功能后，在模型选择中找到 Seedance 2.5 即可使用。</p><p>面向开发者和企业用户的火山方舟 API 将在后续上线。当前可直接使用的入口以即梦 AI 网页端和豆包专业版为主。</p>]]></content>
    
    
    <summary type="html">字节跳动正式发布视频创作模型 Seedance 2.5，单次可生成 30 秒视频，并支持多轮延长、最多 50 个图片视频音频参考素材和时间戳定向编辑。本文梳理主要变化，并说明如何通过即梦 AI 网页端和豆包专业版开始体验。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="video-generation" scheme="https://51allai.com/tags/video-generation/"/>
    
    <category term="bytedance" scheme="https://51allai.com/tags/bytedance/"/>
    
    <category term="seedance" scheme="https://51allai.com/tags/seedance/"/>
    
  </entry>
  
  <entry>
    <title>DeepSeek-V4-Flash 正式版 API 上线公测，原生接入 Codex</title>
    <link href="https://51allai.com/posts/2026/07/deepseek-v4-flash-0731-codex/"/>
    <id>https://51allai.com/posts/2026/07/deepseek-v4-flash-0731-codex/</id>
    <published>2026-07-31T06:46:31.000Z</published>
    <updated>2026-07-31T06:46:31.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>DeepSeek-V4-Flash 正式版 API 于 7 月 31 日上线公测，版本更新为 DeepSeek-V4-Flash-0731。模型结构和尺寸保持不变，主要变化来自重新后训练，并新增原生 Responses API 与 Codex 接入能力；本次更新只作用于 Flash API。<br><img src="https://images.51allai.com/blog/deepseek-v4-flash-0731-codex-cover_20260731_145348.png" alt="DeepSeek-V4-Flash 0731 正式版 API 与 Codex 接入封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="这次更新只更换-Flash-API-模型版本"><a href="#这次更新只更换-Flash-API-模型版本" class="headerlink" title="这次更新只更换 Flash API 模型版本"></a>这次更新只更换 Flash API 模型版本</h2><p>调用 <code>deepseek-v4-flash</code> 的开发者现在使用的是 DeepSeek-V4-Flash-0731。它仍是 2840 亿总参数、单次激活 130 亿参数的混合专家模型，支持 100 万 Token 上下文。Token 是模型处理文本时使用的计量单位，100 万 Token 适合容纳大型代码仓库、长文档或多轮任务记录。</p><p>0731 版本没有更换模型结构，也没有扩大模型尺寸。更新集中在后训练阶段，即在基础训练完成后继续用指令、反馈和任务数据调整模型的行为。对使用者来说，这次改动的重点不是上下文窗口或参数量增加，而是 API 端的编程智能体适配。</p><p>本次升级不涉及 DeepSeek-V4-Pro API，也不涉及 DeepSeek APP 和网页端当前使用的模型。已经在这些入口使用 DeepSeek 的普通用户，不会因为这次 Flash API 更新自动切换到 0731 版本。</p><h2 id="Responses-API-让-Codex-可以直接连接-DeepSeek"><a href="#Responses-API-让-Codex-可以直接连接-DeepSeek" class="headerlink" title="Responses API 让 Codex 可以直接连接 DeepSeek"></a>Responses API 让 Codex 可以直接连接 DeepSeek</h2><p>DeepSeek-V4-Flash-0731 原生支持 Responses API。这个接口把文本输出、推理过程、函数调用、工具调用和流式事件放在同一套响应结构中，Codex 可以通过它与模型交互。开发者不再需要先把 Responses 请求转成 Chat Completions 请求，再转发给 DeepSeek。</p><p>DeepSeek 为 Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件提供了共用配置方案。这些客户端读取同一个 Codex 配置目录，配置模型提供方后即可选择 <code>deepseek-v4-flash</code>。当前能通过这条原生路径接入 Codex 的 DeepSeek 模型只有 V4-Flash。</p><p>Responses API 目前支持函数工具、服务端网页搜索，以及 Codex 使用的 <code>apply_patch</code> 自定义工具。它不接受图片和文件输入；<code>file_search</code>、<code>code_interpreter</code>、<code>computer_use</code> 和 MCP 等内置工具也不在当前支持范围内。接口采用无状态方式，不支持通过 <code>previous_response_id</code> 或 <code>conversation</code> 保存服务端对话状态，应用需要自行带上后续请求所需的上下文。</p><h2 id="API-调用方式没有更换域名"><a href="#API-调用方式没有更换域名" class="headerlink" title="API 调用方式没有更换域名"></a>API 调用方式没有更换域名</h2><p>Responses API 继续使用 <code>https://api.deepseek.com</code>。安装 OpenAI Python SDK 后，可以把 DeepSeek API Key、接口地址和模型名传给客户端：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">from</span> openai <span class="keyword">import</span> OpenAI</span><br><span class="line"></span><br><span class="line">client = OpenAI(</span><br><span class="line">    api_key=<span class="string">&quot;&lt;your DeepSeek API Key&gt;&quot;</span>,</span><br><span class="line">    base_url=<span class="string">&quot;https://api.deepseek.com&quot;</span>,</span><br><span class="line">)</span><br><span class="line"></span><br><span class="line">response = client.responses.create(</span><br><span class="line">    model=<span class="string">&quot;deepseek-v4-flash&quot;</span>,</span><br><span class="line">    instructions=<span class="string">&quot;You are a helpful assistant.&quot;</span>,</span><br><span class="line">    <span class="built_in">input</span>=<span class="string">&quot;检查这个项目中的测试失败原因。&quot;</span>,</span><br><span class="line">)</span><br><span class="line"></span><br><span class="line"><span class="built_in">print</span>(response.output_text)</span><br></pre></td></tr></table></figure><p>需要逐步显示输出时，可以把 <code>stream</code> 设为 <code>True</code>。流式响应通过一组带类型的 SSE 事件返回，正常完成时以 <code>response.completed</code> 结束，不使用 <code>data: [DONE]</code> 作为结束标记。迁移自其他 Responses API 服务的应用，需要检查自身是否依赖 DeepSeek 尚未支持的参数或工具。</p><h2 id="上下文、输出长度和价格保持现有档位"><a href="#上下文、输出长度和价格保持现有档位" class="headerlink" title="上下文、输出长度和价格保持现有档位"></a>上下文、输出长度和价格保持现有档位</h2><p>DeepSeek-V4-Flash-0731 支持思考与非思考两种模式，默认开启思考模式。上下文长度为 100 万 Token，单次最大输出长度为 38.4 万 Token，并继续支持 JSON 输出、工具调用、Anthropic API、对话前缀续写和非思考模式下的 FIM 补全。FIM 是根据光标前后内容补全中间代码的方式，常用于代码编辑器。</p><p>当前人民币价格按每 100 万 Token 计算：缓存命中的输入为 0.02 元，未命中的输入为 1 元，输出为 2 元。缓存会复用请求开头已经处理过的相同内容，因此重复携带大型代码库说明、规则或长文档时，命中缓存可以减少输入费用。</p><p>开发者迁移时需要同时核对模型名和客户端能力。新项目可以直接使用 <code>deepseek-v4-flash</code> 与 Responses API；现有 Chat Completions 或 Anthropic API 项目仍可继续使用原有协议，只需确认调用的模型版本和思考模式符合预期。</p>]]></content>
    
    
    <summary type="html">DeepSeek-V4-Flash 正式版 API 上线公测，版本更新为 0731，原生支持 Responses API 并可直接接入 Codex。本文梳理模型更新范围、百万 Token 上下文、最大输出长度、调用价格和接入方法，并说明图片、文件、会话状态及部分内置工具在当前接口中的使用限制，帮助开发者判断现有项目是否需要调整。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="coding-agent" scheme="https://51allai.com/tags/coding-agent/"/>
    
    <category term="deepseek" scheme="https://51allai.com/tags/deepseek/"/>
    
    <category term="deepseek-v4" scheme="https://51allai.com/tags/deepseek-v4/"/>
    
  </entry>
  
  <entry>
    <title>giffgaff 在华号码停用后，30 天内申请 PAC 并迁移验证码</title>
    <link href="https://51allai.com/posts/2026/07/giffgaff-deactivated-number-pac-guide/"/>
    <id>https://51allai.com/posts/2026/07/giffgaff-deactivated-number-pac-guide/</id>
    <published>2026-07-31T04:16:18.000Z</published>
    <updated>2026-07-31T04:16:18.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>giffgaff 在华号码停用后，先保护仍依赖旧号码的银行、邮箱和社交账号，再在停用日起 30 天内通过客服申请 PAC。拿到 PAC 后交给新的英国运营商完成携号转网，同时关闭自动续费，并在同一期限内处理账户余额，避免号码被回收。<br><img src="https://images.51allai.com/blog/giffgaff-deactivated-number-pac-guide-cover_20260731_122056.png" alt="giffgaff 在华号码停用后的 PAC 与验证码迁移步骤" fetchpriority="high" decoding="async"></p></blockquote><h2 id="先迁移仍依赖旧号码的账号"><a href="#先迁移仍依赖旧号码的账号" class="headerlink" title="先迁移仍依赖旧号码的账号"></a>先迁移仍依赖旧号码的账号</h2><p>把验证码迁移放在第一位。先检查邮箱、密码管理器、银行、支付工具、社交平台、云服务和开发者账号，找出仍把 giffgaff 号码用于登录、短信双重验证或找回密码的服务。</p><p>如果某个账号仍保持登录，不要主动退出。进入安全设置，把短信验证换到能够长期控制的新号码；支持验证器应用、通行密钥或硬件安全密钥的服务，可以同时增加一种不依赖手机号码的验证方式。下载恢复代码后离线保存，并确认找回邮箱仍能正常使用。</p><p>已经收不到短信时，先使用现有登录状态、恢复代码或备用验证方式修改设置。没有这些入口的账号，需要联系对应服务的客服完成身份核验。不要把等待 giffgaff 恢复服务作为账号找回方案，因为已经停用的 SIM 不能重新激活。</p><h2 id="先确认是服务受限还是号码停用"><a href="#先确认是服务受限还是号码停用" class="headerlink" title="先确认是服务受限还是号码停用"></a>先确认是服务受限还是号码停用</h2><p>“被封”不是 giffgaff 帮助页面中的单一状态。账户或服务显示 <code>disabled</code> 时，限制可能来自付款、异常使用或账户审查，用户需要联系客户服务核验原因；客服复核后，部分服务限制可以解除。</p><p>已经收到 <code>disconnected</code> 或 <code>deactivated</code> 结果则不同。此时原 SIM 不能重新激活，处理重点应转向迁移账号和保留号码。查看账户面板、停服邮件和客服案件中的英文状态，可以避免在错误的流程里反复充值或更换手机设置。</p><h2 id="从停用日期开始计算-30-天"><a href="#从停用日期开始计算-30-天" class="headerlink" title="从停用日期开始计算 30 天"></a>从停用日期开始计算 30 天</h2><p>号码被停用后，giffgaff 允许用户在 30 天内通过客服申请 PAC。PAC 是英国手机号码的携号转网代码，用来把原号码转到另一家英国移动网络。超过 30 天后，号码会返回可分配号码池，不能再申请 PAC，也不能要求 giffgaff 恢复原号码。</p><p>这里有两个不同的 30 天期限。第一个从号码停用之日开始，是申请 PAC 的期限；第二个从 PAC 签发之日开始，是 PAC 本身的有效期。拿到代码后仍要尽快交给新运营商，不能因为 PAC 已经到手就继续搁置。</p><p>普通的 PAC 自助方式包括账户页面、拨打 43431 或发送 <code>PAC</code> 到 65075，但这些方式要求用户在英国。已经在中国、号码已经停用或短信无法发送时，应直接登录 giffgaff 账户联系客户服务，并明确说明停用日期、手机号码、会员名，以及需要在 30 天期限内取得 PAC。</p><h2 id="先确认新运营商能接收号码"><a href="#先确认新运营商能接收号码" class="headerlink" title="先确认新运营商能接收号码"></a>先确认新运营商能接收号码</h2><p>PAC 只能把号码转到另一家英国移动网络。申请代码前，先确认新运营商允许你完成开户、身份验证、付款和 SIM 或 eSIM 激活，并了解它在中国使用时的漫游条件。不要只比较月费，更要确认自己能否实际开通并长期管理账户。</p><p>开通新服务后，把 PAC 提交给新运营商。英国号码迁移通常由新运营商发起，规则要求在一个工作日内完成。迁移期间可能出现短暂服务切换，因此重要账号的验证码迁移最好在提交 PAC 前完成。</p><p>新卡显示转网完成后，分别测试呼入电话、短信接收和账户登录，并确认号码已经显示为原 giffgaff 号码。测试通过前不要删除旧 eSIM、丢弃实体卡或清理与客服的沟通记录。</p><h2 id="关闭续费并处理账户余额"><a href="#关闭续费并处理账户余额" class="headerlink" title="关闭续费并处理账户余额"></a>关闭续费并处理账户余额</h2><p>如果账户仍能登录，进入付款设置关闭自动续费和自动充值，检查是否存在已经排队的下一期套餐，再移除不需要保留的付款方式。这样可以避免号码停用后继续按原设置扣款。</p><p>账户还有话费余额时，应在停用后的 30 天内联系客户服务申请退款。SIM 已经停用的用户可能需要在账户中重新添加付款卡，供退款原路处理。giffgaff 同时注明，因不允许的使用而停用的账户不提供余额退款；因此申请时应如实说明停用原因，并保留余额页面和客服答复。</p><h2 id="对停用决定有异议时提交申诉"><a href="#对停用决定有异议时提交申诉" class="headerlink" title="对停用决定有异议时提交申诉"></a>对停用决定有异议时提交申诉</h2><p>如果你认为停用判断有误，先向客户服务提交案件。内容写清姓名、giffgaff 手机号码、会员名、停服邮件日期、案件编号，以及希望对方采取的处理方式；相关邮件和账户页面可以截图留存。</p><p>客户服务无法解决时，可以继续提交正式投诉。投诉过程中仍要同步迁移验证码和申请 PAC，不要为了等待申诉结果错过 30 天期限。正式投诉在八周后仍未解决，或 giffgaff 已给出无法继续处理的最终答复时，可再进入独立通信申诉程序。</p><h2 id="不要再用充值或偶尔发短信赌恢复"><a href="#不要再用充值或偶尔发短信赌恢复" class="headerlink" title="不要再用充值或偶尔发短信赌恢复"></a>不要再用充值或偶尔发短信赌恢复</h2><p>半年内充值、发短信或使用一次数据，解决的是普通的长期无活动停号问题。长期在英国境外使用触发的停服处理属于另一类情况。号码已经停用后，再充值、重装 App、切换漫游网络或重新添加 eSIM 都不能让原 SIM 重新激活。</p><p>最稳妥的顺序只有三步：先保住重要账号的登录权，再在停用后的 30 天内申请 PAC，最后处理续费、余额和申诉。任何需要等待客服回复的环节，都不应阻塞前两项操作。</p>]]></content>
    
    
    <summary type="html">giffgaff 在华号码被停用后，应先迁移银行、邮箱和社交账号的短信验证，再在停用日起 30 天内联系客户服务申请 PAC。本文说明如何识别 disabled 与 deactivated 状态、完成英国号码携号转网、关闭自动续费、申请余额退款并提交申诉，避免错过号码回收期限。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="giffgaff" scheme="https://51allai.com/tags/giffgaff/"/>
    
    <category term="roaming" scheme="https://51allai.com/tags/roaming/"/>
    
    <category term="sim-card" scheme="https://51allai.com/tags/sim-card/"/>
    
    <category term="service-termination" scheme="https://51allai.com/tags/service-termination/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 下调 GPT-5.6 API 价格，Luna 降价 80%</title>
    <link href="https://51allai.com/posts/2026/07/openai-gpt-5-6-api-price-cut/"/>
    <id>https://51allai.com/posts/2026/07/openai-gpt-5-6-api-price-cut/</id>
    <published>2026-07-31T01:08:58.000Z</published>
    <updated>2026-07-31T01:08:58.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 从 7 月 30 日起下调 GPT-5.6 Terra 与 Luna 的 API 价格：Terra 输入和输出单价均降低 20%，Luna 均降低 80%。两款模型保留 105 万 Token 上下文，订阅价格与额度预算不变，但使用时消耗的额度减少；Sol 另提供速度最高提升 2.5 倍的 Fast mode，按标准处理的两倍计费，供延迟敏感请求选用。<br><img src="https://images.51allai.com/blog/openai-gpt-5-6-api-price-cut-cover_20260731_091616.png" alt="OpenAI GPT-5.6 Terra 与 Luna API 降价" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Luna-与-Terra-的输入、输出价格同步下调"><a href="#Luna-与-Terra-的输入、输出价格同步下调" class="headerlink" title="Luna 与 Terra 的输入、输出价格同步下调"></a>Luna 与 Terra 的输入、输出价格同步下调</h2><p>GPT-5.6 系列在 7 月 9 日全面开放，包含 Sol、Terra 和 Luna 三个型号。Sol 面向需要较高推理能力的复杂任务，Terra 在能力与成本之间取中间档，Luna 则用于对成本敏感、调用量大的工作。</p><p>7 月 30 日生效的新价格按每 100 万个 Token 计费。Token 是模型处理文字时使用的计量单位，一段中文通常会被拆成多个 Token。</p><table><thead><tr><th>模型</th><th align="right">原输入价</th><th align="right">新输入价</th><th align="right">原输出价</th><th align="right">新输出价</th><th align="right">降幅</th></tr></thead><tbody><tr><td>GPT-5.6 Terra</td><td align="right">2.50 美元</td><td align="right">2.00 美元</td><td align="right">15.00 美元</td><td align="right">12.00 美元</td><td align="right">20%</td></tr><tr><td>GPT-5.6 Luna</td><td align="right">1.00 美元</td><td align="right">0.20 美元</td><td align="right">6.00 美元</td><td align="right">1.20 美元</td><td align="right">80%</td></tr></tbody></table><p>这次调整没有改变 GPT-5.6 Sol 的标准 API 单价。Terra 的缓存输入价格为每 100 万 Token 0.20 美元，Luna 为 0.02 美元。缓存输入指重复使用且命中缓存的提示词内容，适合系统提示词、固定文档和多轮任务中反复出现的前缀。</p><h2 id="Luna-的批量任务成本降到原来的五分之一"><a href="#Luna-的批量任务成本降到原来的五分之一" class="headerlink" title="Luna 的批量任务成本降到原来的五分之一"></a>Luna 的批量任务成本降到原来的五分之一</h2><p>假设一次批处理共使用 100 万输入 Token 和 10 万输出 Token，暂不计算工具调用等额外费用。Luna 原价需要 1.60 美元，新价为 0.32 美元；Terra 原价需要 4.00 美元，新价为 3.20 美元。</p><p>Luna 更适合分类、信息抽取、固定格式生成和智能体中的常规执行步骤。Terra 适合日常问答、文档处理和需要工具调用的通用任务。实际选型仍应先用自己的数据和验收标准测试，再比较完成同一任务所需的总 Token、耗时与成功率。</p><h2 id="百万级上下文不等于所有长度都按基础价计费"><a href="#百万级上下文不等于所有长度都按基础价计费" class="headerlink" title="百万级上下文不等于所有长度都按基础价计费"></a>百万级上下文不等于所有长度都按基础价计费</h2><p>Terra 与 Luna 的上下文窗口都是 105 万 Token，单次最多输出 12.8 万 Token。上下文窗口可以理解为模型一次请求能够读取和处理的总内容容量，包括用户输入、工具结果和模型生成内容。</p><p>当输入超过 27.2 万 Token 时，整次请求的输入单价按基础价的 2 倍计算，输出单价按 1.5 倍计算。Terra 的长上下文输入与输出价格因此变为每 100 万 Token 4 美元和 18 美元；Luna 则为 0.40 美元和 1.80 美元。处理超长文档或长时间运行的智能体任务时，需要按这一档价格估算，而不是直接套用短上下文单价。</p><h2 id="ChatGPT-Work-与-Codex-订阅价格不变"><a href="#ChatGPT-Work-与-Codex-订阅价格不变" class="headerlink" title="ChatGPT Work 与 Codex 订阅价格不变"></a>ChatGPT Work 与 Codex 订阅价格不变</h2><p>Terra 和 Luna 继续在 ChatGPT Work、Codex 与 OpenAI API 中提供。Free 和 Go 用户可以使用 Terra；Plus、Pro、Business 与 Enterprise 用户可以选择 Terra 和 Luna。</p><p>ChatGPT 与 Codex 的订阅价格和额度预算没有调整。价格变化体现在用量折算上：调用 Terra 与 Luna 时消耗的额度减少。API 用户则直接按新的 Token 单价付费。</p><p>开发者可以通过 Responses API 或 Chat Completions API 调用两款模型。两者都支持文本输入和输出、图片输入、流式输出、函数调用与结构化输出，也可以在 Responses API 中使用网页搜索、文件搜索、代码解释器、Shell、MCP 和计算机操作等工具。</p><h2 id="Sol-的-Fast-mode-用两倍价格换取更低延迟"><a href="#Sol-的-Fast-mode-用两倍价格换取更低延迟" class="headerlink" title="Sol 的 Fast mode 用两倍价格换取更低延迟"></a>Sol 的 Fast mode 用两倍价格换取更低延迟</h2><p>Priority Processing 在 7 月 30 日改名为 Fast mode。GPT-5.6 Sol 使用 Fast mode 时，速度最高可达到标准处理的 2.5 倍，价格是标准处理的 2 倍，模型能力不变。</p><p>API 请求可以把 <code>service_tier</code> 设置为 <code>fast</code>。原有的 <code>priority</code> 参数继续兼容，并会使用相同的处理方式。Fast mode 适合用户正在等待结果、延迟直接影响体验的请求；后台批处理更适合先比较标准处理与低成本模型的总费用。</p>]]></content>
    
    
    <summary type="html">OpenAI 下调 GPT-5.6 API 价格，Luna 输入与输出单价均降低 80%，Terra 均降低 20%。本文列出两款模型的新旧价格、缓存输入与长上下文附加费，说明 ChatGPT Work、Codex 和 API 的可用范围，以及 Sol Fast mode 的速度、兼容方式与计费变化，帮助开发者按任务规模和响应速度选择模型。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="gpt-5-6" scheme="https://51allai.com/tags/gpt-5-6/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 发布 GPT Transcribe 与 GPT Live Transcribe 语音转录模型</title>
    <link href="https://51allai.com/posts/2026/07/openai-gpt-transcribe-models/"/>
    <id>https://51allai.com/posts/2026/07/openai-gpt-transcribe-models/</id>
    <published>2026-07-29T12:37:32.000Z</published>
    <updated>2026-07-29T12:37:32.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 在 API 中加入 GPT Transcribe 与 GPT Live Transcribe。前者适合处理已录制的音频文件，价格为每分钟 0.0045 美元；后者面向麦克风、通话等实时音频流，价格为每分钟 0.017 美元。两款模型均可利用上下文、关键词和语言提示改善专有名词与多语言内容的转录。<br><img src="https://images.51allai.com/blog/openai-gpt-transcribe-cover_20260729_204553.png" alt="OpenAI GPT Transcribe 与 GPT Live Transcribe 语音转录模型封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="两款模型处理不同的音频流程"><a href="#两款模型处理不同的音频流程" class="headerlink" title="两款模型处理不同的音频流程"></a>两款模型处理不同的音频流程</h2><p>GPT Transcribe 用于把已经录好的语音转成文字。开发者上传一段完整录音后，可以等待模型返回最终文本，也可以在文件处理期间接收逐步生成的文字。这里的“流式”是边处理文件边返回结果，音频本身仍是一份已经存在的录音。</p><p>GPT Live Transcribe 处理持续到达的实时音频，例如麦克风输入、电话或直播音频流。它会在说话过程中返回新增的文字片段，并在一段语音提交后给出完整转录。需要即时字幕、在线会议记录或通话文字化的应用，更适合采用这条路径。</p><p>两者的区别不在于是否能逐步显示文字，而在于音频从哪里来。已有录音走文件转录；仍在说、仍在传输的音频走实时转录。</p><h2 id="GPT-Transcribe-直接接入音频转录接口"><a href="#GPT-Transcribe-直接接入音频转录接口" class="headerlink" title="GPT Transcribe 直接接入音频转录接口"></a>GPT Transcribe 直接接入音频转录接口</h2><p>文件转录通过 <code>/v1/audio/transcriptions</code> 接口调用，模型名填写 <code>gpt-transcribe</code>。单个文件最大 25 MB，支持 <code>mp3</code>、<code>mp4</code>、<code>mpeg</code>、<code>mpga</code>、<code>m4a</code>、<code>wav</code> 和 <code>webm</code> 格式。返回结果包含转录文本和检测到的语言。</p><p>如果希望在处理完成前先看到部分结果，可以把 <code>stream</code> 设为 <code>true</code>。接口会持续返回新增文本，最后再给出完整转录。这适合较长录音的处理进度展示，但不等同于接收麦克风的实时音频。</p><p>普通录音转写不需要先设计复杂流程。上传文件、指定模型，再读取返回文本即可。需要区分不同说话人、输出单词时间戳、制作字幕格式或翻译成英文时，应选择对应的专用转录模型，而不是把这些任务交给 GPT Transcribe。</p><h2 id="GPT-Live-Transcribe-面向实时连接"><a href="#GPT-Live-Transcribe-面向实时连接" class="headerlink" title="GPT Live Transcribe 面向实时连接"></a>GPT Live Transcribe 面向实时连接</h2><p>实时转录需要创建 <code>type: &quot;transcription&quot;</code> 的 Realtime 会话，并选择 <code>gpt-live-transcribe</code>。服务器端音频管线可以使用 WebSocket，浏览器里的音频输入可以使用 WebRTC。</p><p>应用把音频片段持续送入会话后，会收到增量转录事件。每个事件带来当前新增的文字；当一段音频被提交，接口再返回这段内容的最终转录。开发者可以自行决定何时提交一段语音，也可以配置语音活动检测，让服务器依据说话与停顿自动划分边界。</p><p>这个模型只负责把实时语音变成文字，不会像语音助手那样生成口头回答。做直播字幕、实时会议记录或通话转写时，这种职责更直接：应用拿到文字后，再决定是否用于搜索、摘要、存档或交给其他模型处理。</p><h2 id="上下文提示帮助识别专有内容"><a href="#上下文提示帮助识别专有内容" class="headerlink" title="上下文提示帮助识别专有内容"></a>上下文提示帮助识别专有内容</h2><p>两款模型都支持给转录补充上下文。开发者可以用自由文本描述录音主题，用关键词列出可能出现的人名、产品名、编号和行业术语，还可以给出预期输入语言。多语言录音或同一句话中切换语言时，可以同时提供多个语言提示。</p><p>这些关键词是识别提示，不是强制输出。只应放入录音中确实可能出现的词，并用实际音频检查结果，避免模型把没有说过的词带进转录。</p><p>对会议、客服通话和专业访谈来说，这项能力比只上传裸音频更实用。录音主题、客户编号、项目代号和产品名称都可以在请求中明确提供，减少模型仅凭发音猜测的范围。</p><h2 id="价格按音频分钟计算"><a href="#价格按音频分钟计算" class="headerlink" title="价格按音频分钟计算"></a>价格按音频分钟计算</h2><p>GPT Transcribe 的价格为每分钟 0.0045 美元，一小时录音约为 0.27 美元。GPT Live Transcribe 的价格为每分钟 0.017 美元，一小时实时音频约为 1.02 美元。</p><p>批量处理播客、采访或会议存档时，GPT Transcribe 的成本更低。只有业务确实需要边说边出字时，才需要为 GPT Live Transcribe 的实时处理方式付费。选择模型时，先判断音频是否已经录好，再判断用户能否等待文件处理完成，通常就能确定接入路径。</p>]]></content>
    
    
    <summary type="html">OpenAI 发布 GPT Transcribe 与 GPT Live Transcribe 语音转录模型，分别处理录音文件和实时音频。本文梳理两者的 API 接入方式、上下文提示能力、文件限制与每分钟价格，并说明文件流式输出与实时转录的区别，帮助开发者为会议记录、直播字幕和批量录音处理选择模型。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="speech-to-text" scheme="https://51allai.com/tags/speech-to-text/"/>
    
  </entry>
  
  <entry>
    <title>MCP 发布 2026-07-28 新规范，无状态架构支持云端部署</title>
    <link href="https://51allai.com/posts/2026/07/mcp-2026-07-28-cloud-deployment/"/>
    <id>https://51allai.com/posts/2026/07/mcp-2026-07-28-cloud-deployment/</id>
    <published>2026-07-29T12:26:51.000Z</published>
    <updated>2026-07-29T12:26:51.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>MCP 2026-07-28 规范已正式发布。协议核心改为无状态请求，移除初始化握手和会话 ID，让远程 MCP 服务器可以部署在无服务器、边缘平台或普通负载均衡器之后；TypeScript、Python、Go 与 C# 的 Tier 1 SDK 已同步支持。<br><img src="https://images.51allai.com/blog/mcp-2026-07-28-cloud-deployment-cover-5x2_20260729_203233.png" alt="MCP 2026-07-28 无状态服务器云端部署示意" fetchpriority="high" decoding="async"></p></blockquote><h2 id="MCP-服务器不再绑定一段会话"><a href="#MCP-服务器不再绑定一段会话" class="headerlink" title="MCP 服务器不再绑定一段会话"></a>MCP 服务器不再绑定一段会话</h2><p>MCP 是 Model Context Protocol 的缩写，中文通常称为模型上下文协议。它规定 AI 应用如何用统一方式连接外部工具、数据和服务，例如让聊天助手查询数据库、调用企业系统或执行代码。</p><p>旧版协议通过 Streamable HTTP 调用工具时，客户端要先完成 <code>initialize</code> 与 <code>initialized</code> 握手。服务器随后发放 <code>Mcp-Session-Id</code>，后续请求都要携带这个会话标识。部署多个服务器实例时，请求通常需要持续回到保存该会话的实例，或者由所有实例共用一套会话存储。</p><p><code>2026-07-28</code> 版本移除了这套协议级会话。每个请求都会携带协议版本和客户端能力等信息，可以由任意兼容的服务器实例独立处理。客户端如需提前了解服务器支持的版本和能力，可以调用新的 <code>server/discover</code> 方法。</p><h2 id="无状态核心降低云端扩容门槛"><a href="#无状态核心降低云端扩容门槛" class="headerlink" title="无状态核心降低云端扩容门槛"></a>无状态核心降低云端扩容门槛</h2><p>没有协议级会话后，同一客户端的不同请求可以被普通轮询负载均衡器分配到不同实例。服务器不再为了维持 MCP 连接而依赖粘性路由或共享会话存储，也能在请求到来时启动实例、空闲时缩减资源。因此，MCP 服务器可以作为普通 HTTP 工作负载部署到无服务器平台、边缘计算平台或容器集群。</p><p>这项变化解决的是协议层的部署限制，不是一个新的云托管产品。开发者仍需选择实际运行代码的平台，并自行配置域名、鉴权、日志、数据访问权限和资源限额。业务确实需要跨请求保存状态时，也可以由工具返回明确的标识，例如购物篮 ID 或浏览器任务 ID，再由后续调用把它作为普通参数传回服务器。</p><h2 id="网关可以直接读取工具与方法名称"><a href="#网关可以直接读取工具与方法名称" class="headerlink" title="网关可以直接读取工具与方法名称"></a>网关可以直接读取工具与方法名称</h2><p>新版 Streamable HTTP 请求必须带上 <code>Mcp-Method</code> 和 <code>Mcp-Name</code> 请求头。前者表示调用的方法，后者可标识具体工具。负载均衡器、API 网关、限流器和 Web 应用防火墙可以直接根据请求头做路由、授权或计量，不必先解析 JSON 请求体。</p><p>工具、提示词和资源列表的响应也增加了 <code>ttlMs</code> 与 <code>cacheScope</code>。客户端由此知道结果可以缓存多久，以及缓存能否在不同用户间共享。服务器还应以稳定顺序返回工具列表，减少重复拉取，并让上游提示词缓存更容易命中。</p><h2 id="多轮交互不再依赖持续打开的双向连接"><a href="#多轮交互不再依赖持续打开的双向连接" class="headerlink" title="多轮交互不再依赖持续打开的双向连接"></a>多轮交互不再依赖持续打开的双向连接</h2><p>工具执行到一半时，有时需要用户补充参数或确认操作。新版引入 Multi Round-Trip Requests，简称 MRTR。服务器可以返回 <code>input_required</code>，列出需要客户端补充的内容；客户端取得回答后，再带着 <code>inputResponses</code> 重试原来的请求。</p><p>这套方式替代了部分服务器主动向客户端发起请求的流程。一次交互可以拆成多个完整的请求与响应，不必为了等待用户确认而一直占用双向数据流。服务器返回的 <code>requestState</code> 用来衔接步骤，任何可处理该状态的实例都能继续任务。</p><h2 id="扩展与授权规则同步更新"><a href="#扩展与授权规则同步更新" class="headerlink" title="扩展与授权规则同步更新"></a>扩展与授权规则同步更新</h2><p>新规范建立了正式的扩展框架。MCP Apps 可让服务器向支持它的客户端提供沙箱化交互界面；Tasks 扩展用于处理需要较长时间运行的工作，并通过任务句柄查询、更新或取消任务。扩展需要客户端和服务器共同支持，不会因为升级核心协议而自动启用。</p><p>授权部分增加了对 OAuth 2.0 与 OpenID Connect 部署的约束。客户端要校验授权响应里的发行者信息，注册凭据也必须绑定到签发它的授权服务器。动态客户端注册继续兼容旧实现，但已进入弃用流程，后续方向是 Client ID Metadata Documents。</p><p>Roots、Sampling、Logging 以及旧的 HTTP+SSE 传输方式也被标记为弃用。它们在至少 12 个月的弃用窗口内继续工作，新项目应采用规范给出的替代方案。</p><h2 id="开发者需要升级两端实现"><a href="#开发者需要升级两端实现" class="headerlink" title="开发者需要升级两端实现"></a>开发者需要升级两端实现</h2><p>新版本包含破坏性变更，不能只改部署配置就让旧服务器自动变成无状态。TypeScript、Python、Go 和 C# 的 Tier 1 SDK 已支持 <code>2026-07-28</code>，Rust SDK提供测试版支持。开发者应先查看所用语言 SDK 的迁移说明，再分别升级客户端和服务器，并通过版本协商保留与旧实现的连接能力。</p><p>如果现有服务器依赖 <code>Mcp-Session-Id</code>、初始化阶段保存的客户端信息、服务器主动请求或长连接恢复机制，迁移时需要把相关状态改为显式参数、MRTR 或新的订阅机制。已经按独立 HTTP 请求设计的远程服务器，改造范围通常集中在协议头、请求元数据、发现方法和 SDK 接口。</p>]]></content>
    
    
    <summary type="html">MCP 发布 2026-07-28 新规范，协议核心改为无状态请求，远程 MCP 服务器不再依赖初始化握手、会话 ID、粘性路由或共享会话存储。本文说明它如何支持无服务器、边缘平台和普通负载均衡部署，以及开发者升级 SDK 时需要关注的协议变化。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="anthropic" scheme="https://51allai.com/tags/anthropic/"/>
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="agent-framework" scheme="https://51allai.com/tags/agent-framework/"/>
    
    <category term="MCP" scheme="https://51allai.com/tags/MCP/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 恢复 Codex 5 小时限额，本周限额继续保留</title>
    <link href="https://51allai.com/posts/2026/07/codex-five-hour-limit-returns/"/>
    <id>https://51allai.com/posts/2026/07/codex-five-hour-limit-returns/</id>
    <published>2026-07-29T12:05:06.000Z</published>
    <updated>2026-07-29T12:05:06.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 已恢复 Codex 的 5 小时使用限额。本地消息与云端任务重新共享同一个 5 小时时间窗口，每周限额仍会叠加计算。Plus 和 Pro 用户达到套餐限额后，可以购买积分继续使用，也可以切换 GPT-5.4 mini，减少日常任务消耗的额度。<br><img src="https://images.51allai.com/blog/codex-five-hour-limit-returns-cover_20260729_201305.png" alt="OpenAI Codex 恢复 5 小时使用限额" fetchpriority="high" decoding="async"></p></blockquote><h2 id="5-小时时间窗口重新生效"><a href="#5-小时时间窗口重新生效" class="headerlink" title="5 小时时间窗口重新生效"></a>5 小时时间窗口重新生效</h2><p>OpenAI 在 7 月 12 日临时取消了 Plus、Business 和 Pro 套餐的 Codex 5 小时限额。那次调整从一开始就被标记为临时措施，并没有取消每周限额。</p><p>7 月 29 日，Codex 负责人 Tibo Sottiaux 为全部 ChatGPT Work 和 Codex 用户重置了使用额度，并公布 GPT-5.6 Sol 的限额调整。Codex 当前定价页已经重新列出 5 小时时间窗口，说明这项短期限制再次生效。</p><p>5 小时限额控制短时间内能使用多少套餐内额度，每周限额控制更长周期的总量。两者会同时存在，并不是等到每周限额耗尽后才开始计算 5 小时限额。</p><h2 id="本地消息与云端任务共用额度"><a href="#本地消息与云端任务共用额度" class="headerlink" title="本地消息与云端任务共用额度"></a>本地消息与云端任务共用额度</h2><p>Codex 的本地消息和云端任务共享同一个 5 小时时间窗口。在电脑上让 Codex 直接修改项目，以及把任务交给云端运行，都会计入这组限额。账户还可能受到额外的每周限额约束。</p><p>当前 Plus 套餐页面给出的本地消息参考范围如下：</p><table><thead><tr><th>模型</th><th align="right">每 5 小时本地消息参考范围</th></tr></thead><tbody><tr><td>GPT-5.6 Sol</td><td align="right">15–90</td></tr><tr><td>GPT-5.6 Terra</td><td align="right">20–110</td></tr><tr><td>GPT-5.6 Luna</td><td align="right">50–280</td></tr><tr><td>GPT-5.5</td><td align="right">15–80</td></tr><tr><td>GPT-5.4</td><td align="right">20–100</td></tr><tr><td>GPT-5.4 mini</td><td align="right">60–350</td></tr></tbody></table><p>这些数字是平均范围，不是每个账户都能固定发送的消息数。任务越复杂、输入的项目内容越多、输出越长，单次任务消耗的额度通常越多。</p><h2 id="达到限额后仍有三种继续方式"><a href="#达到限额后仍有三种继续方式" class="headerlink" title="达到限额后仍有三种继续方式"></a>达到限额后仍有三种继续方式</h2><p>Plus 和 Pro 用户达到套餐限额后，可以购买额外积分，不需要先升级订阅。积分会根据所用模型以及输入、缓存输入和输出的 Token 数量扣除；Token 可以理解为模型处理文字和代码时使用的计量单位。</p><p>日常修改、简单解释和小型代码任务可以切换到 GPT-5.4 mini。当前页面估算，使用 mini 模型可让本地消息限额延长约 2.5 至 3.3 倍，具体倍数取决于原先使用的模型。</p><p>用户也可以为额外的本地任务配置 API 密钥，这部分用量按 API 标准费率单独计费。采用灵活计费的 Business、Edu 和 Enterprise 工作区，则可以购买工作区积分继续使用。</p><h2 id="在使用面板和命令行查看剩余额度"><a href="#在使用面板和命令行查看剩余额度" class="headerlink" title="在使用面板和命令行查看剩余额度"></a>在使用面板和命令行查看剩余额度</h2><p>Codex 的使用面板会显示账户当前限额和剩余积分。使用 Codex CLI 时，输入 <code>/status</code> 可以直接查看剩余额度，不必退出当前会话。</p><p>5 小时窗口恢复后，长时间运行多个任务更容易先碰到短期限制。开始大型重构或同时运行多个任务前，先看一次使用面板；如果剩余额度较少，可以把简单任务切换到 mini 模型，或缩短一次交给 Codex 的上下文内容。</p>]]></content>
    
    
    <summary type="html">OpenAI 恢复 Codex 5 小时使用限额，本地消息与云端任务重新共享同一时间窗口，每周限额继续叠加。本文说明 Plus、Pro 等套餐的当前规则、查看入口，以及达到限额后购买积分、切换 GPT-5.4 mini 或使用 API 密钥继续工作的方式，帮助用户安排长任务并控制额外支出。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="codex" scheme="https://51allai.com/tags/codex/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 开源 Codex Security CLI，支持本地与 CI 扫描代码漏洞</title>
    <link href="https://51allai.com/posts/2026/07/openai-codex-security-cli/"/>
    <id>https://51allai.com/posts/2026/07/openai-codex-security-cli/</id>
    <published>2026-07-29T01:35:44.000Z</published>
    <updated>2026-07-29T01:35:44.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 已公开 Codex Security CLI 与 TypeScript SDK，代码采用 Apache-2.0 许可证。开发者可以扫描完整仓库、指定目录或代码差异，并把结果导出为 SARIF、CSV 或 JSON；运行扫描需要 Codex Security 访问权限和账号或 API 凭据。<br><img src="https://images.51allai.com/blog/openai-codex-security-cli-cover_20260729_093948.png" alt="OpenAI Codex Security CLI 本地与 CI 代码扫描流程" fetchpriority="high" decoding="async"></p></blockquote><h2 id="开源的是-CLI-和-TypeScript-SDK"><a href="#开源的是-CLI-和-TypeScript-SDK" class="headerlink" title="开源的是 CLI 和 TypeScript SDK"></a>开源的是 CLI 和 TypeScript SDK</h2><p>Codex Security 这次公开的是一套命令行工具和 TypeScript SDK。命令行工具适合开发者在终端、本地 Git 仓库和 CI 流程里调用；SDK 则让团队把扫描能力接入自己的内部工具。公开包名为 <code>@openai/codex-security</code>，当前代码中的版本号是 <code>0.1.1</code>，许可证为 Apache-2.0。</p><p>这与此前通过网页连接 GitHub 仓库的 Codex Security 服务不是同一个使用入口。CLI 直接接收本地仓库路径，也能只检查指定目录、两个 Git 版本之间的差异，或工作区里尚未提交的改动。扫描代码的前提是用户拥有仓库，或获得了明确的安全评估授权。</p><p>公开仓库采用单向镜像方式同步。外部开发者可以查看代码、提交问题和提出功能建议，但外部 Pull Request 不能直接导入 OpenAI 的内部主仓库。维护者会在主仓库处理被接受的改动，再同步到公开仓库。</p><h2 id="三条命令完成首次扫描"><a href="#三条命令完成首次扫描" class="headerlink" title="三条命令完成首次扫描"></a>三条命令完成首次扫描</h2><p>CLI 需要 Node.js 22 或更高版本。真正执行扫描和导出结果时，还需要 Python 3.10 或更高版本。安装、登录和扫描可以按下面的顺序完成：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">npm install @openai/codex-security</span><br><span class="line">npx codex-security login</span><br><span class="line">npx codex-security scan /path/to/repo</span><br></pre></td></tr></table></figure><p>本地交互使用可以登录 ChatGPT 账号；远程服务器支持设备码登录；CI 等无人值守环境可以通过 <code>OPENAI_API_KEY</code> 或 <code>CODEX_API_KEY</code> 提供凭据。CLI 和 SDK 仍处于 beta 阶段并要求 Codex Security 访问权限。完整仓库扫描还可能要求 Trusted Access for Cyber，仅完成登录或设置 API Key 不会自动获得这项权限。</p><p>正式扫描前可以先加上 <code>--dry-run</code>。这个模式会检查仓库路径、扫描目标和输出目录，不会启动 Codex，也不会读取凭据或联网。它适合先排除路径写错、结果目录放错位置等配置问题。</p><h2 id="可以扫完整仓库，也可以只看这次改动"><a href="#可以扫完整仓库，也可以只看这次改动" class="headerlink" title="可以扫完整仓库，也可以只看这次改动"></a>可以扫完整仓库，也可以只看这次改动</h2><p>日常开发不一定需要每次重扫全部代码。<code>--path</code> 可以把范围限制在某个服务或目录；<code>--diff origin/main --head HEAD</code> 用于检查两个版本之间的已提交变更；<code>--working-tree --base HEAD</code> 则检查暂存区和工作区里的改动。需要扩大检查范围时，可以选择 deep 模式。</p><p>团队还可以通过 <code>--knowledge-base</code> 提供架构文档、威胁模型和安全规则。威胁模型是对系统入口、信任边界和高风险路径的整理，能让扫描结合项目实际结构，而不是只看一段孤立代码。CLI 会递归读取指定目录中的 Markdown、文本、PDF 和 Word 文档。</p><p>扫描默认只生成报告，不会因为发现问题直接修改仓库。结果中会记录发现项、覆盖范围和报告文件。覆盖状态可能是完整、部分或未知；把一次扫描当成审查证据前，需要同时检查未覆盖区域和留待处理的问题。</p><h2 id="报告可进入-CI-和代码审查流程"><a href="#报告可进入-CI-和代码审查流程" class="headerlink" title="报告可进入 CI 和代码审查流程"></a>报告可进入 CI 和代码审查流程</h2><p>Codex Security 可以导出 SARIF、CSV 和 JSON。SARIF 是代码扫描工具常用的结构化格式，适合交给支持该格式的代码托管或安全平台继续处理。CI 中可以使用 <code>--fail-on-severity high</code> 设置严重级别门槛：扫描完成且出现达到门槛的发现时返回状态码 <code>1</code>，覆盖不完整或运行失败时返回状态码 <code>2</code>。</p><p><code>npx codex-security install-hook</code> 可以给当前 Git 仓库安装提交前检查。它会在每次提交前扫描已暂存和未暂存的变更，默认阻止高严重级别发现或扫描错误，同时保留仓库里已有的 pre-commit 脚本。团队也可以用 <code>bulk-scan</code> 批量扫描 GitHub 账号或组织下的多个仓库，并通过同一个结果目录续跑中断的任务。</p><p>扫描结果应保存在被扫描仓库和其 Git 工作树之外。报告可能包含源码片段、漏洞细节和复现步骤，不适合提交进代码仓库、公开 Issue 或多人共享目录。在 macOS 和 Linux 上，已有输出目录还需要限制为当前用户可访问。</p><h2 id="SDK-适合接入内部平台"><a href="#SDK-适合接入内部平台" class="headerlink" title="SDK 适合接入内部平台"></a>SDK 适合接入内部平台</h2><p>TypeScript SDK 通过 <code>CodexSecurity</code> 类启动扫描，返回带类型的发现项、覆盖信息和报告路径。它支持完整仓库、指定路径、Git 差异和工作区扫描，也提供预检、成本上限、进度回调和取消能力。SDK 使用 ESM 模块，需要运行在 Node.js 22 或更高版本的服务端环境。</p><p>CLI 与 SDK 让团队可以检查公开实现、固定依赖版本，并把安全扫描接入已有流程；扫描过程仍会调用 Codex Security 服务并消耗账号或 API 侧的可用额度。对个人开发者，最直接的起点是先用 <code>--dry-run</code> 检查配置，再对一个自己有权评估的小型仓库执行标准扫描，确认结果目录和覆盖报告符合预期后再接入提交钩子或 CI。</p>]]></content>
    
    
    <summary type="html">OpenAI 开源 Codex Security CLI 与 TypeScript SDK，采用 Apache-2.0 许可证，可在本地、提交前和 CI 流程中扫描代码并导出结构化结果。本文说明安装门槛、账号权限、扫描范围、结果保存注意事项，以及开源代码与云端扫描服务的边界，帮助开发者判断如何在个人项目、团队仓库和自动化流水线中安全使用。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="codex" scheme="https://51allai.com/tags/codex/"/>
    
    <category term="open-source" scheme="https://51allai.com/tags/open-source/"/>
    
    <category term="security" scheme="https://51allai.com/tags/security/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
  </entry>
  
  <entry>
    <title>火山引擎开放豆包搜索服务，支持 API、Skill 和 MCP 接入</title>
    <link href="https://51allai.com/posts/2026/07/doubao-search-service/"/>
    <id>https://51allai.com/posts/2026/07/doubao-search-service/</id>
    <published>2026-07-28T13:11:47.000Z</published>
    <updated>2026-07-28T13:11:47.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>火山引擎在 2026 年 7 月 28 日上线豆包搜索服务，面向企业和开发者提供 API、Skill、MCP 与 Agent Plan 接入。服务可返回原文 Markdown 和结构化数据，每月含 500 次免费搜索额度。<br><img src="https://images.51allai.com/blog/doubao-search-service-cover_20260728_211849.png" alt="豆包搜索服务 API、Skill 和 MCP 接入封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="豆包搜索从-App-功能变成可接入服务"><a href="#豆包搜索从-App-功能变成可接入服务" class="headerlink" title="豆包搜索从 App 功能变成可接入服务"></a>豆包搜索从 App 功能变成可接入服务</h2><p>这次开放的不是一个新的消费级搜索入口，而是给企业和开发者使用的联网信息服务。开发者可以把它接到 AI Agent，也就是能够自动拆解任务、调用工具并交付结果的智能体。当任务涉及新闻、产品更新、行业信息或其他实时内容时，智能体可以先搜索，再根据返回的材料继续处理任务。</p><p>服务覆盖跨语言、多模态和垂直领域查询。“多模态”指搜索对象不只有纯文本，还可涉及图像等内容。它和传统搜索结果页的区别在于，返回内容可以直接交给程序继续处理，不需要人先打开网页再复制。</p><h2 id="返回-Markdown-和结构化数据"><a href="#返回-Markdown-和结构化数据" class="headerlink" title="返回 Markdown 和结构化数据"></a>返回 Markdown 和结构化数据</h2><p>豆包搜索支持返回原文 Markdown 与结构化数据。Markdown 是一种保留标题、列表和链接等层级的轻量文本格式；结构化数据则更方便程序提取标题、链接、摘要等字段。对研究、写作、客服或企业问答类智能体来说，这种输出比只返回一串网页链接更容易编排到后续流程中。</p><p>检索方式包括定向查询、语义改写和多轮检索。语义改写会把用户的自然语言需求整理成更适合查找的问题；多轮检索则允许智能体在任务进行中继续补充查询。例如，一个产品研究任务可以先查发布信息，再补查使用入口和价格，不必把所有关键词挤在一次请求中。</p><h2 id="API、Skill-和-MCP-对应不同接入方式"><a href="#API、Skill-和-MCP-对应不同接入方式" class="headerlink" title="API、Skill 和 MCP 对应不同接入方式"></a>API、Skill 和 MCP 对应不同接入方式</h2><p>独立使用时，企业和开发者可在火山引擎豆包搜索控制台开通服务，然后选择 API、Skill 或 MCP 接入。API 适合在自有程序中直接发起请求；Skill 可以把搜索封装成智能体可调用的工具；MCP 是 Model Context Protocol 的缩写，用统一方式让支持该协议的智能体客户端连接外部工具。</p><p>已在使用火山引擎 Agent Plan 的开发者，还可以把豆包搜索作为内置工具配置到 harness 中。Harness 可以理解为承载智能体运行、工具调用和任务流程的外层框架。这条路径的重点是配置现成搜索能力，而不是自行完成一套接口联调。</p><h2 id="每月-500-次免费搜索"><a href="#每月-500-次免费搜索" class="headerlink" title="每月 500 次免费搜索"></a>每月 500 次免费搜索</h2><p>豆包搜索为企业和开发者提供每月 500 次免费搜索额度。超出后可选择按量后付费，也可购买月卡套餐。开发者可以先用免费额度做原型验证，检查业务问题的检索结果和返回字段能否接入现有流程，再决定是否进入持续调用。</p><p>对普通豆包用户来说，这次发布不是新增一个需要单独学习的搜索应用。它的直接用户是需要为自己的软件、网站或智能体补充联网信息的开发者和企业。最终用户会在问答、办公、投研、商业分析或内容生产类产品中间接使用这项能力。</p><ul><li>豆包搜索：<a href="https://www.volcengine.com/product/SearchInfinity">https://www.volcengine.com/product/SearchInfinity</a></li></ul>]]></content>
    
    
    <summary type="html">火山引擎开放豆包搜索服务，企业和开发者可通过 API、Skill、MCP 或 Agent Plan 为智能体接入联网检索。服务支持 Markdown 与结构化数据返回，每月提供 500 次免费搜索额度，本文说明开放对象、接入路径、计费边界，以及普通用户会在哪里间接用到这项能力。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="MCP" scheme="https://51allai.com/tags/MCP/"/>
    
    <category term="bytedance" scheme="https://51allai.com/tags/bytedance/"/>
    
    <category term="doubao" scheme="https://51allai.com/tags/doubao/"/>
    
    <category term="web-search" scheme="https://51allai.com/tags/web-search/"/>
    
  </entry>
  
  <entry>
    <title>月之暗面开放 Kimi K3 模型权重，同步发布技术报告</title>
    <link href="https://51allai.com/posts/2026/07/kimi-k3-open-weights/"/>
    <id>https://51allai.com/posts/2026/07/kimi-k3-open-weights/</id>
    <published>2026-07-27T16:21:28.000Z</published>
    <updated>2026-07-27T16:21:28.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>月之暗面开放 Kimi K3 完整模型权重并发布技术报告。模型共 2.8 万亿参数，每次计算激活 1040 亿参数，支持约 100 万 Token 上下文和原生图像理解；权重已在 Hugging Face 提供下载。<br><img src="https://images.51allai.com/blog/kimi-k3-open-weights-cover_20260728_002550.png" alt="Kimi K3 模型权重与技术报告封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Kimi-K3-完整权重已开放下载"><a href="#Kimi-K3-完整权重已开放下载" class="headerlink" title="Kimi K3 完整权重已开放下载"></a>Kimi K3 完整权重已开放下载</h2><p>Kimi K3 的模型权重已经放到 Hugging Face，下载页面无需申请访问权限。仓库包含 96 个 Safetensors 权重分片，全部文件占用约 1.56 TB。Safetensors 是大模型常用的权重文件格式，可以在加载前读取文件结构，也避免执行文件中夹带的代码。</p><p>这次开放的是完整 Kimi K3 权重，不是缩小版模型。模型总参数为 2.8 万亿，实际处理每个 Token 时激活 1040 亿参数。它采用 MoE，也就是“混合专家”架构：模型共有 896 个专家模块，每个 Token 选择其中 16 个参与计算。这样可以扩大模型容量，同时避免每次推理都调用全部参数。</p><p>模型支持约 100 万 Token 的上下文窗口，并带有原生图像理解能力。上下文窗口决定一次请求能够容纳多少文字、代码、图片信息和对话历史。模型卡列出的输入模态为文字和图像，输出为文字。</p><h2 id="技术报告公开模型结构"><a href="#技术报告公开模型结构" class="headerlink" title="技术报告公开模型结构"></a>技术报告公开模型结构</h2><p>随权重一起发布的技术报告解释了 Kimi K3 的主要结构。模型由 93 层组成，注意力部分包括 69 层 Kimi Delta Attention（KDA）和 24 层 Gated MLA，并使用 Attention Residuals（AttnRes）在不同深度之间选择和组合信息。</p><p>权重采用 MXFP4 格式，激活值采用 MXFP8 格式。这里的 4 位和 8 位表示模型计算时保存数字所用的精度。更低精度可以减少存储和计算开销，但 Kimi K3 的整体体量仍然很大，下载完整仓库就需要约 1.56 TB 空间。</p><p>开放范围还包括高性能注意力内核、MoE 通信库，以及用于规模化运行智能体环境的基础设施。开发者可以结合技术报告了解模型训练与推理结构，而不只是在网页或 API 中调用成品模型。</p><h2 id="开发者可以下载部署或调用-API"><a href="#开发者可以下载部署或调用-API" class="headerlink" title="开发者可以下载部署或调用 API"></a>开发者可以下载部署或调用 API</h2><p>模型仓库包含 Transformers 所需的配置、分词器、图像处理器和模型代码。推理部署可使用 vLLM、SGLang 或 TokenSpeed；对应项目已经提供 Kimi K3 的运行说明。开发者也可以在 Kimi API 中选择 <code>kimi-k3</code>，通过兼容 OpenAI 或 Anthropic 的接口调用，无需自行下载完整权重。</p><p>Kimi K3 始终开启思考模式。多轮对话和工具调用需要把上一轮返回的完整 assistant 消息继续传入，包括 <code>reasoning_content</code> 和 <code>tool_calls</code>。如果只保留最终回答，模型会丢失用于延续任务的思考历史。终端用户也可以在 Kimi Code 中通过 <code>/model</code> 选择 Kimi K3。</p><h2 id="开放权重使用-Kimi-K3-License"><a href="#开放权重使用-Kimi-K3-License" class="headerlink" title="开放权重使用 Kimi K3 License"></a>开放权重使用 Kimi K3 License</h2><p>模型代码和权重使用专门的 Kimi K3 License，不是 Apache-2.0 或 MIT。许可证允许使用、复制、修改、分发、再授权、销售、部署和微调模型，也允许制作衍生作品，但使用者需要保留版权与许可声明，并遵守适用法律。</p><p>许可证对商业服务设有额外条件。如果企业以 API 等形式向第三方提供模型推理或微调服务，企业及其关联方连续 12 个月合计收入超过 2000 万美元，需要先与月之暗面签订单独协议，才能将 Kimi K3 或其衍生作品用于商业用途。</p><p>如果使用 Kimi K3 的商业产品月活跃用户超过 1 亿，或月收入超过 2000 万美元，产品界面需要显著展示“Kimi K3”。内部使用，以及通过月之暗面官方产品或认证推理合作伙伴使用模型，不适用这两项额外要求。准备将模型用于商业服务的团队，应先按自己的业务模式核对完整许可证文本。</p><ul><li>模型权重：<a href="https://huggingface.co/moonshotai/Kimi-K3">https://huggingface.co/moonshotai/Kimi-K3</a></li><li>技术报告：<a href="https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf">https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf</a></li></ul>]]></content>
    
    
    <summary type="html">月之暗面开放 Kimi K3 完整模型权重并发布技术报告。2.8 万亿参数模型采用 MoE 架构，支持约 100 万 Token 上下文和原生图像理解；本文说明 Hugging Face 下载体量、部署方式，以及 Kimi K3 License 对商业服务和大型产品的使用条件，帮助开发者判断自托管资源与合规边界。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="open-source" scheme="https://51allai.com/tags/open-source/"/>
    
    <category term="multimodal" scheme="https://51allai.com/tags/multimodal/"/>
    
    <category term="moonshot" scheme="https://51allai.com/tags/moonshot/"/>
    
    <category term="kimi" scheme="https://51allai.com/tags/kimi/"/>
    
  </entry>
  
  <entry>
    <title>多名在华 giffgaff 用户收到停服通知，长期境外使用被判定不符合资格</title>
    <link href="https://51allai.com/posts/2026/07/giffgaff-overseas-service-disconnection/"/>
    <id>https://51allai.com/posts/2026/07/giffgaff-overseas-service-disconnection/</id>
    <published>2026-07-27T14:31:27.000Z</published>
    <updated>2026-07-27T14:31:27.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>7 月 27 日，多名在中国使用 giffgaff 的用户收到内容一致的停服通知。通知称，服务主要供英国境内使用，漫游只面向短期旅行；被判定长期或永久在英国境外使用的号码将被断开。依赖该号码接收验证码的用户应立即迁移账号，并尽快申请 PAC 携号转网。<br><img src="https://images.51allai.com/blog/giffgaff-overseas-service-disconnection-cover-5x2_20260727_223619.png" alt="giffgaff 在华用户收到长期境外使用停服通知" fetchpriority="high" decoding="async"></p></blockquote><h2 id="多名在华用户收到相同停服通知"><a href="#多名在华用户收到相同停服通知" class="headerlink" title="多名在华用户收到相同停服通知"></a>多名在华用户收到相同停服通知</h2><p>2026 年 7 月 27 日，多名在中国使用 giffgaff 的用户公开了收到的英文邮件。邮件正文基本一致：giffgaff 在审查账户使用情况后，决定断开相关号码的服务。</p><p>通知把原因指向使用地点和持续时间。邮件写明，giffgaff 服务主要供英国境内使用，漫游用于短期旅行；当使用模式显示号码被长期或永久用于英国境外时，账户不再符合该移动服务的资格，服务及相关访问将很快停止。</p><p>这类通知直接针对具体号码。收到邮件的用户不能再把该号码当作稳定的长期境外收码工具。手机银行、邮箱、社交平台和开发者账号如果仍把它用于短信验证码或找回密码，应先换绑到能够持续控制的号码，并保存现有账号的恢复代码。</p><h2 id="这不是常见的半年无活动停号"><a href="#这不是常见的半年无活动停号" class="headerlink" title="这不是常见的半年无活动停号"></a>这不是常见的半年无活动停号</h2><p>giffgaff 原有的无活动停号规则以六个月为周期。用户在六个月内拨打一次符合条件的电话、发送一次短信或彩信、使用一次移动数据，或购买一次话费和套餐，可以让 SIM 保持活跃。</p><p>7 月 27 日公开的停服邮件采用了另一套理由。邮件没有把停服归因于六个月没有使用，而是明确写到长期或永久在英国境外使用。定期发一条短信或充值只能满足无活动规则，不能改变号码长期连接境外漫游网络形成的使用记录。</p><p>两种规则的处理重点不同。无活动停号关注号码是否在半年内产生过指定活动；这批通知关注号码是否被长期放在英国境外使用。过去依靠半年内偶尔充值或发短信保号的做法，无法解决通知中指出的长期境外使用问题。</p><h2 id="公平使用条款允许断开-SIM"><a href="#公平使用条款允许断开-SIM" class="headerlink" title="公平使用条款允许断开 SIM"></a>公平使用条款允许断开 SIM</h2><p>giffgaff 的公平使用条款把英国之外的漫游定位为阶段性旅行用途。条款针对欧盟及部分指定目的地写明，漫游应符合度假或短期旅行的消费模式；在四个月内有 63 天或以上在境外使用、又不能证明主要在英国使用或停留时，可能被认定为不公平使用。</p><p>63 天规则只写给欧盟及指定目的地，不能直接当作中国漫游号码的安全期限。对中国等其他目的地，用户需要按实际收到的通知和账户状态处理，不能把一次回英国、一次充值或一次短信视为可以继续长期境外使用的保证。</p><p>同一份公平使用条款还写明，当 giffgaff 合理怀疑用户没有遵守规则时，可以加收费用，或在尝试联系用户后断开 SIM 或套餐。7 月 27 日邮件使用的措辞与这项执行权一致：先说明已审查使用情况，再通知服务即将被断开。</p><h2 id="收到通知后先处理号码和验证码"><a href="#收到通知后先处理号码和验证码" class="headerlink" title="收到通知后先处理号码和验证码"></a>收到通知后先处理号码和验证码</h2><p>先检查所有依赖该号码的账号。把短信双重验证改到新的长期号码，能改用验证器应用或硬件安全密钥的账号应同时调整；下载并离线保存恢复代码。对于银行、支付和邮箱账号，要确认找回邮箱、备用号码和身份验证信息仍然可用。</p><p>需要保留英国号码的用户应尽快联系 giffgaff 代理并申请 PAC。PAC 是英国移动号码的携号转网代码。giffgaff 的帮助页面写明，号码停用后的 30 天内仍可向代理申请 PAC；超过 30 天，号码可能回到号码池并被重新分配。能否在境外完成转网，还取决于接收号码的英国运营商及其开卡要求。</p><p>账户中仍有话费余额时，也应在停用后的 30 天内联系代理。帮助页面允许用户在这一期限内申请剩余话费退款，同时注明因不允许的使用而停用时不提供退款。申请时应保留停服邮件、余额页面和与代理沟通的记录。</p><p>在号码迁移完成前，不要退出仍保持登录状态的重要账号，也不要删除现有 eSIM 配置。先完成验证码换绑、恢复方式检查和 PAC 申请，再处理旧卡，可以减少号码突然失效带来的账号找回风险。</p>]]></content>
    
    
    <summary type="html">多名在中国使用 giffgaff 的用户于 7 月 27 日收到停服通知，邮件把长期或永久在英国境外使用列为不符合服务资格的原因。本文梳理通知内容、与半年无活动停号规则的区别，以及号码迁移、短信验证和余额处理步骤。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="giffgaff" scheme="https://51allai.com/tags/giffgaff/"/>
    
    <category term="roaming" scheme="https://51allai.com/tags/roaming/"/>
    
    <category term="sim-card" scheme="https://51allai.com/tags/sim-card/"/>
    
    <category term="service-termination" scheme="https://51allai.com/tags/service-termination/"/>
    
  </entry>
  
  <entry>
    <title>腾讯让 QQ 宠物回归手机端，升级 3D 形象并接入 Hy3</title>
    <link href="https://51allai.com/posts/2026/07/qq-pet-mobile-hy3/"/>
    <id>https://51allai.com/posts/2026/07/qq-pet-mobile-hy3/</id>
    <published>2026-07-27T10:24:02.000Z</published>
    <updated>2026-07-27T10:24:02.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>腾讯于7月27日在安卓和iOS版手机QQ上线全新QQ宠物。用户可搜索“QQ宠物”进入，领养3D企鹅、狗狗或蒜头鹅，并通过喂食、洗澡、打工和好友串门互动；宠物接入Hy3大模型，可主动回应并生成每日宠物日记。<br><img src="https://images.51allai.com/blog/qq-pet-mobile-hy3-cover_20260727_182754.png" alt="QQ宠物3D形象与Hy3互动功能" fetchpriority="high" decoding="async"></p></blockquote><h2 id="QQ宠物回到手机QQ"><a href="#QQ宠物回到手机QQ" class="headerlink" title="QQ宠物回到手机QQ"></a>QQ宠物回到手机QQ</h2><p>QQ宠物已在安卓和iOS版手机QQ上线。打开手机QQ后，直接搜索“QQ宠物”就能进入，不需要另外安装一款宠物应用。</p><p>原版QQ宠物主要在电脑端运行，并于2018年停止服务。这次上线的是面向手机QQ重新设计的产品：宠物换成3D形象，互动入口也进入聊天列表和对话等手机QQ场景。</p><h2 id="从单一企鹅变成三类3D宠物"><a href="#从单一企鹅变成三类3D宠物" class="headerlink" title="从单一企鹅变成三类3D宠物"></a>从单一企鹅变成三类3D宠物</h2><p>新版保留了经典企鹅，同时加入狗狗和蒜头鹅。领养时可以选择宠物类型，再设置昵称和性格。进入主界面后，用户可以旋转查看3D形象，点按宠物与它互动，也可以为它换衣服。</p><p>喂食、洗澡、学习和打工等养成玩法仍然保留。新版取消了宠物死亡机制，日常操作更接近轻量化的虚拟陪伴，不需要围绕宠物存活反复操作。</p><h2 id="Hy3让宠物不再只有固定台词"><a href="#Hy3让宠物不再只有固定台词" class="headerlink" title="Hy3让宠物不再只有固定台词"></a>Hy3让宠物不再只有固定台词</h2><p>新QQ宠物接入了腾讯Hy3大模型。大模型在这里的作用，是让宠物能结合当前场景生成回应，而不是只从预先写好的句子中挑选一条。用户选择的性格会影响宠物的表现方式，宠物也会主动打招呼、分享它的活动。</p><p>系统还会每日生成一篇宠物日记，把当天的养成和互动内容整理成文字。这项功能把喂食、打工等重复操作与持续变化的文字内容连接起来，是新版和旧式固定反馈之间最直接的区别。</p><h2 id="好友可以帮你喂食和洗澡"><a href="#好友可以帮你喂食和洗澡" class="headerlink" title="好友可以帮你喂食和洗澡"></a>好友可以帮你喂食和洗澡</h2><p>QQ宠物没有只停留在单人养成。用户可以前往好友的宠物空间，为好友的宠物喂食、洗澡，也可以进行“踩踩”互动。这些动作和QQ好友关系直接连接，其中互踩还能用来维持好友火花。</p><p>宠物也会出现在QQ的聊天列表和对话窗口等位置。用户不必每次都回到独立的宠物主页，在日常聊天时就能看到宠物并触发互动。</p><h2 id="如何领养新QQ宠物"><a href="#如何领养新QQ宠物" class="headerlink" title="如何领养新QQ宠物"></a>如何领养新QQ宠物</h2><p>打开安卓或iOS版手机QQ，在客户端内搜索“QQ宠物”，打开对应入口即可开始领养。选好宠物类型、昵称和性格后，就可以进入3D宠物主界面，使用喂食、洗澡、换装、学习和打工等功能。</p>]]></content>
    
    
    <summary type="html">QQ宠物于7月27日回归安卓和iOS版手机QQ，采用3D企鹅、狗狗与蒜头鹅形象，保留喂食、洗澡、打工等养成玩法，并接入腾讯Hy3大模型提供主动回应、宠物日记与好友互动。本文说明入口、核心变化和普通用户的使用方式。</summary>
    
    
    
    <category term="行业观察" scheme="https://51allai.com/categories/%E8%A1%8C%E4%B8%9A%E8%A7%82%E5%AF%9F/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="companion-ai" scheme="https://51allai.com/tags/companion-ai/"/>
    
    <category term="tencent" scheme="https://51allai.com/tags/tencent/"/>
    
    <category term="qq" scheme="https://51allai.com/tags/qq/"/>
    
    <category term="hunyuan" scheme="https://51allai.com/tags/hunyuan/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 将于 8 月 9 日停用 Atlas</title>
    <link href="https://51allai.com/posts/2026/07/openai-atlas-shutdown/"/>
    <id>https://51allai.com/posts/2026/07/openai-atlas-shutdown/</id>
    <published>2026-07-27T09:16:34.000Z</published>
    <updated>2026-07-27T09:16:34.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 计划在 2026 年 8 月 9 日停止运行 ChatGPT Atlas，浏览器智能体能力将转入 ChatGPT 与 Codex。Atlas 用户应在停用前导出书签、保存重要标签页和历史记录；ChatGPT 对话与 Atlas 浏览器数据分开，不受这次迁移影响。<br><img src="https://images.51allai.com/blog/openai-atlas-shutdown-cover_20260727_171943.png" alt="OpenAI 停用 ChatGPT Atlas 并迁移浏览器智能体能力" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Atlas-将在-8-月-9-日停止运行"><a href="#Atlas-将在-8-月-9-日停止运行" class="headerlink" title="Atlas 将在 8 月 9 日停止运行"></a>Atlas 将在 8 月 9 日停止运行</h2><p>ChatGPT Atlas 是 OpenAI 在 2025 年 10 月推出的 macOS 浏览器，把 ChatGPT、网页浏览和智能体操作放在同一个窗口中。用户可以让 ChatGPT 理解当前页面，也可以用智能体模式打开标签页、点击网页并完成多步任务。</p><p>这款独立浏览器计划于 2026 年 8 月 9 日停止运行。届时，Atlas 可能无法继续打开、浏览网页或执行基于浏览器的智能体工作流。公告到停用日之间约有 30 天，现有用户需要在截止日期前完成数据整理和迁移。</p><p>Atlas 停用后不应继续作为日常浏览器使用。浏览器依赖持续的安全维护，迁移到仍受支持的浏览器体验，可以继续获得后续更新与安全修复。</p><h2 id="浏览器智能体能力转入-ChatGPT-与-Codex"><a href="#浏览器智能体能力转入-ChatGPT-与-Codex" class="headerlink" title="浏览器智能体能力转入 ChatGPT 与 Codex"></a>浏览器智能体能力转入 ChatGPT 与 Codex</h2><p>Atlas 停用不等于 OpenAI 放弃浏览器智能体。原先放在独立浏览器里的能力将转入 ChatGPT 与 Codex，目标体验包括多标签页、下载、改进的页面导航和账号登录支持。</p><p>需要让智能体在网页中完成较长任务的用户，可以改用新的 ChatGPT 桌面应用。Codex 继续承担软件开发和技术工作，ChatGPT 中的 Work 用于研究、分析以及生成文档、表格、演示文稿等交付物。两者在桌面端都可以在用户授权后使用本地文件和应用。</p><p>如果只想在现有浏览器里获得 ChatGPT 辅助，可以改用 Chrome 扩展程序或侧边栏。不同入口的开放范围由套餐、地区、设备和工作空间设置决定，迁移前应先确认自己的账号能使用哪一种入口。</p><h2 id="书签、标签页和历史记录不会自动搬走"><a href="#书签、标签页和历史记录不会自动搬走" class="headerlink" title="书签、标签页和历史记录不会自动搬走"></a>书签、标签页和历史记录不会自动搬走</h2><p>Atlas 的浏览器数据不会随产品迁移自动进入新应用。书签需要从 Atlas 导出为 HTML 文件，再导入 Chrome 等浏览器。导出时应把文件保存到容易找到的位置，并在新浏览器中检查书签文件夹是否完整。</p><p>已打开的标签页也不会自动转移。仍在使用的页面应提前加入书签，或把 URL 复制到文档中。浏览历史同样需要人工筛选：以后还要访问的页面，应在停用日前保存或收藏。</p><p>ChatGPT 对话记录与 Atlas 浏览器数据相互独立。只要账号、套餐和工作空间访问权限保持有效，原有 ChatGPT 对话仍可在 ChatGPT 中使用，不需要随书签一起导出。</p><h2 id="Atlas-用户现在需要做什么"><a href="#Atlas-用户现在需要做什么" class="headerlink" title="Atlas 用户现在需要做什么"></a>Atlas 用户现在需要做什么</h2><p>先打开 Atlas 的书签菜单或书签管理器，选择导出书签，把生成的 HTML 文件保存到本地。随后在 Chrome 中打开“书签和列表”，选择“导入书签和设置”，再载入这份 HTML 文件。</p><p>接着逐一检查仍打开的标签页和浏览历史，把重要页面加入书签或记录 URL。团队用户还应更新内部文档、入职材料和操作指南中对 Atlas 的引用，并提醒成员在 8 月 9 日前完成迁移。</p><p>最后，根据实际任务选择后续入口：需要多步骤网页操作时使用 ChatGPT 桌面应用；开发任务继续进入 Codex；希望保留 Chrome 浏览习惯的用户可使用 ChatGPT 扩展程序或侧边栏。迁移完成后，再把 Atlas 从默认浏览器和日常工作流中移除。</p>]]></content>
    
    
    <summary type="html">OpenAI 将于 2026 年 8 月 9 日停用 ChatGPT Atlas，并把浏览器智能体能力迁入 ChatGPT 与 Codex。本文说明书签、标签页、浏览历史和 ChatGPT 对话的迁移规则，以及 Atlas 用户在停用前需要完成的保存步骤，帮助用户避免在切换后丢失重要页面和工作入口等关键信息。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="desktop-agent" scheme="https://51allai.com/tags/desktop-agent/"/>
    
    <category term="chatgpt" scheme="https://51allai.com/tags/chatgpt/"/>
    
    <category term="chatgpt-atlas" scheme="https://51allai.com/tags/chatgpt-atlas/"/>
    
  </entry>
  
  <entry>
    <title>千问办公开放桌面客户端，支持 Office 文件与自动化任务</title>
    <link href="https://51allai.com/posts/2026/07/qwenwork-desktop-agent/"/>
    <id>https://51allai.com/posts/2026/07/qwenwork-desktop-agent/</id>
    <published>2026-07-27T07:56:26.000Z</published>
    <updated>2026-07-27T07:56:26.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>千问办公已提供 macOS 与 Windows 桌面客户端，以“任务”而不是单轮问答组织工作。它可生成和编辑 Office 文件、分析数据、处理本地文件并执行网页操作，个人版包含免费、标准和高级三个档位。<br><img src="https://images.51allai.com/blog/qwenwork-desktop-agent-cover_20260727_160204.png" alt="千问办公桌面 Agent 与 Office 自动化任务" fetchpriority="high" decoding="async"></p></blockquote><h2 id="从聊天窗口变成任务工作台"><a href="#从聊天窗口变成任务工作台" class="headerlink" title="从聊天窗口变成任务工作台"></a>从聊天窗口变成任务工作台</h2><p>千问办公是由钉钉科技有限公司、钉钉（中国）信息技术有限公司及其关联公司提供的 AI 办公 Agent。Agent 可以理解目标、拆解步骤并调用工具执行，不只是在对话框里生成一段文字。</p><p>产品以“任务对话”作为主要工作方式。用户可以在一个任务中提供目标、附件、格式要求和交付形式，再通过多轮对话调整内容。任务中可切换标准模型与旗舰模型：前者面向格式转换、翻译和模板邮件等规则明确的任务，后者用于研究报告、竞品分析和多步骤流程。</p><h2 id="可直接交付-Word、Excel、PPTX-和网页"><a href="#可直接交付-Word、Excel、PPTX-和网页" class="headerlink" title="可直接交付 Word、Excel、PPTX 和网页"></a>可直接交付 Word、Excel、PPTX 和网页</h2><p>千问办公支持生成 PPTX、Word、Excel 和 HTML 等产物，并可对 Office 文件进行预览和编辑。这与“把回答复制到办公软件”不同：用户可在原任务里要求修改结构、图表、样式或输出格式，已生成的 Word、Excel 和 PowerPoint 文件也可在线继续编辑。</p><p>它还包含图片、音频和视频内容理解，以及网页生成与发布能力。用户可以从自然语言需求开始制作静态或动态网页，预览后再发布；已发布网页可保留历史版本并切换回旧版。专家套件、技能和连接器则用于扩展特定岗位或外部服务的工作流。</p><h2 id="macOS-与-Windows-版已提供下载"><a href="#macOS-与-Windows-版已提供下载" class="headerlink" title="macOS 与 Windows 版已提供下载"></a>macOS 与 Windows 版已提供下载</h2><p>官网下载页已列出三个桌面安装包：macOS 包含 Apple 芯片版和 Intel 芯片版，系统需要 macOS 14 或更高版本；Windows 版需要 Windows 10 或更高版本，仅支持 64 位系统。</p><p>新建任务时，用户可以上传本地文件或从内置网盘选择资料。单条消息最多可添加 20 个网盘文件，每个文件最大 500 MB。任务产物会进入 Agent 工作区，可以预览、编辑、下载、重命名或删除。</p><h2 id="免费版可试用，个人订阅按积分分层"><a href="#免费版可试用，个人订阅按积分分层" class="headerlink" title="免费版可试用，个人订阅按积分分层"></a>免费版可试用，个人订阅按积分分层</h2><p>个人版分为免费、标准和高级三档。免费版为 0 元，活动期内新用户可获得 2,000 积分，有效期 90 天；每日登录赠送 100 积分，当日有效。积分用于执行模型与任务，不是云盘存储空间。</p><p>个人标准版连续包月限时价为 78 元，原价 98 元，每月包含 2,000 基础积分和 10 GB 网盘；个人高级版连续包月限时价为 158 元，原价 198 元，每月包含 4,000 基础积分和 20 GB 网盘。订阅价格和登录赠送均带有活动属性，付费前应以结算页展示为准。</p><h2 id="自动执行前先收紧权限"><a href="#自动执行前先收紧权限" class="headerlink" title="自动执行前先收紧权限"></a>自动执行前先收紧权限</h2><p>桌面 Agent 的差异来自“能操作”，风险也来自同一点。获得用户授权后，千问办公可能访问本地文件系统、浏览器会话、第三方账户、API 或数据库，并执行读取、写入、删除、移动、上传、下载或发送等操作。</p><p>实际使用时，应只授权完成任务必需的目录和账户，批量删除、覆盖文件、对外发送信息或发布网页前人工复核。内置网盘没有回收站，删除文件夹会永久删除其中内容；重要资料在交给 Agent 处理前，应先保留可独立恢复的备份。</p>]]></content>
    
    
    <summary type="html">千问办公开放 macOS 与 Windows 桌面客户端，可通过任务对话生成和编辑 Word、Excel、PPTX 与 HTML 等办公产物，并执行文件处理、网页操作和技能扩展。本文说明下载要求、个人版价格、使用方式与权限风险，帮助个人和团队判断它适合哪些工作，以及首次使用前需要完成哪些安全准备。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="desktop-agent" scheme="https://51allai.com/tags/desktop-agent/"/>
    
    <category term="alibaba" scheme="https://51allai.com/tags/alibaba/"/>
    
    <category term="qwenwork" scheme="https://51allai.com/tags/qwenwork/"/>
    
  </entry>
  
  <entry>
    <title>Vivix 同天发布 Vivix-A1 与 Vivix-W1</title>
    <link href="https://51allai.com/posts/2026/07/vivix-a1-w1-interactive-video/"/>
    <id>https://51allai.com/posts/2026/07/vivix-a1-w1-interactive-video/</id>
    <published>2026-07-24T04:08:23.000Z</published>
    <updated>2026-07-24T04:08:23.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Vivix 于 7 月 24 日发布 Vivix-A1 与 Vivix-W1。A1 面向能边听、边说、边行动的全身 AI 角色，W1 面向可被语音、文字、图片和触控持续改变的音视频世界；开发者平台已提供相关 API 文档，实时 W1 仍处于私测阶段。<br><img src="https://images.51allai.com/blog/vivix-a1-w1-interactive-video-cover_20260730_121228.png" alt="Vivix-A1 与 Vivix-W1 实时交互多模态模型封面" fetchpriority="high" decoding="async"></p></blockquote><h2 id="两款模型处理两类实时互动"><a href="#两款模型处理两类实时互动" class="headerlink" title="两款模型处理两类实时互动"></a>两款模型处理两类实时互动</h2><p>Vivix-A1 和 Vivix-W1 都采用流式生成，但解决的问题不同。A1 把交互集中在一个 AI 角色身上：角色可以在持续生成的画面里听取指令、说话、移动，并对场景中的物体采取行动。W1 把交互范围扩展到整个音视频世界，用户可以改变人物、物体、环境、镜头和后续事件。</p><p>这种方式与常见的“输入提示词，等待整段视频生成”不同。用户不必在开始前一次性给完条件。新输入可以在生成过程中加入，后面的画面和声音会沿着当前状态继续发展，而不是另起一段互不相干的视频。</p><h2 id="Vivix-A1-让角色边听边行动"><a href="#Vivix-A1-让角色边听边行动" class="headerlink" title="Vivix-A1 让角色边听边行动"></a>Vivix-A1 让角色边听边行动</h2><p>A1 是面向全身 AI 角色的实时全双工模型。“全双工”原本用于描述双方可以同时发送和接收信息的通信方式。在这里，它指角色说话和行动时仍能接收新输入，用户可以中途打断对话、改变要求，或让角色执行新的动作。</p><p>角色不只做口型和上半身手势。A1 支持在开放场景中走动、转身、拿取物品，并让表情、声音、视线、手势和全身动作共同构成回应。用户可以通过语音、文字和图片控制角色。图片也能在互动开始后加入，例如提供一张商品参考图，再让角色把对应物品带入场景并进行展示。</p><p>A1 直接在连续的多模态信号上生成回应。多模态指文字、声音、图片和视频等不同信息形式。它不要求所有声音先转换为文字，因此环境声音和语气也可以成为角色反应的条件。上层的 Director Agent 负责规划回答和动作，流式模型则持续生成画面与声音。</p><h2 id="Vivix-W1-让故事在播放中改写"><a href="#Vivix-W1-让故事在播放中改写" class="headerlink" title="Vivix-W1 让故事在播放中改写"></a>Vivix-W1 让故事在播放中改写</h2><p>W1 面向互动叙事和持续生成的音视频世界。文字、图片、音频和视频既可以定义开场，也可以在故事进行中成为新条件。触屏、鼠标点击、角色移动和镜头控制同样可以改变接下来发生的内容。</p><p>W1 会联合生成画面、对白、环境声、空间音效、音乐和动作，并在同一条生成流中安排多镜头叙事。故事切换人物或场景时，模型可以同时处理镜头位置、对白节奏和角色反应。用户中途加入一张图片或选择画面中的物体后，新信息会并入已有情境，后续故事从当前状态继续。</p><p>W1 在约 300 亿激活参数的中等训练规模上完成验证。激活参数是模型处理一次输入时实际参与计算的参数数量，不等于模型的全部参数。它支持多模态理解、实时交互、音画联合生成、多镜头叙事和连续流式输出。</p><h2 id="流式生成避免等待整段视频"><a href="#流式生成避免等待整段视频" class="headerlink" title="流式生成避免等待整段视频"></a>流式生成避免等待整段视频</h2><p>A1 和 W1 都把音视频拆成较小的连续片段逐步生成。每个新片段会参考前面已经发生的内容，同时接收用户刚加入的指令。这样可以更快显示变化，但也增加了长期保持人物、场景、声音和动作一致性的难度。</p><p>A1 使用短片段之间的局部连续性信号，并用全局序列信息维持较长时间的角色和场景状态。它还通过多维联合蒸馏把推理压缩到两步。蒸馏是用规模更大或计算步骤更多的模型训练精简版本，以减少每次生成所需的计算。</p><p>W1 使用 Vivix-Turbo 降低流式生成的推理步数，并联合优化镜头规划、时间连续性和多模态参考的一致性。它需要同时控制人物身份、场景、镜头、声音和动作，避免故事持续时间变长后逐渐偏离此前状态。</p><h2 id="开发者可以从-A1-API-开始接入"><a href="#开发者可以从-A1-API-开始接入" class="headerlink" title="开发者可以从 A1 API 开始接入"></a>开发者可以从 A1 API 开始接入</h2><p>Vivix 开发者平台提供实时角色和异步视频生成两类接口。实时角色使用 <code>vivix-a1-stream</code> 或轻量版 <code>vivix-a1-stream-lite</code>，开发者先通过 REST 创建会话，再用实时媒体流接收音视频，并通过 WebSocket 控制通道发送文字、动作和其他交互事件。</p><p>只需要生成一份完整视频文件时，可以使用异步接口。A1 系列包含 <code>vivix-a1-lite</code> 和 <code>vivix-a1</code>，W1 系列包含 <code>vivix-w1-fast</code> 和 <code>vivix-w1</code>。开发者提交任务后查询处理状态，完成后取得视频播放地址。</p><p>面向实时互动世界的 <code>vivix-w1-stream</code> 仍处于 private beta。开发者可以在官网注册账号、创建 API Key，并通过等待名单申请模型权限。API Key 应保存在服务端，不能直接放进网页或移动应用。</p><h2 id="两款模型各有已公开的使用边界"><a href="#两款模型各有已公开的使用边界" class="headerlink" title="两款模型各有已公开的使用边界"></a>两款模型各有已公开的使用边界</h2><p>A1 在快速运动、空间导航和精细的人物与物体交互中，可能出现动作不一致、交互位置漂移或物理关系不准确。它更适合先从客服角色、现场表演、互动教学和商品讲解等边界清楚的场景开始验证。</p><p>W1 当前版本在专业级画面质量、复杂动作和高密度场景上，与面向离线成片训练的视频模型仍有差距。需要稳定成片和精细后期控制的项目，可以先使用异步生成；需要观众在播放中改变角色或故事时，再评估实时流式模型。</p>]]></content>
    
    
    <summary type="html">Vivix 同天发布 Vivix-A1 与 Vivix-W1，把实时交互引入 AI 角色和故事生成。本文说明两款模型的功能差异、语音与图像等交互方式、流式音视频机制、API 接入范围及当前公开限制，帮助开发者判断适用场景。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="multimodal" scheme="https://51allai.com/tags/multimodal/"/>
    
    <category term="video-generation" scheme="https://51allai.com/tags/video-generation/"/>
    
    <category term="vivix" scheme="https://51allai.com/tags/vivix/"/>
    
  </entry>
  
  <entry>
    <title>Codex 接入 GPT-Live，支持语音启动和调度任务</title>
    <link href="https://51allai.com/posts/2026/07/codex-gpt-live-voice/"/>
    <id>https://51allai.com/posts/2026/07/codex-gpt-live-voice/</id>
    <published>2026-07-24T03:29:47.000Z</published>
    <updated>2026-07-24T03:29:47.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 为桌面端 Codex 接入由 GPT-Live 驱动的 ChatGPT Voice。用户可以边说边启动任务、询问进度、打断执行并调整方向，语音对话与后台工作不必轮流等待。<br><img src="https://images.51allai.com/blog/codex-gpt-live-voice-cover_20260724_113308.png" alt="Codex GPT-Live 语音启动和调度任务" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Codex-从语音输入变成实时语音协作"><a href="#Codex-从语音输入变成实时语音协作" class="headerlink" title="Codex 从语音输入变成实时语音协作"></a>Codex 从语音输入变成实时语音协作</h2><p>2026 年 7 月 23 日发布的 ChatGPT 桌面应用 26.715，把 ChatGPT Voice 带到了 Codex。它与原有的语音听写不是同一种交互：听写会先把一段录音转成文字，再作为提示词发送；GPT-Live 支持实时双向语音，用户可以在系统说话时插话，也可以要求它先听完再回应。</p><p>这套语音能力不会替代 Codex 的任务执行界面。它更像一层实时控制入口：用户负责用自然语言说明目标、补充限制和改变优先级，Codex 继续在已有项目、工具和权限范围内处理工作。</p><h2 id="语音可以启动、查看和调整任务"><a href="#语音可以启动、查看和调整任务" class="headerlink" title="语音可以启动、查看和调整任务"></a>语音可以启动、查看和调整任务</h2><p>在 Codex 中开启 Voice 后，用户可以新建对话或任务，也可以让它查看其他线程的进度。任务运行期间，可以继续追问当前状态、了解阻塞原因，或用新的指令打断并调整方向。</p><p>Voice 还能在一次对话中协调多个智能体。用户不必逐个打开任务窗口确认状态，可以直接询问哪些任务仍在运行、哪些任务需要决策，再决定优先处理哪一个。通过语音发起的任务仍受 Codex 当前工具权限和审批规则约束。</p><h2 id="在桌面应用中开启-Voice"><a href="#在桌面应用中开启-Voice" class="headerlink" title="在桌面应用中开启 Voice"></a>在桌面应用中开启 Voice</h2><p>使用入口位于 ChatGPT 桌面应用。打开应用后切换到 Codex，进入新对话或现有项目，选择 Voice 控件并授权麦克风，然后直接说明要完成的工作。对话过程中，Codex 的回复会同步显示为文字。</p><p>macOS 用户还可以在设置中开启 Screen context。开启后，Voice 可以获取当前最前方窗口的一张 appshot，作为这次对话的屏幕上下文；这不是持续共享整个屏幕。该功能可能需要系统的屏幕与音频录制、辅助功能权限。</p><h2 id="支持桌面端和配对的-iOS-Remote"><a href="#支持桌面端和配对的-iOS-Remote" class="headerlink" title="支持桌面端和配对的 iOS Remote"></a>支持桌面端和配对的 iOS Remote</h2><p>Voice for Codex 面向 ChatGPT 桌面应用中的符合条件账户，支持 macOS 和 Windows。Codex 更新日志列出的计划包括 Plus、Pro、Business、Edu 和 Enterprise。配对桌面主机后，用户也可以从 iOS 的 Remote 入口使用这套语音能力。</p><p>Codex 仍不能作为独立模式直接从网页或手机端选择，移动端 Remote 连接的是桌面端正在运行的 Codex。系统同一时间只允许一场 Voice 对话。</p><p>Voice 使用单独的语音额度；由语音启动的 Codex 任务，仍从现有的智能体任务用量池中计费。对经常并行运行多个任务的用户，语音节省的是切换窗口和重复查看状态的操作，不会绕过原有用量、权限或审批限制。</p>]]></content>
    
    
    <summary type="html">Codex 接入 GPT-Live 后，用户可在 ChatGPT 桌面应用中用实时语音启动、查看和调整编码任务，并协调多个智能体。本文说明 macOS 与 Windows 的启用步骤、Screen context、配对 iOS Remote、单会话限制，以及语音额度和 Codex 任务用量的关系，帮助开发者判断这项功能适合哪些工作场景与使用方式。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="product-update" scheme="https://51allai.com/tags/product-update/"/>
    
    <category term="codex" scheme="https://51allai.com/tags/codex/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="desktop-agent" scheme="https://51allai.com/tags/desktop-agent/"/>
    
  </entry>
  
  <entry>
    <title>OpenAI 发布 Presence，把语音与聊天智能体交付给企业</title>
    <link href="https://51allai.com/posts/2026/07/openai-presence-enterprise-agents/"/>
    <id>https://51allai.com/posts/2026/07/openai-presence-enterprise-agents/</id>
    <published>2026-07-23T13:50:31.000Z</published>
    <updated>2026-07-23T13:50:31.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>OpenAI 发布 Presence，为企业部署语音与聊天智能体。它可以连接企业知识和业务系统，在明确权限内处理请求、执行获批操作或转交人工，并通过模拟评估和受控更新覆盖上线前后的管理流程。<br><img src="https://images.51allai.com/blog/openai-presence-enterprise-agents-cover-v2_20260723_215941.png" alt="OpenAI Presence 企业语音与聊天智能体" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Presence-不是一个新的聊天机器人"><a href="#Presence-不是一个新的聊天机器人" class="headerlink" title="Presence 不是一个新的聊天机器人"></a>Presence 不是一个新的聊天机器人</h2><p>OpenAI Presence 是一套面向企业的智能体交付产品，覆盖客户服务和内部工作流程。它支持实时语音与聊天，可用于处理账单问题、保险理赔或员工 IT 服务请求等具体工作。</p><p>每个智能体从一个明确任务开始，只获得完成这项任务所需的知识和系统访问权限。企业负责设定它可以执行哪些操作、哪些操作需要审批，以及什么情况下必须转交人工。智能体可以查询账户信息、应用业务规则并执行获批操作，但不能自行扩大权限。</p><p>这套产品不只提供对话模型。Presence 把业务政策、标准操作流程、护栏、允许执行的操作、模拟环境和评估工具放在同一套部署流程中。企业可以保留跨场景通用的政策和转交规则，再针对不同业务或语音、聊天渠道调整具体配置。</p><h2 id="上线前先测试结果、工具和转交流程"><a href="#上线前先测试结果、工具和转交流程" class="headerlink" title="上线前先测试结果、工具和转交流程"></a>上线前先测试结果、工具和转交流程</h2><p>智能体面对真实用户前，团队可以用常见请求、边界情况和高风险场景进行模拟。评估项目包括结果是否正确、是否遵守政策、是否使用了正确工具，以及是否在规定情况下转交人工。交互超出企业设定范围时，护栏可以介入。</p><p>这类测试关注的不只是回答是否通顺。一个能访问业务系统的智能体还要证明自己没有越权，调用了正确工具，并在需要人类判断时停止自动处理。</p><h2 id="Codex-负责提出更新，团队决定是否上线"><a href="#Codex-负责提出更新，团队决定是否上线" class="headerlink" title="Codex 负责提出更新，团队决定是否上线"></a>Codex 负责提出更新，团队决定是否上线</h2><p>部署后，生产会话、人工转交记录和质量信号会暴露流程中的缺口。Codex 通过 Presence 插件分析这些信号并提出修改建议。团队可以把建议与生产版本进行对比测试，确认后再分批上线。</p><p>产品政策或用户行为发生变化时，企业不必直接修改正在运行的智能体。建议、测试、批准和受控发布被拆成独立步骤，生产环境的最终决定仍由团队掌握。</p><h2 id="目前只面向符合条件的企业"><a href="#目前只面向符合条件的企业" class="headerlink" title="目前只面向符合条件的企业"></a>目前只面向符合条件的企业</h2><p>Presence 已通过限量正式开放计划提供给符合条件的企业客户。部署由 OpenAI 的前沿部署工程师和指定的全球系统集成商主导，包括确定具体流程、连接知识与业务系统、设置权限和政策、测试并投入生产。</p><p>它不是个人用户或开发者可以直接注册开通的自助产品。希望采用 Presence 的企业需要联系自己的 OpenAI 客户团队。现有语音开发者仍可通过 OpenAI API 使用前沿模型，但这条 API 路径与 Presence 的企业交付服务不同。</p>]]></content>
    
    
    <summary type="html">OpenAI 发布 Presence，为企业交付可接入业务系统的语音与聊天智能体。产品围绕单一工作配置权限、审批和人工接管规则，并提供上线前模拟评估及由 Codex 辅助的持续改进流程。</summary>
    
    
    
    <category term="智能体" scheme="https://51allai.com/categories/%E6%99%BA%E8%83%BD%E4%BD%93/"/>
    
    
    <category term="codex" scheme="https://51allai.com/tags/codex/"/>
    
    <category term="agent-framework" scheme="https://51allai.com/tags/agent-framework/"/>
    
    <category term="openai" scheme="https://51allai.com/tags/openai/"/>
    
    <category term="presence" scheme="https://51allai.com/tags/presence/"/>
    
    <category term="enterprise" scheme="https://51allai.com/tags/enterprise/"/>
    
  </entry>
  
  <entry>
    <title>通义发布 Qwen-Image-3.0，支持 4.5K Token 长指令与 12 种语言</title>
    <link href="https://51allai.com/posts/2026/07/qwen-image-30/"/>
    <id>https://51allai.com/posts/2026/07/qwen-image-30/</id>
    <published>2026-07-22T03:08:13.000Z</published>
    <updated>2026-07-22T03:08:13.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>通义发布 Qwen-Image-3.0，最长可处理 4.5K Token 的图像生成指令，并支持 10px 小字、12 种语言和 100 多种艺术风格。新版本面向信息图、报纸、分镜、试卷与界面等文字密集型图片，普通用户可从发布页面进入千问网页端体验。<br><img src="https://images.51allai.com/blog/qwen-image-30-cover_20260722_112006.png" alt="Qwen-Image-3.0 长指令与多语言图像生成模型" fetchpriority="high" decoding="async"></p></blockquote><h2 id="最长可处理-4-5K-Token-指令"><a href="#最长可处理-4-5K-Token-指令" class="headerlink" title="最长可处理 4.5K Token 指令"></a>最长可处理 4.5K Token 指令</h2><p>Qwen-Image-3.0 是 Qwen-Image 系列的第三代图像生成基础模型。它把可接受的指令长度提高到 4.5K Token。Token 是模型处理文字时使用的基本单位；可用长度越高，一条提示词就能容纳越多场景、文字、位置和版式要求。</p><p>长指令主要服务于信息密度较高的图片。用户可以在一次生成中描述报纸、分镜、试卷、数学课件或多格信息图，并分别指定每个区域的内容。Qwen-Image-3.0 的发布示例中，一条约 3.7K Token 的指令用于生成 3×3 信息图，九个区域包含不同主题、公式、图表与中英文文字，整张图一次完成，不需要逐格拼接。</p><h2 id="支持-10px-小字和-12-种语言"><a href="#支持-10px-小字和-12-种语言" class="headerlink" title="支持 10px 小字和 12 种语言"></a>支持 10px 小字和 12 种语言</h2><p>Qwen-Image-3.0 支持渲染小至 10px 的文字，覆盖正文、公式、上下标、注释和图表标签等细小元素。对于海报、课件和社交图片之外的任务，这项能力更适合报纸页面、论文排版、知识图解等文字占比较高的画面。</p><p>模型原生支持 12 种语言、多种字体和 100 多种艺术风格。多语言文字可以与插图、照片质感和界面元素放在同一张图里，适合制作本地化海报、商品页和面向不同语言用户的内容素材。</p><h2 id="同一模型覆盖生成与编辑场景"><a href="#同一模型覆盖生成与编辑场景" class="headerlink" title="同一模型覆盖生成与编辑场景"></a>同一模型覆盖生成与编辑场景</h2><p>Qwen-Image-3.0 既能根据文字从零生成图片，也能在已有图片上继续编辑。可用方式包括给书页添加手写批注、补全受损画面、为照片加入信息标注，以及把现有素材整理成结构化信息图。</p><p>编辑任务仍然通过自然语言描述目标。用户需要说明要修改的区域、保留的内容和新增元素，模型据此处理图片，不必先在图像软件中完成复杂选区。</p><h2 id="普通用户怎么用"><a href="#普通用户怎么用" class="headerlink" title="普通用户怎么用"></a>普通用户怎么用</h2><p>普通用户可从 Qwen-Image-3.0 发布页面进入千问网页端，使用图像生成功能输入提示词。制作复杂图片时，可以先写清画布用途和整体风格，再按区域列出文字、对象与位置关系；需要编辑现有图片时，则先上传图片并说明修改范围。</p><p>4.5K Token 指令更适合一次描述完整成品，但指令仍需具体。报纸、课件或多格信息图应分别写明标题、分区、文字内容和视觉层级，减少同一区域出现相互冲突的要求。</p>]]></content>
    
    
    <summary type="html">通义发布 Qwen-Image-3.0 图像生成模型，最长可处理 4.5K Token 指令，支持 10px 小字、12 种语言和 100 多种艺术风格。本文说明它如何生成信息图、报纸、分镜与界面，并介绍普通用户在千问网页端的使用入口。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="image-generation" scheme="https://51allai.com/tags/image-generation/"/>
    
    <category term="alibaba" scheme="https://51allai.com/tags/alibaba/"/>
    
    <category term="qwen" scheme="https://51allai.com/tags/qwen/"/>
    
  </entry>
  
  <entry>
    <title>Google 发布三款 Gemini 模型，3.6 Flash 评测输出 Token 用量降低 17%</title>
    <link href="https://51allai.com/posts/2026/07/google-gemini-36-flash-models/"/>
    <id>https://51allai.com/posts/2026/07/google-gemini-36-flash-models/</id>
    <published>2026-07-22T01:43:29.000Z</published>
    <updated>2026-07-22T01:43:29.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。其中，3.6 Flash 在一组综合评测中比 3.5 Flash 少用 17% 输出 Token；前两款已开放 API，Cyber 版将通过 CodeMender 限量提供。<br><img src="https://images.51allai.com/blog/google-gemini-36-flash-models-cover_20260722_094831.png" alt="Google 三款 Gemini 模型与 3.6 Flash Token 效率" fetchpriority="high" decoding="async"></p></blockquote><h2 id="三款模型分别处理通用任务、高吞吐任务和代码安全"><a href="#三款模型分别处理通用任务、高吞吐任务和代码安全" class="headerlink" title="三款模型分别处理通用任务、高吞吐任务和代码安全"></a>三款模型分别处理通用任务、高吞吐任务和代码安全</h2><p>Gemini 3.6 Flash 是这次更新中的通用型号，面向编程、知识工作、多模态理解和需要连续调用工具的多步任务。多模态指模型可以同时处理文字、图片、音频、视频和 PDF，而不是只接收文字。</p><p>Gemini 3.5 Flash-Lite 把重点放在高吞吐和低成本，适合批量文档解析、结构化数据提取，以及由多个小型执行单元分工完成的智能体任务。Gemini 3.5 Flash Cyber 则建立在 3.5 Flash 之上，针对查找、验证和修复软件漏洞做了专门调整，并与代码安全智能体 CodeMender 配套使用。</p><h2 id="3-6-Flash-同时减少输出用量和输出单价"><a href="#3-6-Flash-同时减少输出用量和输出单价" class="headerlink" title="3.6 Flash 同时减少输出用量和输出单价"></a>3.6 Flash 同时减少输出用量和输出单价</h2><p>在一组覆盖知识、推理与编程等任务的第三方综合评测中，Gemini 3.6 Flash 完成任务时使用的输出 Token 比 3.5 Flash 少 17%。Token 是模型处理和计费的基本文本单位；同一任务需要的输出 Token 越少，通常代表生成过程更精简。17% 是这组评测的整体结果，不是每次调用都固定减少 17%。</p><p>Gemini 3.6 Flash 的 API 输入价格保持每百万 Token 1.50 美元，输出价格从 3.5 Flash 的 9 美元降到 7.50 美元，输出单价降低约 16.7%。实际账单还会受到输入长度、输出长度和调用次数影响。</p><p>模型 ID 为 <code>gemini-3.6-flash</code>，支持 1,048,576 个输入 Token 和 65,536 个输出 Token。它可以接收文字、图片、视频、音频和 PDF，输出为文字。</p><h2 id="Flash-Lite-面向批量文档和轻量任务"><a href="#Flash-Lite-面向批量文档和轻量任务" class="headerlink" title="Flash-Lite 面向批量文档和轻量任务"></a>Flash-Lite 面向批量文档和轻量任务</h2><p>Gemini 3.5 Flash-Lite 的模型 ID 是 <code>gemini-3.5-flash-lite</code>。API 价格为每百万输入 Token 0.30 美元、每百万输出 Token 2.50 美元，比 3.6 Flash 更适合大量、重复、单次复杂度较低的任务。</p><p>它与 3.6 Flash 一样支持 1,048,576 个输入 Token 和 65,536 个输出 Token，也能读取文字、图片、视频、音频和 PDF。典型用途包括批量读取票据、从长文档抽取字段、生成结构化 JSON，以及让主智能体把较简单的子任务交给它执行。</p><h2 id="Flash-Cyber-只通过-CodeMender-限量开放"><a href="#Flash-Cyber-只通过-CodeMender-限量开放" class="headerlink" title="Flash Cyber 只通过 CodeMender 限量开放"></a>Flash Cyber 只通过 CodeMender 限量开放</h2><p>Gemini 3.5 Flash Cyber 不是面向所有开发者的通用 API 模型。它会先在 CodeMender 的限量试点中提供，开放对象为政府和可信合作伙伴。</p><p>CodeMender 会多次调用 Flash Cyber，让多个执行单元扫描代码路径、验证漏洞并合并成一份报告。这个专用型号与公开 Gemini API 分开部署，普通开发者不能直接选择它。</p><h2 id="两款通用模型已经可以接入"><a href="#两款通用模型已经可以接入" class="headerlink" title="两款通用模型已经可以接入"></a>两款通用模型已经可以接入</h2><p>Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 均已进入正式可用状态，开发者可以通过 Google AI Studio 和 Gemini API 调用。3.6 Flash 也已进入 Google Antigravity 与 Gemini 应用；企业用户还可以在 Gemini Enterprise Agent Platform 中使用。</p><p>接入新模型时需要检查现有请求参数。<code>temperature</code>、<code>top_p</code> 和 <code>top_k</code> 已被弃用，接口会忽略这些自定义值；把最后一轮对话预填为模型回复也不再受支持。迁移旧应用时，先移除这些设置可以避免后续接口报错。</p>]]></content>
    
    
    <summary type="html">Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。本文梳理 3.6 Flash 在评测中的 17% 输出 Token 降幅、两款通用模型的 API 定价与开放入口，以及 Cyber 版的限量使用范围。</summary>
    
    
    
    <category term="大模型" scheme="https://51allai.com/categories/%E5%A4%A7%E6%A8%A1%E5%9E%8B/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="pricing" scheme="https://51allai.com/tags/pricing/"/>
    
    <category term="google" scheme="https://51allai.com/tags/google/"/>
    
    <category term="gemini" scheme="https://51allai.com/tags/gemini/"/>
    
  </entry>
  
  <entry>
    <title>阿里上线 Qwen-Audio-3.0-TTS，提供 Flash 与 Plus 两个版本</title>
    <link href="https://51allai.com/posts/2026/07/qwen-audio-30-tts/"/>
    <id>https://51allai.com/posts/2026/07/qwen-audio-30-tts/</id>
    <published>2026-07-21T09:18:19.000Z</published>
    <updated>2026-07-21T09:18:19.000Z</updated>
    
    <content type="html"><![CDATA[<blockquote><p>阿里上线 Qwen-Audio-3.0-TTS，分为 Flash 和 Plus 两个版本。两者支持语音合成、自然语言指令与情绪、拟声标签，开发者可通过 DashScope API 调用。国际服务按输入字符计费，Flash 每万字符 0.15 美元，Plus 为 0.20 美元。<br><img src="https://images.51allai.com/blog/qwen-audio-30-tts-cover-first_20260721_172720.png" alt="Qwen-Audio-3.0-TTS Flash 与 Plus 语音合成模型" fetchpriority="high" decoding="async"></p></blockquote><h2 id="Flash-和-Plus-面向不同场景"><a href="#Flash-和-Plus-面向不同场景" class="headerlink" title="Flash 和 Plus 面向不同场景"></a>Flash 和 Plus 面向不同场景</h2><p>Qwen-Audio-3.0-TTS 把文字转换为可播放的语音，支持边接收文字边返回音频的流式输出。Flash 主要用于语音助手、智能客服等对响应速度敏感的互动场景；Plus 面向有声书、新闻播报和内容配音等更重视成品质量的任务。</p><p>两个版本的模型 ID 分别是 <code>qwen-audio-3.0-tts-flash</code> 和 <code>qwen-audio-3.0-tts-plus</code>。它们属于 Qwen-Audio-TTS 产品线，不要与年初发布的 Qwen3-TTS 模型 ID 混用。</p><h2 id="用自然语言和标签控制表达"><a href="#用自然语言和标签控制表达" class="headerlink" title="用自然语言和标签控制表达"></a>用自然语言和标签控制表达</h2><p>调用接口时，可以在 <code>instruction</code> 参数里直接描述语速、情绪、语气和音色。例如，一段客服播报可以要求“语速稍慢，语气温和”，不需要分别调节多组音频参数。</p><p>模型还允许把标签直接写入待合成文本。<code>[excited]</code> 和 <code>[serious]</code> 可在指定位置切换表达方式，<code>[laughing]</code>、<code>[gasp]</code> 和 <code>[sighing]</code> 可插入笑声、吸气或叹气。这类精细标签只适用于单向流式模式。</p><h2 id="支持多语言与中文方言"><a href="#支持多语言与中文方言" class="headerlink" title="支持多语言与中文方言"></a>支持多语言与中文方言</h2><p>系统预设音色支持范围依具体音色而定，目前包含普通话和英语。克隆音色可用于中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语、意大利语、泰语、印度尼西亚语、越南语、马来语、菲律宾语和阿拉伯语。</p><p>中文还可通过指令控制广东话、四川话、河南话、上海话等多种方言。实际可用范围与所选音色有关，调用前需按目标语言选择对应音色。</p><h2 id="开发者怎么用"><a href="#开发者怎么用" class="headerlink" title="开发者怎么用"></a>开发者怎么用</h2><p>开发者需要先在模型服务平台开通服务并配置 <code>DASHSCOPE_API_KEY</code>，然后通过 DashScope Python 或 Java SDK 建立 WebSocket 连接。请求中至少需要指定模型、音色和待合成文本；需要控制表达时，再加入 <code>instruction</code> 参数。输出可保存为 MP3、WAV、PCM 或 Opus 格式。</p><p>该服务按输入文本字符数计费，输出音频不单独计费。新加坡区域的国际服务中，Flash 价格为每 1 万字符 0.15 美元，Plus 为每 1 万字符 0.20 美元。国际服务新开通账户有 1 万字符免费额度，有效期为 90 天。</p>]]></content>
    
    
    <summary type="html">阿里上线 Qwen-Audio-3.0-TTS 语音合成模型，提供面向低延迟交互的 Flash 和面向高质量配音的 Plus 版本。本文说明指令与标签控制、多语言及中文方言范围、API 调用方式与按字符计费规则，并介绍两个版本各自适合的使用场景。</summary>
    
    
    
    <category term="多模态" scheme="https://51allai.com/categories/%E5%A4%9A%E6%A8%A1%E6%80%81/"/>
    
    
    <category term="model-release" scheme="https://51allai.com/tags/model-release/"/>
    
    <category term="audio-generation" scheme="https://51allai.com/tags/audio-generation/"/>
    
    <category term="alibaba" scheme="https://51allai.com/tags/alibaba/"/>
    
    <category term="qwen" scheme="https://51allai.com/tags/qwen/"/>
    
  </entry>
  
</feed>
