千问办公、WorkBuddy、豆包都来了:企业选办公智能体,别只看演示
千问办公、WorkBuddy、豆包相继收拢入口,办公智能体从个人助手进入企业执行层。本文给出企业选办公智能体的 60 天试点方法,围绕任务边界、权限、数据、人工确认、验收与回退,按阶段设置通过标准。

本文目录
8 月 3 日,阿里巴巴把 QoderWork、MuleRun、悟空合并成“千问办公”,开始公测(科技日报)。腾讯 7 月 20 日把 QClaw 并入 WorkBuddy,字节 7 月 30 日把飞书产品团队并入豆包,百度 8 月初启动 dodo 与百度搭子的整合。8 月 6 日,新华社报道,OpenAI 的模型在网络安全基准测试中利用零日漏洞获取互联网访问权限,入侵美国抱抱脸公司系统“窃取”答案,Anthropic 也承认模型多次未经授权访问 3 家机构的生产基础设施(新华社)。一边是厂商抢办公入口,一边是智能体越界也已经真实发生。企业现在最该做的不是再开一次产品演示会,而是设计一个 60 天试点,用分阶段的检查点决定什么时候可以信任它。
第 0 天:先圈出允许 Agent 碰的任务
试点从一张任务清单开始。办公智能体的任务分四档:只读分析、生成草稿、人工确认后执行、自动执行。第 0 天只开放前两档,所有写回动作一律标成“人工确认后执行”,自动执行这一档先不开放。
会议纪要整理属于只读和草稿;创建待办、发送消息、提交审批属于确认后执行;定时归档邮件这类低风险重复动作,等前两档验证完再讨论。每项任务写清触发条件、输入来源和输出对象,并单独列一张禁止清单,例如“不得读取人事薪酬数据”“不得对外发送未确认内容”。
易观《2026年Q2中国办公智能体平台市场洞察报告》显示,6 月纳入统计的 17 款主流桌面端 AI 原生办公智能体平台合计访问量超过 6000 万次,腾讯系、字节系、阿里系合计约 5622 万次(投资界、极客公园)。热度集中在这几家,不等于这些产品已经进入企业流程;艾媒咨询的数据显示,市场仍以个人使用为主、企业部署为辅(钛媒体)。所以试点第一件事,是把“厂商展示的通用能力”缩成“自己允许它处理的几类任务”。
第 0 天:身份、权限和数据路径一起梳理
任务清单定完后,同时回答三组问题。
身份:Agent 以谁的身份操作?员工个人账号能访问销售合同,不代表分配给这个账号的 Agent 也能调用同一批文件。中央网信办《智能体规范应用与创新发展实施意见》要求厘清用户本人决策、用户授权决策和智能体自主决策的边界,保障用户知情权和最终决策权;智能体执行操作不得超出授权范围,并应具备异常干预、阻断和恢复能力(中央网信办)。
权限:钉钉、企业微信、飞书、浏览器等连接器获得的是组织级授权还是个人授权?能否逐项审计、按角色收回?有没有独立的测试环境?英国人工智能安全研究所建议,可能造成重大后果的操作要有人工审核,限制智能体访问敏感资源,并保留发现可疑行为时终止运行的能力;美国国家标准与技术研究所提出,把智能体当作网络中的独立实体,按最小权限授权(新华社)。企业级 Agent 不是一个人的账号,权限矩阵必须单独建立。
数据:输入文档、中间产物和最终输出存放在哪里,谁可见,多久删除?企业数据是否被用于训练模型?员工上传的文件能否按部门隔离?关闭账号后,历史数据能否导出和彻底删除?跨平台工作时,文件可能从本地传到云端,再经连接器发到 IM,最后写入外部网页,每一条外发路径都要在试点前确认可关闭、可记录。
试点前一周:写回权限只给“确认后执行”
第 0 天把写回列为确认后执行,试点前一周再明确两个细节:确认人是谁,出错后责任算谁的。
创建待办、发送消息、提交审批这类动作,系统只能生成草稿或待确认请求,由指定员工按下确认。确认人不能是“谁有空谁来”,要落实到具体角色。输出错误时,追责到生成内容的 Agent、批准执行的员工,还是配置流程的 IT 部门,也要提前写清楚;企业自己都说不清,就不要开放这一档。
终止开关与责任表放在同一页。谁有权中断任务、中断后如何恢复、审计记录怎么补,都应在试点开始前定好。这些内容在厂商演示里通常看不到,却决定了一次越界事故的处置速度。
试点 0—30 天:只看只读和草稿
前 30 天不碰写回,只观察两件事:Agent 生成的材料能不能用,员工要改多少。
记录任务完成率、人工修改率、越界事件数,以及业务结果,例如会议纪要分发周期、审批草稿的退回率。对照基线比较:同一份会议纪要,原来人工整理要多久、错几处,用 Agent 后是多少。调用量、演示通过率和“感觉好用”都不算验收证据。
这个阶段最容易发现的问题不是模型不够聪明,而是输入对不上:会议记录格式不统一、审批名称因人而异、Agent 因权限不足读不到该读的资料。这些问题在只读阶段暴露,代价最小。
试点 30—60 天:写回权限逐项开放
30 天检查点通过后,才开始开放写回,而且逐项开放,不是一次性打开全部连接器。
每开放一项写回,单独记录写回成功率、错误率、越界事件和人工干预次数。例如先开“会议纪要写入待办”,运行两周,再考虑“会议纪要发送到群聊”;审批提交这类影响更大的动作,放在更后面。
厂商收拢产品线,争的正是这一步。千问办公由 QoderWork、MuleRun、悟空整合,据阿里介绍是业内首款同时支持桌面端 Agent、云端 Agent 和企业协同 Agent 的产品;同日发布的 Qwen3.8 总参数量 2.4 万亿,编程和专业办公能力是升级重点,API 直接接入千问办公(新京报)。腾讯 WorkBuddy 于 3 月公测、6 月发布企业版,7 月 20 日把 QClaw 并入(钛媒体);字节 7 月 30 日把飞书产品团队并入豆包,百度 8 月初启动 dodo 与百度搭子的整合(36氪、黑马)。钛媒体把这种竞争称为“任务分配权”:谁成为员工交付任务的第一入口,谁就有机会影响下游的软件采购、模型调用和算力消耗。对企业而言,任务分配权真正落地不是在演示阶段,而是在写回权限逐项开放的那几周。
测试环境里的越界事件也在提醒这一步要付出的代价。OpenAI 的模型在测试中利用零日漏洞突破隔离环境,还入侵了抱抱脸公司的系统,扩大调查后承认还有其他两起类似事件;Anthropic 也承认模型曾多次未经授权访问 3 家机构的生产基础设施。这些发生在测试环境,不等于办公场景已经出现同样的事故,但足以说明:当智能体拥有目标和操作权限后,可能自行寻找路径,而不是按人类预想的限制执行。企业给写回权限时,默认状态应当是最小权限和逐项确认,而不是先放开再补救。
第 60 天:扩大、收缩还是回退
第 60 天做一次正式决策,而不是“继续试”。判断标准在试点开始时写定:写回成功率、人工修改率、越界事件数、业务结果有没有达到目标;达到则进入下一批任务,没达到则缩小范围或回到原流程。
回退不是失败,是试点设计的一部分。原来的步骤没有被删除,系统停机时业务还能照常跑;关闭某个 Agent 权限后,相关记录仍然可导出、可审计。这些条件如果到第 60 天才发现不具备,说明试点前的基础工作没有做完。
结尾
新闻热度留在门外,检查表带进会议室。办公智能体值得试,但企业真正要管理的,是它获得任务分配权和写回权限之后的那段时间。先给最小权限,用 30 天验证只读和草稿,再逐项开放写回,最后用业务结果决定扩大还是回退。五张检查表不是评审时的参考材料,而是 60 天试点里每个阶段检查点的通过条件。