ChatGPT Search、Deep Research、Browser 与 Computer Use
对比搜索、深度研究、浏览器交互和桌面 Computer Use 的信息来源、执行方式、审批与适用边界。
#type / synthesis
#status / growing
#tech / ai
#resource / chatgpt
#platform / browser
[!abstract] 决策规则 查当前事实用 Search;需要多来源计划、综合和可核查报告用 Deep Research;需要进入网页并操作界面用 Browser;只有目标无法通过 API、App 或浏览器语义工具完成时才使用 Computer Use。
[!info] related notes
- 所属 MOC: ChatGPT MOC
- Coding Agent 视角: Coding Agent 浏览器与桌面操作
- App 关系: ChatGPT Apps、Skills 与 Workspace Agents
ChatGPT Search、Deep Research、Browser 与 Computer Use
范围
这四种能力常被统称为“联网”,但它们的目标完全不同:
- Search 获取信息;
- Deep Research 管理研究过程;
- Browser 与网站交互;
- Computer Use 操作视觉桌面界面。
对比
| 能力 | 主要输入 | 主要输出 | 是否操作外部状态 | 适合任务 |
|---|---|---|---|---|
| Search | 查询 | 摘要与来源链接 | 通常否 | 当前事实、快速核对 |
| Deep Research | 研究目标与来源范围 | 有结构的长报告和引用 | 研究阶段通常只读 | 多来源分析 |
| Browser | 网站和交互目标 | 页面结果、截图或完成状态 | 可能 | 登录后网页配置、表单和测试 |
| Computer Use | 屏幕和视觉动作 | 桌面应用状态变化 | 经常可能 | 无 API 的本地 GUI |
Search:低延迟事实获取
适合:
- 产品是否发布;
- 当前文档入口;
- 新闻、规则和版本;
- 一个具体事实的来源。
Search 的短摘要不是深度证据审查。重要结论仍要打开来源,确认发布日期和事实发生日期。
Deep Research:可审阅研究流程
典型流程:
- 用户描述结果和约束;
- 选择公共 web、指定网站、上传文件或 Apps;
- ChatGPT 提出研究计划;
- 用户修改计划和来源;
- 运行中查看进度或中断;
- 获得带来源的结构化报告;
- 导出 Markdown、Word 或 PDF。
Deep Research 适合需要综合而不是单个答案的问题。当前官方说明中,它对连接 Apps 的使用以读取为主,不用写 action 完成研究。
Browser:对网页进行语义交互
Browser 能力适合:
- 打开登录后的管理页面;
- 点击按钮和导航;
- 填写表单;
- 检查可访问 DOM 和页面状态;
- 对网页应用做测试;
- 在重要动作前暂停确认。
它比纯截图坐标操作更稳定,因为可以按角色、名称和可访问结构定位元素。但页面改版、弹窗、异步加载和跨域 iframe 仍可能导致失败。
Computer Use:最后一公里 GUI
Computer Use 通过视觉界面操作桌面应用,适合:
- 没有 API、App、MCP 或 DOM 语义接口;
- 必须在本地 GUI 中完成;
- 用户能看到并控制关键操作。
风险更高:
- 视觉误识别;
- 焦点或窗口变化;
- 不可预测弹窗;
- 坐标漂移;
- 可能点击高风险动作。
优先级通常是:专用 App/API → MCP 工具 → Browser DOM → Computer Use。
来源和权限边界
- 登录状态不等于授权执行所有动作;
- App 能访问的数据由连接范围和工作区策略决定;
- Deep Research 的读取能力不代表可调用 App 写操作;
- Browser/Computer Use 看到页面内容时要防 prompt injection;
- 发送、删除、购买、发布和权限变更应保留审批。
最小选择示例
- “OpenAI 当前支持哪些 Workspace Agent 能力?”:Search 并打开官方文档。
- “比较五家供应商并形成有引用报告”:Deep Research。
- “在已登录 ChatGPT 管理页上传 Skill”:Browser。
- “在没有 API 的本地旧软件中导出报表”:Computer Use。
官方资料与时效
核对日期:2026-08-08。