ChatGPT Search、Deep Research、Browser 与 Computer Use

对比搜索、深度研究、浏览器交互和桌面 Computer Use 的信息来源、执行方式、审批与适用边界。

#type / synthesis #status / growing #tech / ai #resource / chatgpt #platform / browser

[!abstract] 决策规则 查当前事实用 Search;需要多来源计划、综合和可核查报告用 Deep Research;需要进入网页并操作界面用 Browser;只有目标无法通过 API、App 或浏览器语义工具完成时才使用 Computer Use。

[!info] related notes

ChatGPT Search、Deep Research、Browser 与 Computer Use

范围

这四种能力常被统称为“联网”,但它们的目标完全不同:

  • Search 获取信息;
  • Deep Research 管理研究过程;
  • Browser 与网站交互;
  • Computer Use 操作视觉桌面界面。

对比

能力主要输入主要输出是否操作外部状态适合任务
Search查询摘要与来源链接通常否当前事实、快速核对
Deep Research研究目标与来源范围有结构的长报告和引用研究阶段通常只读多来源分析
Browser网站和交互目标页面结果、截图或完成状态可能登录后网页配置、表单和测试
Computer Use屏幕和视觉动作桌面应用状态变化经常可能无 API 的本地 GUI

Search:低延迟事实获取

适合:

  • 产品是否发布;
  • 当前文档入口;
  • 新闻、规则和版本;
  • 一个具体事实的来源。

Search 的短摘要不是深度证据审查。重要结论仍要打开来源,确认发布日期和事实发生日期。

Deep Research:可审阅研究流程

典型流程:

  1. 用户描述结果和约束;
  2. 选择公共 web、指定网站、上传文件或 Apps;
  3. ChatGPT 提出研究计划;
  4. 用户修改计划和来源;
  5. 运行中查看进度或中断;
  6. 获得带来源的结构化报告;
  7. 导出 Markdown、Word 或 PDF。

Deep Research 适合需要综合而不是单个答案的问题。当前官方说明中,它对连接 Apps 的使用以读取为主,不用写 action 完成研究。

Browser:对网页进行语义交互

Browser 能力适合:

  • 打开登录后的管理页面;
  • 点击按钮和导航;
  • 填写表单;
  • 检查可访问 DOM 和页面状态;
  • 对网页应用做测试;
  • 在重要动作前暂停确认。

它比纯截图坐标操作更稳定,因为可以按角色、名称和可访问结构定位元素。但页面改版、弹窗、异步加载和跨域 iframe 仍可能导致失败。

Computer Use:最后一公里 GUI

Computer Use 通过视觉界面操作桌面应用,适合:

  • 没有 API、App、MCP 或 DOM 语义接口;
  • 必须在本地 GUI 中完成;
  • 用户能看到并控制关键操作。

风险更高:

  • 视觉误识别;
  • 焦点或窗口变化;
  • 不可预测弹窗;
  • 坐标漂移;
  • 可能点击高风险动作。

优先级通常是:专用 App/API → MCP 工具 → Browser DOM → Computer Use。

来源和权限边界

  • 登录状态不等于授权执行所有动作;
  • App 能访问的数据由连接范围和工作区策略决定;
  • Deep Research 的读取能力不代表可调用 App 写操作;
  • Browser/Computer Use 看到页面内容时要防 prompt injection;
  • 发送、删除、购买、发布和权限变更应保留审批。

最小选择示例

  • “OpenAI 当前支持哪些 Workspace Agent 能力?”:Search 并打开官方文档。
  • “比较五家供应商并形成有引用报告”:Deep Research。
  • “在已登录 ChatGPT 管理页上传 Skill”:Browser。
  • “在没有 API 的本地旧软件中导出报表”:Computer Use。

官方资料与时效

核对日期:2026-08-08。

创建于 2026/8/8 更新于 2026/8/8