2026-07-16 10:50:57 +08:00

1.7 KiB
Raw Blame History

浏览器

搜索、导航与页面读取

实现阶段P7

  • 搜索互联网、打开 URL、读取页面文本和获取页面基本结构。
  • 管理重定向、加载失败、分页和动态页面等待。
  • 将页面内容转为适合模型使用且保留来源的结构化结果。

页面提取与站内探索

实现阶段P7

  • 提取列表、表格、链接、表单和指定区域内容。
  • 在站内跟随链接完成多页资料收集,并避免无界爬取。
  • 保存必要截图、页面快照或下载内容作为 Run 产物。

DOM 交互与表单操作

实现阶段P7

  • 点击、输入、选择、滚动、等待和提交表单。
  • 通过可访问性树、DOM 和稳定定位信息减少脆弱坐标操作。
  • 提交、购买、发布等真实外部写操作进入确认流程。

标签页、会话与登录态

实现阶段P7

  • 管理浏览器实例、窗口、标签页、历史和页面间上下文。
  • 按 Profile 或任务复用已有登录态,同时保持不同任务之间的边界。
  • 处理登录过期、验证码和必须由用户接管的页面。

上传、下载与文件流转

实现阶段P7

  • 将 Workspace 文件上传到网页,并将下载内容保存为可追踪 Artifact。
  • 观察下载状态、文件名、重复文件和失败重试。
  • 将浏览器文件与 Task/Project Workspace 建立明确关联。

页面视觉理解与混合定位

实现阶段P7

  • 使用截图和视觉模型理解仅靠 DOM 难以操作的界面。
  • 组合 DOM、可访问性树、图像和坐标完成定位。
  • 视觉操作记录截图和动作序列,便于用户检查和失败恢复。