1.7 KiB
1.7 KiB
浏览器
搜索、导航与页面读取
实现阶段:P7
- 搜索互联网、打开 URL、读取页面文本和获取页面基本结构。
- 管理重定向、加载失败、分页和动态页面等待。
- 将页面内容转为适合模型使用且保留来源的结构化结果。
页面提取与站内探索
实现阶段:P7
- 提取列表、表格、链接、表单和指定区域内容。
- 在站内跟随链接完成多页资料收集,并避免无界爬取。
- 保存必要截图、页面快照或下载内容作为 Run 产物。
DOM 交互与表单操作
实现阶段:P7
- 点击、输入、选择、滚动、等待和提交表单。
- 通过可访问性树、DOM 和稳定定位信息减少脆弱坐标操作。
- 提交、购买、发布等真实外部写操作进入确认流程。
标签页、会话与登录态
实现阶段:P7
- 管理浏览器实例、窗口、标签页、历史和页面间上下文。
- 按 Profile 或任务复用已有登录态,同时保持不同任务之间的边界。
- 处理登录过期、验证码和必须由用户接管的页面。
上传、下载与文件流转
实现阶段:P7
- 将 Workspace 文件上传到网页,并将下载内容保存为可追踪 Artifact。
- 观察下载状态、文件名、重复文件和失败重试。
- 将浏览器文件与 Task/Project Workspace 建立明确关联。
页面视觉理解与混合定位
实现阶段:P7
- 使用截图和视觉模型理解仅靠 DOM 难以操作的界面。
- 组合 DOM、可访问性树、图像和坐标完成定位。
- 视觉操作记录截图和动作序列,便于用户检查和失败恢复。