# 浏览器 ## 搜索、导航与页面读取 **实现阶段:P7** - 搜索互联网、打开 URL、读取页面文本和获取页面基本结构。 - 管理重定向、加载失败、分页和动态页面等待。 - 将页面内容转为适合模型使用且保留来源的结构化结果。 ## 页面提取与站内探索 **实现阶段:P7** - 提取列表、表格、链接、表单和指定区域内容。 - 在站内跟随链接完成多页资料收集,并避免无界爬取。 - 保存必要截图、页面快照或下载内容作为 Run 产物。 ## DOM 交互与表单操作 **实现阶段:P7** - 点击、输入、选择、滚动、等待和提交表单。 - 通过可访问性树、DOM 和稳定定位信息减少脆弱坐标操作。 - 提交、购买、发布等真实外部写操作进入确认流程。 ## 标签页、会话与登录态 **实现阶段:P7** - 管理浏览器实例、窗口、标签页、历史和页面间上下文。 - 按 Profile 或任务复用已有登录态,同时保持不同任务之间的边界。 - 处理登录过期、验证码和必须由用户接管的页面。 ## 上传、下载与文件流转 **实现阶段:P7** - 将 Workspace 文件上传到网页,并将下载内容保存为可追踪 Artifact。 - 观察下载状态、文件名、重复文件和失败重试。 - 将浏览器文件与 Task/Project Workspace 建立明确关联。 ## 页面视觉理解与混合定位 **实现阶段:P7** - 使用截图和视觉模型理解仅靠 DOM 难以操作的界面。 - 组合 DOM、可访问性树、图像和坐标完成定位。 - 视觉操作记录截图和动作序列,便于用户检查和失败恢复。