Workflow
跨模态知识图谱
icon
搜索文档
港科广×腾讯联手打造《我的世界》神操作,400张截图就能让AI挖矿通关,成本降至5%|EMNLP 2025
量子位· 2025-09-04 04:41
研究框架与创新突破 - 提出VistaWise框架 首次将跨模态知识图谱与轻量化视觉微调系统性引入开放世界智能体 [3] - 以低成本与跨模态为突破口 设计图-检-控三位一体的极简框架 核心创新概括为一图谱、两增强、三协同 [9] - 训练数据量仅需471帧 较传统方法缩减5个数量级 GPU显存需求下降87.5%至24GB [18] 技术架构与性能表现 - 仅用471张游戏画面微调视觉模型 单张24GB消费级显卡即可完成训练 完整框架可部署于笔记本电脑 [7][17] - 在"获取钻石"任务链上达成33%成功率 刷新非API类方法纪录 较前SOTA提升8个百分点 [4] - 9个连续子任务全部达到73%以上成功率 通过检索式图池化机制减少30%推理tokens [4][13] 核心组件与运行机制 - 构建轻量化跨模态知识图谱 融合文本攻略与实时视觉感知 单张1080p画面可在20ms内完成动态更新 [11] - 采用Path-Searching+Entity-Matching双阶段池化 先锁定全局路径再局部裁剪冗余信息 [13] - 基于PyAutoGUI封装原子动作函数 支持键鼠混合输入 实现零仿真真机操作 [14] - 决策闭环包含感知-检索-推理-执行四步骤 依赖GPT-4o生成自然语言指令驱动操作 [15][20] 行业应用与成本优势 - 突破传统需千万级标注样本与数百张高端显卡的训练模式 成本从百万级大幅降低 [6] - 较多模态大模型视觉感知方案降低30.7%的tokens使用 性能无显著下降 [18] - 研究成果获自然语言处理顶级会议EMNLP 2025主会录用 具学术与商业应用潜力 [5]