
扫码添加

添加学术顾问微信
免费获取服务方案
SAGE:从不可靠VLM教师学自主策略 | arXiv:2609.01567 | 熵值选择性查询教师,蒸馏轻量RL策略,部署零VLM调用、可超越教师
📎 arXiv
🔹 RILA:执行驱动网页开发Agent | arXiv:2609.02088 | 浏览器渲染进循环、交互反馈迭代改码;Qwen3.5-9B从40.40%升至57.52%,反超Kimi-K2.6与GPT-5.5
📎 arXiv
🔹 H3-World:把语言理解变成世界控制 | arXiv:2609.01560 | 视频生成器改造为交互世界模型,语言作自然控制接口,零样本场景交互
📎 arXiv
🔹 Qwen-Drive-1.0:自动驾驶视觉语言基础模型 | arXiv:2609.00111 | 首个统一3D感知、VQA与运动规划的自动驾驶专用VLM
📎 arXiv
🔹 Facet-0:接触密集精密操作机器人基础模型 | arXiv:2609.01596 | 面向亚毫米级装配,统一多模态表示预测接触后果
📎 arXiv
🔹 AgentFactory:自动化智能体系统设计优化 | arXiv:2609.01045 | 北大深研院等联合优化基座模型与工作流,8基准5领域平均提升9.1%
📎 arXiv

扫 码添加

添加学术顾问微信
免费获取服务方案
SAGE:从不可靠VLM教师学自主策略 | arXiv:2609.01567 | 熵值选择性查询教师,蒸馏轻量RL策略,部署零VLM调用、可超越教师
📎 arXiv
🔹 RILA:执行驱动网页开发Agent | arXiv:2609.02088 | 浏览器渲染进循环、交互反馈迭代改码;Qwen3.5-9B从40.40%升至57.52%,反超Kimi-K2.6与GPT-5.5
📎 arXiv
🔹 H3-World:把语言理解变成世界控制 | arXiv:2609.01560 | 视频生成器改造为交互世界模型,语言作自然控制接口,零样本场景交互
📎 arXiv
🔹 Qwen-Drive-1.0:自动驾驶视觉语言基础模型 | arXiv:2609.00111 | 首个统一3D感知、VQA与运动规划的自动驾驶专用VLM
📎 arXiv
🔹 Facet-0:接触密集精密操作机器人基础模型 | arXiv:2609.01596 | 面向亚毫米级装配,统一多模态表示预测接触后果
📎 arXiv
🔹 AgentFactory:自动化智能体系统设计优化 | arXiv:2609.01045 | 北大深研院等联合优化基座模型与工作流,8基准5领域平均提升9.1%
📎 arXiv