← 返回资讯热点
AI热点雷峰网发布时间:2026-07-09 10:40热度 140

Agent 进化论:从对话到协作

人与 AI 的沟通正在变得越来越像人与人之间的沟通。 一位店员用 AI 制作门店宣传视频时,不再把需求列成一段非常细致的 Prompt 发给 AI,然后等待它返回结果;而是直接开启一个与 AI 的对话,告诉它“帮我剪一条今天新品上架的视频”,然后通过连续对话敲定任务的具体细节,就像与人类剪辑师一样。 同样的情况已经发生在很多具体场景中。一些程序员在通勤或散步时会用语音和 Agent 讨论一个功能该怎么设计,如何实现;有用户在玩游戏时,会不断与 AI 游戏助手沟通现在应该做哪些任务,当前的关卡还有哪些道具没有收集…… 进入 Agent 时代,AI 不再只是输入框另一端的响应系统,而是开始进入需求讨论、方案判断和任务执行的全过程。这种角色变化,也让音视频对话成为越来越多人与 Agent 交互的主要方式。 数据显示,豆包 App 在今年一季度的音频用量环比增长约200%,视频用量增长约350%;近一年来的音视频模型日均 Token 消耗已经达到千亿级别。联想天禧 AI 看世界功能从2025年8月上线到2026年5月,人均对话轮次提升至刚上线时的1.65倍,是传统一问一答主对话的3倍。 当越来越多的人把与 Agent 的主要沟通方式从打字切换到视频或语音,多模态对话就很可能会成为人与 Agent 协作的主要交互界面。语音、视频、屏幕共享和环境信息都会成为这个界面的一部分。用户不再只是“输入问题”,而是在一个持续的上下文中,让 Agent 理解任务、补充信息、调用工具并参与执行。 但要真正实现这一点,对多模态交互能力的要求就不能只是“能听见声音”或“能看见画面”,而是要具备接近人的沟通能力,同时做好听觉、视觉、记忆和意图四项能力。只有当这些能力同时成立,多模态对话才会从一种输入方式,升级为支撑任务判断、方案形成和执行推进的协作机制,支持 Agent 完成从工具到伙伴的进化。 一、从等待指令到参与讨论 多模态交互真正改变的,不只是用户向 Agent 发出指令的方式,而是 Agent 进入任务的时间点。 在人与人的协作中,很多需求和答案并不是一开始就完整存在。往往先是有一个模糊的想法,然后在大家讨论中不断被追问细节,结合场景、资源和目标不断补充信息,最终才被沉淀成一个清晰的执行方案。 现在,人与 Agent 的沟通也开始从一次性发出指令,转向在多轮交流中澄清需求、形成方案。这是多模态交互改变协作方式的关键。 首先,它降低了人与 Agent 沟通的门槛。 对很多人来说,用一段文字向 AI 提需求是一个看似简单、实际上很难的问题。用户需要知道如何描述背景、目标、限制条件和期望结果,也需要提前预判模型可能会误解的地方。Prompt 写得不完整,结果就会偏差;想把 Prompt 写清晰,又需要付出一定的时间和精力进行思考、学习。 多模态交互让用户可以用自己最习惯的方式表达需求,不

来源:雷峰网
说明:本站展示中文整理摘要,便于快速判断价值;完整内容和版权归原站所有。