豆包手机助手消费者版今天正式发布。搭配了它的手机长这个样子:搭配了豆包手机助手消费者版的努比亚 NaviX Ultra 将在 9 月 16 日发布而最近关注度很高的最新动向是,豆包手机助手消费者版将搭载在努比亚 NaviX Ultra 手机上,现在已经开启预约,豆包手机助手和中兴努比亚的官方渠道已经公布更多信息。和预览版相比,官方对这个助手的定位显然变化:这是一个面向量产,面向广大消费者的产品。也就是说,它不再只是一个原型机了。在此前第一次亮相时,豆包手机助手引起了不小的波澜,它以 GUI 为主的技术路线给既有的一切都带来了新思路,让所有人开始思考模型越来越强后,手机会变成什么样,过往我们已经习以为常的以 App 为主的交互方式又会变成什么样。所以当豆包的朋友找我说要不要提前体验下这个产品时,我立刻答应下来。我对它充满了好奇,和初代的实验属性不同,这个要真正量产,大规模提供给广大用户的产品,究竟做到了什么程度?现在正式官宣之后,也终于能跟大家分享这段时间提前使用它的感受了。万能对讲机豆包手机助手消费者版和硬件做了很多融合设计,比如第一时间拿到这台机器,从外形来看,最明显的就是侧面的 AI 键。是的,你可以用它唤起豆包助手。在我之后的各种使用里,这个 AI 键成了我和这台机器交互最主要的方式。比如,当我让豆包自动去飞书发送会议邀请时,我的操作过程是,在锁屏状态按住 AI 键直接呼出豆包,语音告诉它去给我们的飞书群发一个会议邀请。因为这个小小的 AI 按键配置了指纹识别功能,手机识别指纹后可以给豆包助手相关的更高权限。所以不需要屏幕解锁,只要是 AI 键识别了你的指纹,它就在后台开始一顿操作,然后很快就完成了任务。后来我还顺便让它去看了看我飞书上昨日在内容部门等几个核心工作群里的记录,给了我一个待办列表。这些都是很多人日常工作的常态,而整个过程丝滑无感。这种按住说话,然后事情就完成摆在你面前的感觉,的确改变了人们对手机的交互方式的预期。而且在使用了一段时间,用这种方式处理了诸多类似任务后,它成了我下意识会去使用的交互方式。任务解决的完成度越高,这种新交互“习惯”养成的顺滑度也越高,我不自觉的去按这个按钮的频率,可能真不亚于人们接受 iPhone“发明”的滑动触碰交互方式的速度。这是个融入了硬件的 AI 交互。这不免让人想起当年苹果早早在 iPhone 17 的侧面就放了一个“快门”按键,为后来的苹果 Intelligence 先占了坑,然而后面的故事有点变成笑话。我感觉人们眼里苹果本该给这个按钮打造的功能,应该就是豆包二代的这个样子。这种按住说话的交互给我的感觉,像是我在拿着一个万能对讲机。这会让人想不停探索这个对讲机能搞定的事情。我也试了几个我一直想做的,“一句话完成各种 agent 任务”的能力。比如,我直接通过语音,让豆包助手去自己操作手机,调用底层能力,跨 App 操作,完成了一个 vlog 剪辑工作。我“口喷”的提示词(其实就是想到哪说哪)很简单:把我相册里不超过 20 秒的视频,按照《午夜巴黎》开头的那个空镜的组合的方式去剪辑成一个 vlog, 保留视频本身的原声音,然后再配一个同样同款的 BGM。以下是它给我的结果:可以看到这个指令涉及多个复杂环节,它涉及对一部电影的某个含糊表达的具体部分的理解,涉及对我意图的判断,和对手机上可以调用的 App 的选择,以及,自动操作手机的能力。而我暗中观察了它操作的过程,这些难点都一一顺滑实现。这是个我一直想做,但因为我从来没用过剪映没怎么剪过视频,而一直没做的任务。现在,只要我手机里有这些素材,就真的能“张张嘴一句话”完成了。这些体验下来,你很难不觉得这个手机就像一个从哆啦 A 梦兜子里拿出来的万能对讲机。另外,在这个任务里,还可以看到豆包手机助手在 AI 层面不少核心设计思路。豆包手机助手预览版最引人瞩目的就是自动操作手机的能力。但也是引起最多争议的能力。这一代在操作不同 App 的方法上,也引入了类似 MCP 的方式。基于软硬件结合的设计,豆包手机助手底层的打通程度更深,大模型可以调用电话、日历、闹钟、飞书等底层工具的能力来完成任务。而自动操作手机的能力继续以 Beta 版的形态保留。当你在设置里打开,它可以在一些任务里通过模拟点击和调用工具的方式来帮你操作手机上的各类应用。操作可以在后台进行,不影响用户正常使用手机。在这个任务里,可以看出它对手机本身的相册的底层调用,对 App 的 GUI 点击操作。这些能力目前主要会支持一方应用和字节系相关产品调用。这也是外界最关注的能力之一,而在这一次发布的同时,豆包手机助手也一起推出了一个新的协议:SAEP,也就是屏幕自动化操作声明协议(Screen Automation Execution Protocol)。它给了第三方应用选择权,应用可以自主选择允许或拒绝 AI 助手在应用内执行屏幕自动化操作。同时,它也允许开发者们申请和接入协议。发布之日起,豆包手机助手也启动了为期 30 天的规则公示:“公示期内,豆包手机助手仅对系统自带应用、字节跳动旗下应用,以及已经通过 SAEP 或邮件明确同意接入的第三方应用执行自动化操作,其他应用默认不操作。”我还用了用豆包“替你接电话”的功能:在设置里,你可以设置它接听的范围,接听的策略。我给了它所有权限,然后用自己的另一个号试了试,再然后,我就……忘记了自己开通了这个设置。直到有天在车上,我突然看到手机自己开始对话起来,低头发现是豆包在替我接电话。有意思的是,这个电话听到后面,我才意识到,对面也是 AI。深度的使用了一段时间后,我发现它的很多功能都已经很强,也比较稳定。而这是任何一个有野心彻底重新建立起一套交互习惯的产品,必须做到的前提。按照官方给出的数据是,这一代相比此前,整体可用率提升至了 80%。这些能力已经足够神奇,但在个人 agent 类产品过去一段时间快速的在用户里渗透后,它们似乎多少还有些“常见”。而我对这款产品更大的期待和好奇,是它能不能更加接近一个真正的个人助手,甚至,私人助手的状态。也就是它开始在这些常规任务之外,能更深入你个人的 context,解决一些你自己定义的需求。而在边用边查看它在技术工程上的创新点后,我突然意识到,有一个我嘀咕了一年却一直没实现过的功能,可能终于可以做出来了。胡适日记 AI2025 年我发过一条朋友圈。要完成“根据我过去一年的照片的地理位置信息,告诉我过去一年都在哪些地方游荡,分别待了多久”这个任务,其实每一个零件都是现成的。照片有 EXIF,EXIF 里有经纬度和时间戳,地图能把经纬度翻成地名,模型能把这堆结构化数据写成人话。没有任何一环需要新技术。我常年在外面跑,一年下来去过多少城市、见了多少人,到年底一复盘,全忘了。可这些信息全都躺在这台设备里——几千张带 GPS 和时间戳的照片,排得满满的日历,便签里塞着的机票截图和随手记。但之前这些信息都是“死”的。过去一年里我试过第三方 App,试过云端模型,全都卡在同一个地方:拿不到东西。没有一个第三方应用能顺畅读完你整个相册的位置信息,你得一张一张传;没有一个助手能自己跳去日历、跳去便签、跳去读书 App 把材料凑齐。想做一次完整的复盘,先花两三个小时在十几个软件之间复制粘贴——那还不如不做。模型早就够用了。卡住的是权限和接口。没做的是具体的工程工作。当时诸多 AI 硬件都在追逐着某种“模型原教旨主义”,试图让模型来接管一切手机和硬件产品的操作。但我的这种需求并不是要模型来单独搞定,而需要模型、硬件底层、工程等一起协同设计解决。所以在用了一段时间豆包手机助手消费者版后,我终于把这个需求扔给了它。第一版指令很简单:根据我相册里的图片来告诉我这两天我在哪里,做了些什么?几秒钟出结果。准确,完整,有据可查。这一步在过去没有任何设备替我做到过。相册、定位、时间戳,第一次真的被一个助手完整读了一遍,不用我传,不用我导,不用我在十几个软件之间来回捣腾。但我对着结果看了一会。我发现这本质还是只是把我的数据念了一遍给我听。读完之后,最大问题是我没觉得它更懂我。它做的还是检索和罗列,我自己想了想,我其实想要的是理解和呈现。那怎么搞,其实能想到的直接方法也简单,就是提示词再改改。但过去的经验提示,这样去操作其实会很随机,有时效果好有时不好。如何让这个手机上的 AI 助手能更懂你,最好就是一个安全可控的记忆系统。说直白一点,记忆这一层夹在你和模型中间。模型本身是不记事的,每次任务都从零开始;而手机里的数据又太多太杂,全塞给它也没用。豆包这次把能记的东西分成了三类。第一类是你手机里本来就有的存量数据——录音、联系人、相册、短信、便签、日历。这些东西一直都在,只是从来没有被完整读过。主动授权之后助手可以调用,为此他们专门配了一个本地搜索工具,负责在这堆存量里检索和找回。第二类是你主动告诉它要记的。给助手发一条记忆指令就行,灵感、购物清单、待办都算。第三类是你日常刷手机时顺手“收”的,豆包手机助手提供了诸多入口:语音(对手机助手说记一下),AI 按键,组合键,快捷手势(三指上滑就能把屏幕里的内容保存进记忆),截图(截完点一下「记忆」,长截图也支持)等。此外还有一层单独的,也就是个人 context。它有两个
实测最新版「豆包手机」助手:所有手机里的 AI 都该变成它这样
来源:PingWest
2026年09月14日 22:01
0 阅读
分享到: