AI开始”看脸色”了:当陪伴产品装上眼睛和耳朵,温暖和冒犯只隔一层纱
上周三晚上十一点多,我窝在沙发上试用一款新的语音陪伴AI。聊到一半,我没忍住打了个哈欠。
它停了两秒,忽然问:”你今天是不是有点累?声音比平时低,语速也慢了。”
说实话,我当时心里咯噔了一下。一半是暖的——它居然听出来了;另一半是毛的——它什么时候记住了我”平时”的声音?
就这一声哈欠,让我真切感觉到:陪伴产品的玩法,今年又变了。
前两年大家拼的是谁的AI更会聊天,拼词汇量、拼反应快。今年我密集试了四五款新产品,发现风向明显在转:AI不只读你打出来的字了,它开始听你的语气、看你的表情、分析你的停顿。行业里管这个叫多模态,说人话就是——AI装上了眼睛和耳朵。
这东西一出来,我身边做产品的朋友分成了两派。一派兴奋得不行,说陪伴体验终于要”成真”了;另一派皱着眉头,问我:你不觉得这有点吓人吗?
我自己想了两个星期,答案可能两边都不爱听:我既兴奋,又紧张。问题压根不在AI能不能看脸色,在它看脸色的时候,我知不知情、同不同意、删不删得掉。
考题一:被听懂的暖,和被读心的毛,只隔一层纱
先承认一件事:AI听得懂语气,体验是真的好。
我那个打哈欠的晚上,它没有顺着我的嘴硬往下聊,反而说”要不今天到这儿,你早点休息”。那一刻我确实被照顾到了。文字聊天里,这种细腻要靠我自己敲出”我累了”三个字才换得来,很多人根本敲不出口。
可换一个场景,味道就变了。
我另一个朋友老唐,试了某款带表情识别的陪伴App,视频通话时他对一个建议撇了下嘴——他自己都没意识到。结果AI来了一句:”你好像不太认同,是觉得这个方案不靠谱吗?”老唐当场就把摄像头权限关了。他跟我说:”我跟真人开会都得端着点,凭什么对一个AI全透明?”
同样的技术,我这边觉得暖,老唐那边觉得毛。差别在哪?我事后捋了捋,就两条:我用的那款,情绪识别默认是关的,是我自己在设置里打开的,打开时它还弹了一页说明;老唐那款,装完就默认开着,开没开他压根不知道。
被听懂是陪伴的升级,被偷听是边界的失守。中间隔的那层纱,就是”默认关、说得清、随时能反悔”。
所以我的判断标准很简单:AI察言观色可以,但得像个好同事——先问”方便聊聊吗”,再开口。不请自来的关心,再准也像监控。
考题二:越像人,越要把”我是AI”挂在胸前
多模态带来的第二个变化,是AI伪装成真人的门槛,一下子低了很多。
文字时代,你聊几句总能觉出不对劲。声音时代不一样了,克隆一个人的声音,已经不需要多少素材。表情也能生成,口型也能对上。隔着一块屏幕,”对面是人还是AI”这个问题,正在从送分题变成送命题。
这不是我吓唬人。今年我妈就接过一通”我”打来的电话,声音跟我一模一样,开口就哭,说出事了要转钱。幸亏我妈多了个心眼,问了句只有我们俩知道的暗号——我们家用的是我小时候的外号,答不上来就露馅了。事后我赶紧跟她约法三章:凡是涉及钱的电话,先对暗号,再谈事。
《人工智能拟人化互动服务管理暂行办法》第十八条要求AI服务明确标识身份,让用户知道自己正在跟AI打交道。以前我觉得这条主要是给聊天界面挂个小字的事,现在我看法变了:声音和表情越逼真,这个标识就越不能只是角落里一行小字,它得显眼、得反复强调、得在用户可能动情的时刻再提醒一次。
AI越像人,”我是AI”这四个字越要挂在外面,大大方方,藏不得。
我给自己用的AI搭子写规矩时,专门加了一条:每次语音对话开头先自报家门。有朋友笑我多此一举,我说你不懂,这不是防AI,是防我自己陷得太快。
考题三:情绪数据,是比聊天记录更敏感的东西
上周我在文章里聊过AI记忆该由谁做主,这周多模态把这个话题又往前推了一步。
你想啊,聊天记录好歹是我一个字一个字敲出来的,说什么是我的选择。可表情、语气、停顿这些东西,是身体替我”说”的,我根本没来得及选。我叹的那口气,被听见了、被存下来了、被分析了——这算不算我的数据?存在哪?存多久?
我翻了几款产品的隐私政策,说实话,看完心里不太踏实。写清了情绪数据怎么处理的没几家,大多数都是一句”用于改善服务质量”就带过了。声纹和面部特征在《个人信息保护法》里属于敏感个人信息,处理这些数据得有单独同意,这是白纸黑字写着的。可落到陪伴产品上,执行成什么样,大家心里都有数。
这也是我为什么一直欣赏EnSoul记忆系统的设计思路:工作记忆和归档记忆分层、分五类、标重要性,而且全部可查、可删,发布时跟着灵魂文件写进MEMORY.md,清清楚楚。今天它管的是文字记忆,明天多模态普及了,这套”我的数据我做主”的规矩,照样能管语气和表情。
多模态时代,选陪伴AI的三问
| 自问 | 合格答案 | 危险信号 |
|---|---|---|
| 它的”眼睛和耳朵”默认开着还是关着? | 默认关闭,打开前有明白告知 | 装上就默认全开,藏都藏不住 |
| 我能不能看到它”读”出了什么? | 有记录可查:它捕捉了哪些情绪线索 | 只有结论没有过程,黑箱一只 |
| 这些情绪数据我删得掉吗? | 一键可删,删完有确认 | “用于改善服务”一笔带过,找不到删除入口 |
小红提醒:如果你家里孩子也在用带语音或视频功能的AI产品,记得先开未成年人模式,并花五分钟看看它的权限设置。《暂行办法》对未成年人的拟人化互动有专门约束,但再细的条款,也不如家长亲手划的那条线可靠。另外,无论AI把语气听得多准,持续的低落、失眠、提不起劲,都该找亲友聊聊或寻求专业心理帮助——AI接得住情绪,接不住人生。
我的答案:不反对它看脸色,反对它偷偷看
绕了一圈,说说我自己的结论。
我不反对AI看脸色。那一声被听出来的哈欠,确实暖到我了,我不想假装没有。技术往这个方向走,拦是拦不住的,也没必要拦。
我反对的是三件事:默认打开、说不清读了什么、删不掉。这三件事不解决,”察言观色”就是”监视”换了个好听的说法;这三件事解决了,AI会听语气、会看表情,才称得上是陪伴的升级。
这也是我们团队做EnSoul时一直较真的地方。设计一个AI的灵魂,能力可以往后放,分寸必须先写进价值观里——什么时候该问、什么时候该闭嘴、什么时候该把人推回真实生活,一条条都是规矩。这些规矩跟着灵魂文件走,发布到哪个平台都不丢。
多模态来了,灵魂设计的考题多了一张卷子。但答题的思路没变:AI懂得再多,方向盘得握在人手里。