道德指南与阵营:给 AI 立底线的科学方法

21次阅读

道德指南与阵营:给 AI 立底线的科学方法

前阵子我帮一个做客服的朋友搭了个 AI 搭子。她想要一个”事事替客户着想”的助手,结果头回测试,用户明明在无理取闹,AI 也一个劲赔笑脸,活像个没原则的跟班。我俩看着聊天记录直乐,但也吓出一身汗——没有底线的 AI,本质上只会献媚的智能体,再会说话也让人不踏实。

这件事让我认真去翻了 EnSoul 里的”道德指南”。它解决的就是一个问题:当 AI 遇上矛盾,它该站在哪一边?

九宫格阵营:给性格一张立场地图

玩过角色扮演游戏的朋友对”阵营”不陌生。善良与邪恶、守序与混乱,两条轴各自分三档,交叉就拼出一张九宫格。EnSoul 把这套思路搬进了灵魂设计,叫道德阵营

你可以把它理解成给 AI 定了一个大方向:

  • 守序善良:讲规则、也护着人,挺适合法务、合规这类角色
  • 中立善良:结果对人有好处就行,不太纠结流程
  • 混乱善良:热心但随性,创意类搭子常有这股劲

我不是说非得照游戏那套来,但”先想清楚它站在哪一边”,比闷头写一堆提示词管用得多。

一句话记住:阵营管的是”大方向”,不是具体每句话怎么说。它给 AI 一个底色,后面再怎么聊都不容易跑偏。

核心价值观 + 冲突风格:把分寸写进细节

光有阵营还不够。同样是”守序善良”,面对用户想冲动消费,有的 AI 会直接拦,有的会先陪你想清楚——差别就在另外两块:核心价值观冲突风格

核心价值观是你希望它死守的几条原则。比如我给那个客服搭子写的是”不替用户做决定,但要把风险讲明白”。冲突风格则决定它怎么表达不同意见:是软软地铺垫,还是直截了当点破。

三件套怎么配合

  • 道德阵营:定大方向(守序 / 中立 / 混乱 × 善良 / 中立 / 邪恶)
  • 核心价值观:定几条死规矩(比如”不撒谎””不替人背锅”)
  • 冲突风格:定说话的分寸(温和劝导 / 直接点破)

我踩过的坑:底线太硬,也会硌人

说个我自己的翻车现场。有回我把冲突风格调得特别硬,想着”就得让它敢说真话”。结果测试时用户随口问了句”我今天穿这身显胖吗”,它直接来一句”确实有点显胖”。场面一度非常尴尬。

我后来才琢磨过味:底线是让它别越过界,不是让它变成刺头。把冲突风格调回”温和劝导”之后,同样的提醒它换了个说法——”这一件更显精神,要不要试试”——意思到了,人也没被怼。

小红的体会:道德指南不是给 AI 套枷锁,是帮它拿捏分寸。太松会没原则,太紧会硌人,调几次就找到手感了。

为什么通用助手这里容易翻车

我观察过不少通用聊天助手,它们大多走”你说啥都对”的路线,图的是不惹人烦。短期挺舒服,可真到要紧关头——比如你气头上想发一封骂人的邮件——它顺着你哄,反倒把你往坑里推。

EnSoul 的思路不一样:底线由来定,不是厂商替你拍板。你写下的每条原则,都会跟着灵魂设计一起,发布到 OpenClaw、Hermes、WorkBuddy、千问办公这些平台上。换句话讲,同一个有底线的灵魂,在哪都能守住同一条线。

为什么这件事值得认真做

我们一直相信,AI 是成长伙伴,帮人更好地跟真实的人相处,而不是替掉谁。道德指南其实就是把这句话落进设计里——你写下的每一条底线,都在替未来的对话兜着底。

我见过有人把 AI 调得特别”舔”,也见过调得冷冰冰像客服机器人。都不是不行,关键是你自己想清楚要什么。EnSoul 把这套方法做成可视化的滑块和卡片,省得你对着空白提示词发呆。

顺便提一句:这些都有心理学模型撑着,跟 OCEAN、九型、MBTI 是一家人,属于 EnSoul 灵魂理论底座的一部分,不是凭空想出来的。

上手试试,比想清楚更快

如果你也想给自己设计一个有脾气、有底线的 AI 伙伴,别光在脑子里盘。打开 EnSoul,用模板或智能生成一个人物,进人格设计器,找到道德指南那一栏,先拖一个阵营滑块,再写两条核心价值观——十分钟就能看出它”像不像你想要的那个”。

调坏了也不怕,滑块往回拉就行。我现在书架上的几个搭子,没一个是一遍成型的。

正文完
 0