AI时代的自我构建:从数据画像到算法定义的身份

📅 2026/8/27 19:21:40
AI时代的自我构建:从数据画像到算法定义的身份
如果只看标题这是一篇关于艺术家 Barbara Kruger 的评论如果看下去你会发现它真正讨论的是当算法、大模型和数据足迹成为我们每天面对的新“画面”时一个人如何定义自己是谁。Barbara Kruger 在几十年前用她的红底白字作品质问消费社会中的自我而今天这个问题的答案被 AI 进一步改写。这一次我们不看部署脚本也不跑模型推理而是把“自我构建”放到技术语境里拆开你被多少人看过、被多少条数据定义、被多少个推荐系统塑造你的身份是主动表达出来的还是被算法推选出来的。这篇文章会先回到 Barbara Kruger 跟她那件最出圈的作品“I shop therefore I am”解释她如何用现成图片和短句完成对大众文化中“自我”的重构再切换到 AI 时代分析数据画像、推荐系统、大模型生成如何参与人的身份形成最后落到可操作的层面给出一个普通人在 AI 平台之上主动构建自我表达的工程路径包括数据管理、本地模型工具、AIGC 创作工作流以及必须遵守的隐私、版权和合规边界。这个话题在 CSDN 不算主流但它的现实感很强因为每一个做产品、做接口、做模型的工程师本质上都在设计一种“定义用户”的系统。理解 Barbara Kruger 的批判方式再看懂 AI 如何接管定义权你就同时拿到了两样东西一套历史坐标系和一张技术时代的行动地图。1. 内容速览从艺术批评到 AI 自我构建的核心线索维度具体内容核心人物Barbara Kruger美国概念艺术家以黑白摄影与粗体红字文字拼接作品闻名时代背景20 世纪 80 年代消费主义浪潮报纸、杂志、电视广告成为大众身份素材核心命题从“我思故我在”到“我消费故我在”再到 AI 时代的“我被数据定义故我在”技术载体数据画像、推荐系统、大语言模型、AIGC 工具、数字分身关键风险数据隐私、算法偏见、版权争议、数字身份失控、肖像与声音滥用本文场景文化评论 技术解读 可落地的 AI 自我构建工作流适合读者AI 产品经理、算法工程师、内容创作者、关注数字身份的普通用户如果你只是想知道“AI 会不会替代我”这篇文章不会直接回答但它会告诉你一个更值得关注的事实AI 已经在参与“我是谁”这件事本身。你刷到的内容、被推送的商品、AI 替你写的摘要、帮你生成的图像都在一点一点地改写你的表达习惯和价值判断。Barbara Kruger 拆穿了传统媒体的操纵而我们面对的是比媒体更隐蔽的算法系统。2. Barbara Kruger 与“我消费故我在”传统媒体时代的自我构建2.1 Kruger 的作品机制Barbara Kruger 出生于 1945 年早年做过《Mademoiselle》杂志的平面设计师这段经历直接影响了她后来的创作语言。她大量截取杂志广告中的黑白照片在上面叠加粗体文字文字通常放置于红色色块内字体偏 Futura Bold Oblique远处看像广告文案近处读却带着明显的反抗意味。她刻意使用商业图像的语言让作品首先在视觉上“伪装”成一条广告然后通过文字内容反转观者的预期。这种挪用加拼贴的手法在艺术史上并不新鲜但 Kruger 做得更狠她几乎不创造新的图像所有画面都来自现成的大众媒体。她真正创作的不是照片而是照片与文字的冲突关系。当一句“你的身体是战场”被压在一张女性脸部特写上时图像指向审美文字指向权力二者叠加后产生了一种被压迫的张力。她的作品能在几秒内看懂却能让人记住很久这正是她在艺术圈和流行文化圈都能破圈的原因。2.2 消费社会中被拼接的自我Kruger 最著名的作品是 1987 年的《Untitled (I shop therefore I am)》。画面里一只手伸向一张红底卡片卡片上写着“I shop therefore I am”直白地戏仿笛卡尔的“我思故我在”。在她看来人的存在感不再来自抽象思考而来自购买行为你穿什么、用什么、开什么车决定了你是怎样的人。这种逻辑在今天依然成立甚至更加强化——社交媒体上的“晒单”本质上是把消费行为当作身份声明。值得注意是Kruger 并不只是在批判物质崇拜。她触碰的是更深一层的问题在传统的宗教、家族和职业身份逐渐松动后大众媒体提供了一套现成的“自我组装模板”。广告中的模特、杂志里的生活方式、电影里的人物构成了一个个可复制的身份样本。普通人通过模仿和消费来完成自我认同于是人的自由选择变成了对预设叙事的选择人的主体性最终只是在一个封闭循环里做决定。2.3 从画面到算法批判对象的迁移如果把 Kruger 的批判逻辑提炼成一个公式可以这样理解大众媒体通过重复性和可知觉的象征体系把“什么是好的自我”植入人的大脑人们不假思索地认同并模仿最终形成一套与社会系统高度同构的自我认知。传统媒体时代这套象征体系是广告海报和杂志封面到了互联网时代它变成了首页推荐流和短视频信息流而在 AI 时代它进一步变成了算法画像、大模型提示词和 AIGC 生成结果的概率分布。所以从 Barbara Kruger 到 AI并不是一次简单的主题更新而是批判对象的整体迁移。她面对的是由编辑、设计师和广告主“人工”设定的图像化身份我们面对的则是由数据、参数和模型“自动化”生成的概率化身份。后者更隐蔽因为它没有人工编辑可以直接责怪系统会告诉你“这是你的偏好这是为你生成的内容。”于是“我被数据定义故我在”成为一种新的默认状态。3. AI 时代自我构建的技术机制画像、推荐与生成3.1 数据画像你被算法拼成的样子在互联网产品中用户画像通常由行为数据、标签体系和模型预测三层构成。每当你点击、点赞、停留、下单系统都会把这些离散动作聚合为兴趣标签喜欢数码、关注效率工具、时间集中在凌晨、消费能力强、情绪偏理性。这些标签经过协同过滤和深度学习模型处理后变成推荐系统用来对你投放内容的依据。问题在于数据画像本质上是“外部的你”它只记录可观测行为不记录你真实的内心动机。你可能因为帮朋友代买礼物而点开一个商品页画像是“有消费意向”你可能为了查资料而刷完整段短视频画像是“偏爱娱乐内容”。当这些误差被重复累积算法眼中的你和你认为的自己会越来越不像。Barbara Kruger 说的“消费定义存在”到 AI 这里变成了“数据定义存在”而且这个定义过程完全由模型完成你本人无法直接看到。3.2 推荐系统镜像、回音壁与身份锁定推荐系统与算法分发并不是中立的。它的目标是延长用户停留时间和提高转化率因此系统会倾向于推荐你已经被验证过偏好内容。这就是回音壁效应的技术根源越刷越喜欢越喜欢越被推送最终你的信息世界被压缩成一小块高度重复的地带。在这种机制下人的兴趣不是被“发现”的而是被“培育”的看似个人化的兴趣实际上是由算法在后台选择分支后不断强化出来的结果。更关键的是认知层面。当一位用户持续接受某一类型的内容他会被训练成以为“自己就喜欢这个”从而逐渐把“数据画像的我”内化为“真实的我”。这与 Barbara Kruger 对消费社会的批评一脉相承只是以前的“你是什么由你买什么决定”现在的“你是什么由算法以为你要什么决定”而算法甚至会反过来塑造你对“你要什么”的判断。3.3 大模型与 AIGC从被动消费到主动定义如果说推荐系统是被动塑造那么大模型和 AIGC 工具提供了一种更主动的可能性。用户可以通过提示词让 AI 生成符合自己审美的文字、图像、音频甚至视频也可以把个人信息、备忘录、日记投入个人知识库让模型变成自己的“第二大脑”。这听起来像是赋权我终于可以用 AI 表达真实的自己了。但问题藏在模型本身的统计属性里。大模型输出的是训练语料中的“最大概率路径”它天然倾向于符合主流叙事、常见表达和既有认知。当你要求模型“写一段关于我的一天”时如果提示词不够具体模型会生成一个“标准的一天”而不是你真正经历的一天。因此AIGC 创作中的自我构建关键在于控制能力你是否能把足够个性化的信息注入生成过程让它偏离平均值输出带有你独特痕迹的内容。做不到这一点AI 生成的就不是你而是“被训练数据平均化后的你”。4. 数字自我构建的工程化路径把 AI 当作工具而非定义者4.1 明确目标你是想表达还是想被代表在进入具体工具之前先把目标定清楚。如果你只是想获得一段符合主流审美的个人简介AI 完全可以替你生成如果你想通过 AI 生成一个真正能代表你、又不被主流叙事吞掉的内容就必须建立一套自己的工作流。第一步是区分“表达自我”与“匹配算法”前者需要投入个人素材、真实经历和独特观点后者只需要迎合现有标签即可完成。Barbara Kruger 的做法是挪用大众媒体的图像再加以改写放到今天这意味着你要主动收集属于自己的语料并设计提示词来改变模型默认的输出方向。在任何 AI 工具链里“个人素材”都是最稀缺的资源。很多人直接输入一句抽象描述就期望得到完整个人表达结果只会收获一堆“正确但空泛”的内容。正确做法是先准备一个素材池再让模型基于素材生成。素材池可以是文字日记、人物照片、作品集、访谈记录、代码仓库、书摘清单等一切能体现你真实状态的东西。4.2 个人知识库与“第二大脑”思路“第二大脑”概念的实质是把个人数据模型化让机器能够以你的经验为标准进行检索和生成。常用的技术组合是本地向量数据库 嵌入模型 大语言模型。你可以把个人文档切分、向量化、存入数据库然后在提问时先检索最相关的片段再让 LLM 基于这些片段回答。这样生成内容不会完全基于模型平均知识而是与你个人数据相关。一个最小可行的架构如下模块作用可选工具知识源存放个人素材本地文件夹、Notion、Obsidian切分与嵌入把文档转为向量LangChain、LlamaIndex、text-embedding 模型向量数据库保存并检索相似内容Chroma、FAISS、Milvus大模型基于检索结果生成输出本地 Qwen、DeepSeek、GPT 兼容接口应用层提供交互界面命令行、WebUI、API 封装这套架构并不复杂但真正决定效果的是素材覆盖度。输入源越多、质量越高模型对你的还原度就越强。如果你只让模型读一份简历它生成的自我表达自然不会超出简历如果你让它读你的日记、随笔、代码注释、社交动态它的输出会明显更接近你。4.3 一个可执行的 AI 自我表达工作流这里提供一个适用的工作流模板可用于打造个人的 AI 写作工作室。第一步收集素材。把个人文档统一放入一个文件夹命名规则建议按时间或主题分目录。 第二步切分与嵌入。对文档做分块块大小建议 300 到 800 字超过部分会影响检索精度。 第三步建立检索。把所有向量写入本地数据库每次生成前先取 Top-K 相似片段。 第四步构造提示词。将检索到的片段连同用户指令一起发给模型。 第五步人工复审。AI 生成的任何内容都必须经过二次编辑不能直接发布或交付。这五步的核心理念是AI 只做整理和草稿最终选择和判断权留在你手里。Barbara Kruger 把杂志广告拿来剪切、粘贴、反转再用自己的文字改变原意个人 AI 工作流本质上是一样的操作——从海量数据里取出片段通过提示词重写语境最终产生一个带有个人判断的新表达。5. 在 AI 平台之上构建自我表达的实操示例5.1 用 LLM API 生成个人风格文字下面的代码是一个通用调用示例模拟一个“从个人素材生成自述”的流程。你需要把 API 地址、模型名和密钥替换成实际环境中的配置。# 通用示例通过 API 调用大模型基于个人关键词生成第一人称自述 # 需要替换api_url、api_key、model_name import requests api_url http://127.0.0.1:8000/v1/chat/completions headers { Authorization: Bearer YOUR_API_KEY, Content-Type: application/json } payload { model: qwen2.5-7b-instruct, messages: [ { role: system, content: 你是帮助用户梳理个人表达的写作助手。请根据用户提供的个人关键词和经历片段生成一段第一人称自述文字。文字要具体、真诚、避免空泛评价。 }, { role: user, content: 个人关键词程序员、凌晨、城市、代码、不确定性。经历片段我最近半年在重构一个旧系统经常在凌晨处理线上问题发现代码的问题本质上是沟通的问题。 } ], temperature: 0.7, max_tokens: 800 } resp requests.post(api_url, jsonpayload, headersheaders, timeout120) data resp.json() print(data[choices][0][message][content])这段代码本身不复杂重点在提示词的构造方式系统提示词里我明确要求“具体、真诚、避免空泛评价”这是对抗大模型平均值倾向的有效方法。如果你只是写“帮我写一段自我介绍”模型会输出一段放在任何 25 岁程序员身上都成立的文字但当你把“凌晨处理线上问题”和“代码问题本质是沟通问题”这些个人判断放进去输出就有了专属性。5.2 用本地模型管理个人偏好数据如果不希望个人文本发送到外部接口可以考虑本地运行模型。以 Ollama 为例部署一个 7B 左右的模型可以承担个人数据问答和摘要任务。在普通消费级显卡上可以运行如果只有 CPU适合处理轻量文本任务。# 安装 Ollama 后拉取一个适合本地问答的小模型 ollama pull qwen2.5:7b # 进入交互式会话 ollama run qwen2.5:7b启动后可以输入“请用三句话总结我今天记录的内容”这类指令。本地模型的最大优势是数据不出设备但它的输出质量和上下文长度通常不如云端大模型。更合理的做法是让本地模型处理敏感信息云端模型处理非敏感创意内容两者分开降低隐私风险。5.3 用图像生成工作流构建个人视觉符号在图像方向可以借鉴 Barbara Kruger 的拼贴思路用图像生成工具组合“个人素材 文字标语”。例如在 ComfyUI 或类似工作流中把个人照片、日常物品照片与短句提示词叠加生成一组带有个人符号感的视觉卡片。工作流的关键节点包括图像输入、控制组件加载、提示词文字叠加、批量输出。文字部分应该像 Kruger 的标语一样短且有力比如“我写在 debug 日志里的诗”“凌晨三点提交的 commit”。这类内容本身带有真实经验不会被 AI 平均化最终生成结果也更像“表达”而不是“生成”。需要注意如果使用他人肖像、模特照片或品牌素材必须确认授权涉及具体人脸的图像生成尤其需要获得当事人明确同意。Barbara Kruger 使用杂志广告图是艺术行为但普通人的商业或公开使用场景版权、肖像权和平台规则是硬约束不能绕过。6. 边界、风险与合规AI 自我构建不能踩的线6.1 数据隐私与个人信息边界AI 自我构建依赖大量个人数据而个人数据被采集、被上传到云端、被用于模型训练都面临风险。许多用户习惯把日记、聊天记录、工作文档直接粘贴给在线 AI 工具这在方便的同时带来了不可控的隐私外泄。更稳妥的做法是建立分级制度极度敏感的信息使用本地模型处理可以公开的创意内容使用云端大模型不把真实姓名、地址、手机号等身份信息作为提示词输入。数据最小化原则在这里同样成立只给模型“完成任务所需的必要信息”不要把所有上下文都塞进去。你要让 AI 帮你写一段表达个人情绪的文字提供情绪场景和几个关键词就够了不一定要让它读取整本日记。6.2 版权问题训练数据、输出内容与 Barbara Kruger 的遗产Barbara Kruger 的作品本身使用了大量杂志广告图片这在当年被认为是挪用艺术但对版权来说一直存在争议。到 AI 时代版权问题变得更复杂大模型训练语料中可能包含受版权保护的文字和图像模型的输出也可能与某些原作的风格或构图高度相似。你把个人照片输入图像生成模型得到的输出图像权利归属取决于所使用平台的用户协议有的平台允许商用有的平台只允许个人使用使用前需要阅读条款。在文章中引用 Barbara Kruger 的作品图片同样需要确认版权状态。推荐的做法是先看图片是否进入公有领域再看使用场景是否属于合理引用最后看平台是否已有授权合作。这方面没有一刀切的结论核心是不要默认“网上能搜到的图片就可以随便用”。6.3 数字分身、肖像与声誉风险AI 时代的人脸合成、声音克隆和数字分身已经相当成熟但每一项都涉及人身权和同意问题。即便你拿到了本人的正面同意也要明确使用范围、有效期限和可撤回机制。更关键的是数字分身一旦生成就可能被下载、被拼接、被断章取义地传播因此不能只靠口头同意最好有书面记录并且遵守可用的授权条款。用 AI 构建“另一个自己”也有心理层面的风险。如果数字分身的表达比本人更能引起社交反馈人可能开始调整真实自我去靠拢 AI 版本这是一种反向塑造。长期使用数字分身要定期反思它是不是替代了真实的表达而不是辅助表达。6.4 算法偏见与信息茧房推荐系统和大模型都不是中立工具。模型的训练数据中若存在性别、地域、职业偏见生成内容也会带有偏见并进一步影响用户对自我和他人的判断。比如一个反复接收“程序员就是穿格子衫、不爱交流”内容的人可能逐渐把这些标签内化甚至真的把自己改造成这样。主动降低信息茧房的干扰需要刻意引入与算法偏好相反的输入源关注不同领域的内容、设置较宽的检索范围、定期清理兴趣标签。在这方面技术手段也能帮助破圈。比如设计一个“反推荐”工作流让模型定期推荐你从未关注过的主题把它的结果当作陌生化素材来使用。Barbara Kruger 做的是把熟悉的广告图像陌生化后提醒你重新看AI 场景下的反推荐工作流就是同样的操作只不过对象是推荐系统和大模型输出。7. 常见问题与思考问题可能答案或思考方向AI 会让我的自我更丰富还是更单一取决于你投入多少个人素材和对生成结果的筛选力度模型输出不像我怎么办增加真实案例素材把提示词写得更具体避免抽象描述本地模型性能不够怎么办先做小模型轻量任务把高难度生成交给云端数字分身会不会失控使用前明确授权范围和撤回机制定期检查数字内容流传情况AIGC 生成的内容能商用吗必须阅读平台用户协议和模型授权条款确认后再使用推荐系统总给我推相似内容主动切换内容类型、清理兴趣标签、增加陌生领域阅读AI 生成的自我描述和现实不符说明你的提示词或素材输入粒度不够需要补充真实经历数据如何避免被算法定义定期做一次“数据清除”或“标签归纳”重新评估哪些内容是真实意愿这些问题的共同点是AI 不是替你做决定而是放大你的输入。你的素材足够个性化输出才足够像你你投入的判断足够多生成结果才不至于被平均值覆盖。Barbara Kruger 没有把杂志图片原样展出而是加上自己的文字后改变语义你使用 AI 生成内容时也应该把模型当作可以“挪用”的工具而不是权威发言人。8. 从 Kruger 到 AI 的演变逻辑与可执行建议Barbara Kruger 的创作路径可以拆成四步截取现成图像、提炼尖锐文字、制造冲突语义、让观者重新审视。这套方法放在 AI 时代同样有效从海量数据中截取与个人经验相关的片段用足够短的文字定义冲突点再借由 AI 生成扩展内容最后让人重新思考“什么是我的真实表达”。对于 CSDN 的技术读者我建议从三个方向去实操第一把“自我表达”当成一个产品来设计先收集素材再做需求拆分最后用 AI 工具实现第二从最小闭环开始先用本地模型做一周个人日记摘要再做知识库检索再尝试 AIGC 创作第三每次使用 AI 生成内容时都保留一层人工复审确保输出没有被模型平均值带偏。技术与人的关系在 Barbara Kruger 的作品里表现为图像与文字的冲突在 AI 时代表现为模型输出与个人经验的冲突。冲突本身不是坏事它是重新审视身份的起点。如果你能像我上面描述的那样主动管理数据、设计提示词、控制生成结果的走向那么 AI 就不只是定义你的系统而成为你用于自我构建的工具。下一步值得做的事是把你最近一年的日记、代码提交、书摘和聊天记录整理起来做成一个属于你自己的向量库让 AI 先学会“读你”再让它“替你表达”。