超越滑动:社交算法如何塑造你的现实

TL;DR · AI 摘要
社交算法通过分析用户行为预测点击偏好,导致信息茧房效应,文章通过构建推荐系统代码演示其运作机制。
核心要点
- 算法基于用户行为数据预测点击倾向,而非故意推送虚假内容
- 协同过滤与内容过滤结合可提升推荐准确性
- 使用MIND数据集构建的新闻推荐器可模拟信息茧房形成过程
结构提纲
按章节快速跳转。
社交算法并非恶意,而是通过数据分析预测用户点击行为以提高平台粘性。
推荐系统依赖协同过滤和内容过滤两种方法来识别用户兴趣并推荐内容。
算法倾向于推送引发强烈情绪反应的内容,如负面新闻或娱乐视频。
使用微软新闻数据集MIND构建新闻推荐系统,展示信息茧房如何形成。
通过Python代码实现基于余弦相似度的用户相似度计算与文章推荐功能。
该系统通过用户点击记录构建稀疏矩阵,从而推荐未浏览但可能感兴趣的文章。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 社交算法与信息茧房
- 算法工作原理
- 协同过滤
- 内容过滤
- 推荐系统实现
- MIND数据集
- 余弦相似度
金句 / Highlights
值得收藏与分享的关键句。
算法不是为了误导用户,而是通过预测点击行为最大化用户停留时间。
协同过滤通过寻找行为相似用户推荐内容,而内容过滤则根据已有喜好匹配特征。
使用MIND数据集构建的推荐系统能有效模拟信息茧房现象,揭示算法偏见。
标题:超越滑动屏幕:社交媒体算法如何塑造你的现实
URL 来源:https://towardsdatascience.com/beyond-the-scroll-how-social-media-algorithms-shape-your-reality/
发布日期:2026-05-23T15:00:00+00:00
Markdown 内容: 你的社交媒体信息流可能比你想象的更了解你。
当你浏览社交媒体时,你会注意到一个非常典型的行为:你看了一条视频,然后突然间时间线就被更多同类内容所淹没。五年前,这感觉有点像魔法。但如今,我们谈论“_算法_”时,仿佛它是一个在硅谷地下室里操纵一切的神秘实体。而事实远没有那么戏剧化,却更加有趣。
这个 _算法_ 并非天生邪恶,它不会坐在那里策划你的激进化。它只是一段运行余弦相似度和加权平均值的代码,试图预测你接下来会点击什么。问题在于我们互动的内容创造了参与度。而让人类持续参与的最可靠方式,恰恰也是让他们获取信息最糟糕的方式(愤怒诱导、假新闻,甚至更糟)。)
本文将探讨推荐引擎是如何运作的,为什么它们会使我们陷入回音室效应,同时为了让你更直观地理解,我们将从零开始构建一个推荐系统,将其应用于真实的新闻数据,并观察泡沫是如何形成的。
- * *
参与引擎:推荐系统如何工作
社交媒体算法本质上是一个策展人。它的职责是从数百万帖子中筛选出你最有可能参与的内容:点击、观看、点赞、分享、愤怒评论。它基于一个词:数据。
你做的每一个动作都是一种线索:
- 你在哪些帖子上停留(即使没有点击)
- 你观看了哪些视频,以及观看时长
- 你关注、屏蔽或取消关注了哪些账号
- 你在凌晨一点搜索了哪些话题
通过机器学习,算法会在这种行为洪流中识别模式。它不断提出同一个问题:什么能让这个人在这个平台上停留得更久?记住,这是所有社交媒体公司的最大目标:让你在这个平台上待得更久。
大多数推荐系统背后都有两种经典的技术:
- 协同过滤 找到行为与你相似的用户,并推荐他们喜欢的内容。如果爱丽丝和鲍勃都喜欢《黑客帝国》和《盗梦空间》,而爱丽丝还喜欢《星际穿越》,那么系统就会向鲍勃推荐《星际穿越》。这很容易理解。
- 基于内容的过滤 则分析你已喜欢的内容特征,并找出类似的东西。如果你经常看烹饪视频,它会推送更多标记为“烹饪”、“食谱”或“刀工”的视频,这些内容与你已经喜欢的相似。
真实平台会将这些方法与其他数百种信号结合使用。但核心思想是一样的:从你的行为中学习,预测还有哪些内容可能吸引你。
算法并不打算向你展示不良或虚假内容。它优化的是参与度。而让人类保持参与的最可靠方式之一,就是激发我们的情绪,尤其是强烈而负面的情绪 特别是这篇论文 中提到的那样。或者猫咪视频。
- * *
基于真实数据构建新闻推荐系统
让我们停止抽象地讨论,动手来构建一个。我们将使用来自 Microsoft News 的真实匿名点击日志。该数据集被称为 MIND(微软新闻数据集),由微软研究院为学术研究发布。这个样本包含 50,000 名用户,超过 51,000 篇英语新闻文章,涵盖 17 个类别(新闻、体育、金融、生活方式、健康、旅游等),以及 156,000 多次真实曝光会话,每次记录了用户看到的内容及点击行为。整个程序只需约 30 行 Python 代码即可实现,虽然你现在不需要详细了解这些细节:
import numpy as np
import pandas as pd
from scipy.sparse import csr_matrix
from sklearn.metrics.pairwise import cosine_similarity
# 构建一个稀疏的用户 × 文章矩阵(1 = 点击,0 = 未点击)
matrix = csr_matrix((np.ones(len(clicks)), (user_rows, article_cols)),
shape=(n_users, n_articles))
def recommend(user_id, matrix, top_n=15, n_neighbors=50):
"""找到 50 个最相似的用户,并对这些用户点击过的文章进行排序,
这些文章是当前用户尚未见过的。”
u = user_idx[user_id]
# 计算该用户与其他所有用户的余弦相似度
sims = cosine_similarity(matrix[u], matrix).flatten()
sims[u] = 0 # 不要给自己推荐
# 取前 50 个最相似的用户
top_neighbors = np.argsort(sims)[-n_neighbors:][::-1]
weights = sims[top_neighbors]
# 用邻居点击的加权和来评分文章
scores = np.asarray(matrix[top_neighbors].T.dot(weights)).flatten()
# 将用户已点击的文章分数置零
scores[matrix[u].toarray().flatten() > 0] = 0
# 返回得分最高的文章
top_articles = np.argsort(scores)[-top_n:][::-1]
return top_articles余弦相似度用于找出你最接近的五十个邻居,也就是那些点击相同类型文章的人。我们取这些邻居点击过的文章,根据每个邻居与你的相似程度加权,然后推荐得分最高的十五篇文章。这就是支撑数十亿美元产业的基础。
- * *
余弦相似度是什么?
余弦相似度听起来像是数学教科书里的东西,但别担心,其实它比看起来简单得多。为了让你明白它是怎么工作的,我们先快速绕个小弯子。
设想如下数据点分布在两个轴上:机械 vs 生物,可爱程度:

表情符号相似度映射器 —— 猫与狗 – 作者供图
余弦相似度测量的是两个箭头之间的夹角,每个箭头都从原点 (0,0) 出发,指向我们的某个数据点。夹角越小,两个项目就越相似。
这样理解:如果两个箭头几乎指向相同的方向,那么它们所代表的项目具有相似的特征。以猫和狗为例。两者在“生物性”和“可爱度”上得分都很高,因此它们的箭头几乎指向同一方向,余弦相似度会返回接近 1 的值(其最大值)。
但如果我们将猫与泰迪熊进行比较,尽管它们在“可爱”维度上相似,但在“生物性”轴上却不同:

Emoji 相似度映射器 —— 猫与泰迪熊 – 作者供图
如果我们比较猫与泰迪熊,虽然它们在“可爱”维度上相似,但在“生物性”轴上却不同:猫是完全生物性的,而泰迪熊的得分为零。
这使得它们的箭头分开。它们之间的角度变大,余弦相似度返回一个较低的值,反映出尽管共享一个特征,这两个对象却占据我们空间中截然不同的区域。
当然,如果我们把猫和汽车进行比较,几乎不会有任何相似性,因为它们的箭头指向不同的方向:

Emoji 相似度映射器 —— 猫与汽车 – 作者供图
AI 模型利用这类信息来推荐可能引发你类似反应的内容。想象一个二维空间,其中一个轴表示视频让你产生的情绪(平静、娱乐、愤怒),另一个轴表示它的主题。每个视频都会在这个空间中的某个位置被标记。
如果你点击了一个让你愤怒的政治视频,并且你把它从头看到尾。平台会记录这两个维度:主题和情绪反应。通过余弦相似度,它会找到那些“箭头”指向相同方向的其他视频(比如煽动性政治视频)并将其推给你下一次观看。你参与得越多,算法就越自信地学习到哪个角落的空间能让你持续观看。
- * *
认识用户 U92876(我们称它为 Joe):体育迷
我从 MIND 数据集中挑选了一位阅读历史纯为体育的用户,NFL 排名、NBA 转会传闻、MLB 禁赛新闻。他阅读了二十五篇文章,全部都是体育类。
让我们看看推荐系统会给他推荐什么:

Joe 的推荐阅读列表 – 作者供图
类别分布如下:
- 40% 体育
- 13% 新闻
- 13% 汽车
- 34% 其他各类内容的混合
算法识别出这个人的体育习惯并反馈回来,但同时也提供了一个相当多样化的饮食结构。有政治、娱乐、生活方式、金融等内容。还不错吧?
现在看看会发生什么。
- * *
好奇心的瞬间
我模拟了一个比大规模沉迷更常见的场景:一种闲散的好奇心。
我们的体育迷并没有花几个小时读政治。查看他们的初始信息流时,他们只是随意点击了三个引起注意的内容:
- _关于乔·拜登的新闻故事。_
- _关于米奇·麦康奈尔的新闻故事。_
- _关于特朗普攻击的视频。_
不到十分钟内,只点击了三次,留下了三颗微小的线索给算法,然后 Joe 继续他一天的生活。
如果我们用之前编写的三十行 Python 代码运行这些点击,几乎不会发生什么变化。从数学上讲,25 次历史体育点击仍然压倒性地超过 3 次新的政治点击。算法仍然认为这是一个对体育感兴趣度高达 89% 的用户,信息流几乎没有改变。
但这是现代社交媒体非常关键的秘密武器:时效加权(或时间衰减)。
真正的算法并不会平等地对待你所有的点击;三年前的点击几乎可以算是古代历史,而三分钟前的点击则是黄金。为了让你在当前会话中保持粘性,平台会对最近的行为施加一个巨大的乘数。
一行代码就能在我们之前的算法中实现这一点。如果我们决定最近的点击应该比旧点击多 100 倍的权重,我们可以写成如下形式:
time_decay_weights = np.array([0.1 if historical_click else 10.0 for click in user_history])
如果我们这样做,再运行一次推荐:

Joe 新的阅读推荐列表 – 作者供图
仅凭这三次点击,就对我们的时间加权推荐系统造成了这样的影响:

推荐前的信息流类别 – 作者供图

推荐前的信息流类别 – 作者供图
政治新闻从 13% 上升到了 40%,增加了三倍。仅仅一个晚上点击并阅读了三条新闻后,体育(这个人多年来一直阅读的内容)从主导类别跌至第二位。算法没有停下来思考:“等等,这个人历史上有 25 篇体育文章,一晚上的政治点击并不能定义他。”
它不会思考,只会重新计算时间加权的相似度矩阵,找出一组新的邻居,并推荐其他点击过这些内容的用户喜欢的内容。
有两点特别突出:
- 速度。 一个用户整个信息流的重组可能只需要一个晚上。实际平台的重新计算速度比这个演示更快,因为它们是实时更新的。你可能在自己的信息流中注意到这一点,比如最近搜索过的产品相关的广告。
- 消失的内容。 这不仅仅是算法添加了什么,也包括它移除了什么。用户的资讯摄入不仅变得更加政治化,而且变得更狭窄。而“更狭窄”才是真正的危险所在。
_注意:真实平台不会公布它们的衰变常数,所以这是示意性的,并非测量结果,但机制是真实的,方向才是关键。我举的100倍例子可能是对近期偏见的一种夸大。_
- * *
研究告诉我们什么
你现在知道点击如何影响算法接下来展示给你的内容。
但这还只是开始——让我们愤怒、恐惧或震惊的内容比那些让我们感到愉悦或知情的内容更能牢牢抓住我们的注意力。社交媒体公司并没有有意识地设计这一点,他们的算法只是发现了这一点。
一项2025年对25,000名SmartNews用户数字足迹数据的大型研究发现,人类在选择新闻时具有“负面偏见”的特质。从进化角度看,我们天生就倾向于关注威胁,避免危险对祖先的生存至关重要。当这种古老本能遇到现代机器学习时会发生什么?该研究证实,个性化推荐系统会放大我们固有的负面偏见。
此外,研究人员分析了数亿条帖子的数据,这些帖子来自Facebook和X(前身为Twitter)等平台,结果显示社交用户分享负面新闻链接的可能性大约是正面新闻的1.91倍。负面等于病毒传播,愤怒循环就此诞生。
- * *
认知代价:不只是你在想什么,而是你怎么想
这些算法循环的影响不仅仅是我们消费的内容类型;更重要的是它从根本上改变了我们的大脑。一项2025年的系统性综述分析了71项研究及98,299名使用短视频平台(如TikTok、Instagram Reels和YouTube Shorts)的参与者,发现了深远的认知后果。
与这些无尽滚动平台的高参与度相关联的是较差的认知表现,特别是影响了我们的持续注意力和抑制控制能力。
心理学家指出,习惯化和敏化双重过程可以解释这一现象。短视频快速且高刺激的特点使我们对阅读书籍或深度问题解决等较慢、更费力的任务变得麻木。与此同时,算法即时推送的定制内容激活了大脑奖励系统,强化冲动行为模式,并鼓励人们习惯性地寻求即时满足。
重度使用这些平台的人在需要专注的任务中表现出较低的电生理活动。一些研究人员甚至指出,在关键认知控制区域(包括前额叶皮层和纹状体奖励回路)存在结构性差异,这与持续受到高度奖励的算法刺激有关。
- * *
社会成本
由于数学矩阵的作用,我们每个人都被困在自己个性化的信息泡泡中。
短期内,这对大多数人来说是令人烦恼的。但如果拉远视角,情况就会变得越来越严重。当算法向我们推送确认我们已有信念的内容时,我们会经历“确认偏见”的强化版。
这些过滤气泡加深了当今社会的分裂。我们将继续极度分化,而这种鸿沟似乎没有尽头。
虚假信息在封闭循环中蓬勃发展,因为假故事不会在泡泡外接受审查。等到事实核查发布时,原始谎言已经在平台上转了一圈,并建立了一支信徒小队。
民主制度依赖于共同的现实基础以及公众愿意公开辩论的意愿,当公民占据完全不同的现实泡泡时,民主便受到了冲击。
- * *
重获你的信息流
在这里你并非无能为力。算法是响应式的,但你可以做一些事情,虽然有些麻烦,但可能会让你跳出自己的泡泡。
构建你泡泡的同一机制也可以用来拓宽它。一些实用建议:
- 多样化输入来源。 主动关注一些超出舒适区的信息源。如果你的政治倾向偏向一方,那就关注另一方的一些理性声音。
- 定期重置。 清除观看历史记录。对那些不断困扰你的推荐内容使用“不感兴趣”。尝试在未登录状态或隐身模式下使用平台,观察没有你的数据时世界有何不同。
- 使用时间顺序信息流。 大多数平台仍允许你关闭算法排序,只按时间顺序查看你关注的人发布的帖子。
- 分享前暂停一下。 每次点赞、评论或分享都相当于投票:“请多发这类内容。” 如果某件事让你愤怒,那正是算法最有可能利用你的时候。
- 限制使用时间。 设置屏幕使用时间限制。安排离线时段。你越少依赖信息流获取资讯,它对你信念塑造的能力就越弱。
超越泡泡
我希望这篇博客文章让你了解了这些推荐系统是如何运作的。我们在真实新闻数据上构建了一个推荐系统,仅需三次点击,就将一名体育迷的信息流从40%的体育内容转变为53%的政治内容。
打破束缚的第一步就是意识到这一点。下次当你陷入网络狂热时,深呼吸一下,问问自己:我为什么会看到这些?谁从我的这种反应中受益?答案通常可以追溯到一个正在执行其职责的算法,而这个职责很少是“为你提供信息”。
保持知情,保持开放的心态,
—— Ivo