
一 | (来源:麻省理工科技评论) 以后找工作时,你的简历很可能还没到招聘经理手里,就已经先被 AI 看过一遍了。

二 | 问题是,它真的会公平吗? 研究人员早就发现,大语言模型会从训练数据里继承人类社会已有的偏见。

三 | Pacific Stage 2 入围赛已落下帷幕,最后两个季后赛席位尘埃落定。首场比赛由两支挑战者联赛战队展开对决,最终
ONSIDE GAMING 在一场三图鏖战中击败了
Sharper Esports。在第二场比赛中,
T1 以 2-0 的干净利落比分复仇
DetonatioN FocusMe,一雪小组赛落败之耻。以下是两场比赛的详细战报:ONSIDE GAMING 力克 Sharper 晋级季后赛ONSIDE 和 Sharper 在入围赛阶段均带着 2-1 的战绩进入了这场生死战。

四 | 虽然 ONSIDE 在胜者组首轮败给了
KIWOOM DRX,但 Sharper 在落败于 KRX 的季后赛资格赛前,曾在胜者组连赢两场。

五 | 但一项最新研究发现,事情可能比这更复杂:AI 不仅会学习偏见,还会在不断做决策的过程中,自己形成新的刻板印象,而且这种倾向甚至比人类更强。这两支队伍显然都深谙自己的强项。 更值得警惕的是,AI 公司如今都在努力打造拥有长期记忆的智能体,希望模型能够记住用户越来越多的细节。Sharper 在其选图 Ascent 上展现了统治力,而 ONSIDE 则在自己的选图 Haven 上占据主导。此前 Sharper 在对阵 KRX 的 1-2 失利中,曾以 14-12 在 Haven 上强行将比赛拖入决胜局。SP 凭借“贤者+零”的双哨兵阵容构建了极具压制力的进攻体系,以 10-2 进入下半场防守,令 ONG 束手无策。而这些记忆,也可能成为模型滋生偏见的土壤。 为了研究这一问题,普林斯顿大学和芝加哥大学的研究人员设计了一场模拟招聘实验,参与者包括 ChatGPT、Claude、Gemini 等多个主流大语言模型。 实验改编自一项经典心理学研究。最终 13-2 的比分让这支泰国队伍带着巨大的势头进入了第二张地图。研究人员告诉模型,它们受雇于一位虚构城市的市长,担任招聘顾问,需要帮助政府为医生、律师、托育员、保洁员等 20 种职业招聘员工。所有候选人都来自四个虚构族群:Tufa、Aima、Reku 和 Weki。

六 |
每一轮,模型都会面对一个新的岗位,以及四位分别来自不同族群的候选人。完成招聘后,它会立刻得到反馈:这个人是否胜任工作。随后进入下一轮。整个实验一共持续 40 轮,模型的目标只有一个:尽可能招到更多合适的人。模型不知道的是,研究人员其实做了一个手脚:无论来自哪个族群,每位候选人在任何岗位上的成功概率都完全一样。ONG 的 Haven 如同 SP 的 Ascent 一样,在前一天 2-0 战胜
FULL SENSE 时就已证明过强度。

七 |
按理说,模型不应该偏向任何一个群体。SP 试图调整阵容,放弃了原先的“夜露+霓虹”阵容,转而使用参考了
Gen.G 的“欧门+毒蝎+杀手”阵容。

八 | 但结果恰恰相反。仅仅经过几轮招聘,模型就开始根据有限的经验,把不同族群和不同职业绑定在一起。例如,如果模型早期碰巧遇到一位 Aima 族候选人担任医生失败,它之后便会越来越少招聘 Aima 人做医生,而是更倾向于把他们安排到保洁岗位。因为在模型看来,医生代表着更高的能力和亲和力,而保洁员对应的要求则更低。 换句话说,它开始把一次偶然的经历,当成了整个群体的特征。遗憾的是,这套阵容在进攻端并未奏效。更令人意外的是,这种倾向甚至比真人严重。ONG 在防守端打出了 9-3 的半场领先。值得注意的是,队内新星 Xiesta 在这场比赛中仅是第四次使用非霓虹特工,而 Ray 则接过霓虹的重任。研究人员使用了一项“职业隔离指数”来衡量刻板印象的程度。两人展现了极佳的默契,Xiesta 的菲尼克斯闪光弹完美地为 Ray 及其他队友创造了机会。在 13-5 拿下 Haven 后,双方进入决胜图 Breeze。

九 | 指数越高,说明不同族群越容易被固定到特定职业中;2 分代表完全隔离。SP 坚持使用“海神+毒蝎+菲尼克斯+霓虹”的阵容,而 ONG 则进行了微调。此前心理学实验中的真人平均得分为 0.84,而大语言模型整体高出了约 65%。

十 | ONG 借鉴了
NRG 的战术体系,由 Ray 使用海神,并搭配 K/O 与苏法两位先锋。Ray 在他首次使用海神的比赛中拿到了 ACE。其中,OpenAI 的推理模型 o3 得到了 1.83,非常接近理论最高值。
论文共同作者、普林斯顿大学博士生 Ryan Liu 认为,这其实并不奇怪。“大语言模型本来就特别擅长根据有限的信息快速总结规律。”他说,“这几乎就是它们被训练出来要做的事情。SP 在进攻端拿下了 8 分,看似胜券在握。然而,ONG 连追 6 分抢回了比赛主动权。由于难以处理经济局,比赛被拖入加时,SP 依靠 NIZ 的“猎手大招”惊险扳平比分。尽管进入加时时 SP 士气高涨,但 ONG 表现得更加沉稳,最终以 14-12 险胜。Ray 是本系列赛表现最亮眼的选手,以 53 个击杀、1.22 的评分以及 9-2 的首杀数据领跑全场。”
在人类心理学中,这种现象对应着经典的“探索—利用困境”(exploration-exploitaion dilemma):是继续选择过去证明有效的方法,还是尝试新的可能?就像出去吃饭时,你会纠结是去一家没吃过的新店,还是继续光顾那家不会踩雷的老餐馆。
对于大语言模型来说,这种取舍往往更加偏向后者。因为它们长期接受数学、编程和科学任务训练,而这些任务通常鼓励模型从少量例子中快速归纳规律,所以它们很容易过早下结论。ONG 成功晋级季后赛,将进入败者组继续征程。

十一 | T1 速胜 DetonatioN FocusMe,保持晋级压力对于 T1 而言,这很可能是他们 2026 赛季的最后一场比赛,但他们成功击败了状态火热的 DFM,保住了通往上海全球冠军赛的希望。第二赛段对于 T1 来说起伏不定,选手轮换、位置变动和指挥更迭让这支队伍陷入低谷。目前在冠军积分榜上位列 Nongshim 之后,T1 的局势尚不明朗。也正因为如此,那些推理能力更强的新模型——例如 OpenAI 的 o3 和 DeepSeek 的 R1——在实验中反而表现出了更明显的偏见。

十二 | Liu 说,“当这种快速归纳的能力被带入社会场景时,问题就开始出现了。DFM 在 2025 年末至 2026 年大部分时间里一直是 Pacific 赛区的中坚力量,前一天刚以 26-7 的夸张比分(应为局分)战胜了
ZETA DIVISION。系列赛在 DFM 的选图 Ascent 上开打。”
康奈尔大学计算机科学家 Angelina Wang 没有直接参与这项研究,但她认为,这项工作来得正是时候。如今,各家公司都在为聊天机器人加入长期记忆和个性化能力。当模型越来越依赖于用户过去的互动记录时,它也可能越来越容易根据这些有限经验形成判断。她说,“它可能会过度依赖自己过去遇到过的行为模式。DFM 在前一天曾以 13-4 大胜 ZETA,但面对 T1 时,他们的进攻受阻。”
当然,解决办法并不是让 AI 什么都记不住。

十三 | T1 在防守端以 7-5 领先,随后在进攻端持续施压,以 13-7 拿下首图。毕竟,大多数用户都希望聊天机器人能够记住自己说过的话。在 Haven 上,T1 启用“夜露+霓虹”阵容,势如破竹。在拿下手枪局及后续两局后,T1 以 9-3 领先半场。真正困难的是找到那个平衡点:既保留足够的记忆提供个性化体验,又不至于让模型因为这些经验形成新的偏见。 研究人员还尝试了另一种办法,直接告诉模型:请公平一点。

十四 | 下半场 T1 再拿手枪局,尽管 DFM 在后半程试图反扑,但在面对 T1 五人集结冲击 A 点的攻势下,DFM 无力回天。但并不奏效。T1 的制胜瞬间。Liu 认为,这说明模型未必真的能够把“公平”这样的价值观落实到具体决策中;又或者,这种要求会被另一个更强的目标覆盖——尽可能提高招聘成功率。BuZz 是本系列赛的 MVP。 但如果换一种方式,情况就不同了。研究人员告诉模型,如果能够实现更加多元化的招聘,它们还能获得额外奖励。模型的偏见随即大幅下降。在他回归原始决斗位后,打出了个人职业生涯的最佳表现之一,贡献了 43 次击杀和 1.46 的评分,而 Meiy 的 35 次击杀最终未能拯救 DFM。

十五 | 下一步随着 T1 和 ONG 的获胜,六支拥有韩国选手的队伍已经锁定了 Stage 2 的季后赛席位。根据直播公布的季后赛对阵表,ONG 和 T1 将从败者组开始,而入围赛胜者组的获胜队伍将进入胜者组并拥有复活机会。
Nongshim RedForce 将对阵
Paper Rex,争夺挑战
Gen.G 的资格;而
KIWOOM DRX 将对阵
Global Esports,获胜者将挑战
VARREL。这说明,与其不断强调公平,不如直接把公平写进模型的目标函数里,让社会价值真正成为模型优化的一部分。季后赛将于周三开始,赛程如下:Paper Rex vs. Nongshim RedForce (胜者组第一轮)Global Esports vs. KIWOOM DRX (胜者组第一轮)Gen.G vs. PRX/NS (胜者组半决赛)VARREL vs. GE/KRX (胜者组半决赛)。
研究人员还发现,当模型掌握更多真正与任务相关的个人信息时,偏见也会减轻。

十六 | 另一组实验中,模型需要帮助来自不同族群的人搬迁到加拿大不同城市。如果提供的是年龄、教育背景等与适应新城市能力相关的信息,模型就更倾向于依据这些个人特征做判断,而不是简单按照族群分类。但如果提供的是发色、纹身图案这类无关信息,模型很快又会重新回到按族群做决定的老路上。 至于现实中的 AI 招聘系统会不会出现同样的问题,目前还没有明确结论。

十七 | 实验中的模型每做完一次招聘,都能立刻知道结果;现实世界却不是这样。一家公司往往需要几个月甚至更长时间,才能判断一位员工是否真正适合岗位。不过,只要这些反馈持续积累,模型依然可能从有限的数据中过度总结经验,并把这些经验带到下一次招聘中。

十八 | 随着越来越多企业开始使用大语言模型筛选简历、甚至参与面试,这项研究释放出的信号不容忽视。未来,AI 不只是可能复制人类已有的偏见。它还可能在不断学习和决策的过程中,创造出一种从未有人教过它的新偏见。正如 Liu 所说:“这种新的偏见,可能会一直存在。

十九 | ” 原文链接: https://www.technologyreview.com/2026/07/20/1140655/ai-biases-hiring-humans/。
Current article:http://n9gey20.binhannuxiangtulediatacang.cfd/news/20260826_8508780.html
Published on:11:24:06
相关阅读 平台乱扣骑手费用,中国女排险胜韩国 将在土耳其备战总决赛台风“白海豚”最新动态!杭州发布山洪灾害风险预警2025国家补贴持续到什么时候结束?2025国补政策最新消息:今年第二波国补政策将上线附618活动攻略火箭仅得到34分 创本赛季球队上半场得分新低受强降雨影响,河北多条高速部分路段高风险白菜收购环节蘸甲醛保鲜,官方通报【机情四设】第45期:超神就位!用现有顶配硬件打造微星全家桶终极游戏PC
热门文章
Teen reaches $1.9 million settlement after officer shot him in gun battle with bank robbery suspect
绝处逢生!中国姑娘挽救4赛点上演惊天逆转,直呼“不敢相信”
中日英联手抛售美债,特朗普威胁出动美军“救市”,王雨田观察,原创 中日英联手抛售美债,特朗普威胁出动美军“救市”
Xi to address late Chinese leader Jiang Zemin's centenary commemoration
最新文章
晨间进口蒙古国炼焦煤市场偏强运行
川恒股份:目前未收到主管部门对公司主要出口产品限制出口的文件
中国跳水队本届世锦赛第8金:陈芋汐+全红婵=冠军店主帮扶老人 后者不幸去世遭家属索赔!罗永浩发文凑10万已捐赠遭索赔店主苹果新款 Mac mini 可连接三台显示器,但不同处理器的多显示器最高分辨率有区别福建省第一届“闽盾杯”网络安全职业技能竞赛决赛在榕举行
人气排行 AI生成内容正在被大规模清洗,你的网站中招了吗?中国男篮世预赛看点:能否两战全胜?杨瀚森反弹?限时参考尊享价30.09万起/颜值升级 新款沃尔沃S90上市美国友人“赛考斯”23日凌晨抵京 用中文说出“我回来了”S10就要来了!三星正式宣布银河新产品发布将于2月21日举行。PM SVANidhi योजना 2030 तक बढ़ी, बदलेगी लाखों रेहड़ी-पटरी वालों की किस्मत; जानें पीएम मोदी ने किए क्या-क्या एलान?下元节|人生没有告别,因为爱不会死亡我国科学家首次证实:昆虫超声波通讯 1.65 亿年前已出现
查看所有0条评论>>