Saturday, 10 June 2023

模仿换不来成功,因为你无法复制别人的运气

 人们普遍认为,做成功者做过的事情会增加成功的几率,这种观点掩盖了一些关于运气的偏见。一些人的成功和一时的热度都是运气使然。这意味着你不太可能从这些“榜样”身上受益,因为即使你可以复制他们所做的一切,你也无法复制他们的运气。


迈克尔•刘易斯在《点球成金——逆境中制胜的智慧》一书中,记录了奥克兰运动家棒球队在21世纪初不可思议的夺冠之旅。在这本书中,这家资金相对匮乏的棒球机构的总经理比利•比恩发表了一个令人惊讶的声明。他说,他的数据统计分析在季后赛中没起到任何作用,比赛的胜利全凭运气。

比恩使用了更为生动的语言,但重点是,他意识到:尽管他的足智多谋的确帮他赢下了这场实力悬殊的比赛,但运气或机遇同样重要。这在各行各业都是不可避免的因素——即使在棒球界。

运气在运动家队的比赛中起着多方面的作用。《点球成金》的故事通常被描绘成数据分析的胜利,但这却并不足以完全解释运动家队的成功。因为有关球员的数据和处理这些数据的技术已经公开了几十年。真正帮助比恩扭转战局的关键在于,他的对手往往在一些情况下过多地用运气来解释他的表现,而在另一些情况下却忽略了运气的作用。

这种情况往往表现在几个方面。

不符合一般标准的人就一定不好吗?

多年以来,球探和球队经理对优秀球员的品质特征形成了一些刻板印象。像“潜水艇投手”查德•布拉德福德这样能力强大但却并不符合一般标准的球员们则被低估了,因为经理认为他们的成功仅仅是凭借运气罢了。这种对运气的错误归因遮住了他们宝石一般的锋芒,使他们一直未被人们所重视。直到比恩运用正确的统计方法才真正揭开了实情。

比恩的对手们也对运动家队非比寻常的成功不屑一顾。球队的成就——在有限的预算下赢得了众多比赛——变得如此耀眼,以至于美国职棒大联盟(MLB)专门组织了一个委员会来研究这种“反常现象”,但得出的结论却主要是——“他们很幸运”。

把非典型球队的成功错误地归因于好运气,这对失败者来说也算是一种安慰。如果运动家队的成功被视为运气问题,竞争对手就不会过于担心这种异常情况,也就没有必要深入研究他们的策略。结果却表明,这支球队不但可以与体育巨人较量,而且连续四个赛季进入季后赛,战绩卓越。直到畅销书《点球成金》的出版才真正揭示出这种“运气偏见”背后的神秘之处。

在评估不同的员工时,高管们应该慎之又慎。如果《点球成金》对棒球队管理者错误的看法描述非常到位,那么我们应该预想到,在许多其他领域也会出现更多类似的偏见。那些不符合一般标准的人(比如女性和少数族裔管理者)的成就可能被错误地归因于运气,而符合一般标准的人的成就则往往被高估了。

卓越——还是运气?

人们普遍认为,做成功者做过的事情会增加成功的几率,这种观点掩盖了一些关于运气的偏见。在1986年至2006年间,美国最受欢迎的书《追求卓越》(In Search of Excellence)提出了一个许多商业畅销书遵循的公式:

一、选择几家非常成功的公司; 

二、分析他们从“优秀到卓越”的共同实践; 

三、把这些做法框定为一些基本原则,让那些渴望变得伟大的人来效仿。

但这些异常成功的表现通常不会持续太久。我们以三本最受欢迎的商业畅销书中的50家公司为例:《追求卓越》、《从优秀到卓越》和《基业长青》。我的研究表明,这些公司(从优秀到卓越)在被收录之前的显著增长之后,会出现系统性的衰退。在这50家公司中,有16家在书出版后的5年内失败了,23家业绩平平,表现低于标准普尔500指数。在剩下的11家公司中,只有5家保持了之前的优秀水平。变得卓越之后所发生的事情,显然并非不朽的伟大,而是向平庸的强烈倒退。

人们通常会认为,是由于CEO们的傲慢或自满导致了这种衰退。然而,一个更简单的解释是,CEO们最初就没有人们所期待的那么特别:他们的成功和一时的热度都是运气使然。而且是(坏)运气使他们中的许多人在随后遭受了失败,并受到无根据的指责。这意味着你不太可能从这些“榜样”身上受益,因为即使你可以复制他们所做的一切,你也无法复制他们的运气。


次优即是最优

如果异常成功之人并非效仿的好榜样,那么管理者应该向谁学习呢?我的研究表明,次优的选择可能才是一个不错的选择。

以音乐产业为例。如果一位音乐家的热门单曲排名前20,唱片公司是否应该立即与他签约?我分析了1980年至2008年美国公告牌单曲热度榜(U.S. Billboard 100)中的8297部作品,得出的结论却恰好相反。分析证明,音乐厂牌的老板们应该把目光投向那些排名在22位到30位之间(排行榜上的“次优”)的歌手。

一个最经典的例子就是韩国艺术家鸟叔(Psy)的《江南Style》。这段音乐视频出乎所有人意料地在网上疯传。出现这样的结果需要非凡的运气,因此鸟叔的成功是不可持续的。事实上,进入排行榜前20名的艺人们,他们下一首单曲的平均成绩很可能在40到45名之间徘徊。与那些此前排名更低的对手相比,他们的退步显得更加明显和不成比例。

与此同时,那些排名在20到30之间的人,他们下一首单曲的未来预期排名却是最高的。他们不那么耀眼的成就表明,他们的成功并非过于依赖运气,这使得我们更能准确地预测他们的优点和未来的表现。如果你跟随自己的直觉去追逐明星,给他们过多的报酬,甚至超过他们的应得水平,那么这种对运气的偏见会为像比恩这样精明的反向投资者创造机会,从而摧毁你的业务,颠覆整个行业。

毅力被高估了

当我展示我的研究成果时,一些经理被冒犯到了。他们相信,成功来自于努力工作、强烈的动力或“毅力”,而不是运气。所以最成功的人不应该得到较低的反馈和表扬。有些人甚至提出,成功有一个神奇的数字,即一万小时规则。

许多专业人士的确是通过持之以恒、深思熟虑的练习来获得他们的能力的。但对这些专家的详细分析往往表明,某些超出他们控制范围的情境因素也起着重要作用。让我们考虑一下三个乒乓球冠军的例子。他们都来自英格兰某小镇郊区的同一条街道。这并非巧合,著名乒乓球教练彼得•查特斯(Peter Charters)退休后就住在这个特殊的郊区。很多和这位退休教练住在同一条街上的孩子都因为他而被这项运动所吸引,其中三个孩子在遵循了“一万小时规则”后表现出色,并成为冠军。

他们的努力对他们的成功而言无疑是必要的。但如果没有早期的机遇,仅仅是在没有充分反馈的情况下,即使练习一万小时,也不太可能让一个随机挑选出来的孩子成为全国冠军。类似的情况也有可能是这样的,即一个有天赋的孩子很早就遭遇了不幸,所以他永远没有机会实现自己的潜力。

当谈到适度的表现时,我们对成功的直觉更有可能是正确的。传统的智慧,比如“我工作越努力,我就越幸运”或“机会青睐有准备的头脑”,在解释某人从表现差到表现好的时候非常有力。然而从优秀到卓越却是另一回事:在正确的时间出现在正确的地点非常重要,它的重要性甚至会压倒一个人的优点和毅力。

问题是,成功的管理者往往倾向于凭借他们以前的经验来做出决断,甚至超过了适当的程度。那些被我的研究冒犯到的管理者或许是对的:在他们获得体面的成功时,勤奋和毅力可能比运气更重要。但同样的因素不太可能使他们从优秀走向卓越。否则,就会产生过度控制和过度自信的错觉——这两种危险的偏见毁掉了无数的生意。

排除商业教育中对运气的偏见

管理研究和教育往往关注于说明如何从“优秀到卓越”的规范性理论(perscriptive theories)。这是有问题的,因为商业上的“伟大”往往离不开运气。商业教育工作者需要承认,我们可以帮助商业从业者少犯错误——“从不称职到称职”——但关于如何变得非常成功,我们却几乎教不了什么。

问题在于,我们往往倾向于模仿最成功的人。但当现代社会中最成功的人不再是一个可靠的标准时,忽视这种不匹配,就会让我们继续过高地评价他们,从而助长名实不符的情况,甚至引发欺诈。

考虑到这一点,我们不应该只是模仿生活的赢家,并期望获得类似的成功。但有一种情况是,成功者应该考虑模仿那些利用自己的财富和成功做好事的人。懂得珍惜自己的幸运、不攫取一切的成功者才是真正值得我们尊敬的人。

本文来自微信公众号 “哈佛商业评论”(ID:hbrchinese),作者:HBR-China,36氪经授权发布。

Wednesday, 7 June 2023

GPT4, copilot

 当「拒绝使用 Copilot、GPT-4 等编码工具,即使有多年编码经验,还是会被淘汰」这样太过绝对性的后果照进现实时,引发不少程序员热议——编码是否可以作为衡量程序员的唯一标准?辅助编程工具对于当代程序员而言,究竟是可选项还是必选?凭什么拒绝使用 AI 辅助代码编程工具后,经验丰富的程序员就没有了优势?它是否真的能够提升效率?

透过这一事件,本文也邀请了几位一线的开发者来谈一谈。

100% 手写代码的 19 年老程序员 vs 善用 AI 编程工具的 4 年新程序员

事情起因于一位名叫 Ab Advany 的技术人在 Twitter 上的分享,两周前,他帮助在代理机构的一个朋友去监督一个项目,期间聘请两名程序员来创建最简可行性产品(Minimum viable product,简称 MVP)。

他和两位程序员都有过合作,所以也知道他们相应的背景:

其中一位是来自德国的 Alex。平时会 100% 的手写代码。19 年的编码经验。

另一位是巴基斯坦的 Hamid。他擅长编写代码,也会使用 Copilot、GPT-4 辅助代码工具,以及无代码开发。拥有 4 年的开发经验。

让他们各自去创建 MVP,你觉得会发生什么。

需要提前注明的是,这两位程序员都收到了 Figma 详细的规格说明。另有一位设计师协助他们提供所需的资产,还有一些需要整合的现有代码。

一周时间之后,先来看看善用 AI 辅助编程工具的 Hamid 的情况。

Hamid 率先完成了 MVP 的第一个版本,以及完成 100% 的代码测试覆盖率和无代码部分的端到端测试。整体来看,MVP 的 95% 工作似乎已经完成,甚至乍一看这款产品可以工作......

具体来看,Hamid 先是借助无代码应用程序开发平台 Bubble 构建了 UI 和前端,使用 GPT-4 生成 Cloudflare Workers,使用 Copilot 集成现有代码,并使用 GPT-4 (playwright/ava) 生成测试。

整体成本:

GPT-4:211 美元

Copilot:20 美元

Cloudflare:5 美元

无代码平台 Bubble:134 美元

薪酬:2460 美元(工作 41 小时) 

托管/运行成本:139 美元/月

与之形成对比的是,手敲代码、拥有 19 年开发经验的 Alex 的最新进展:

Alex 一周共计完成了大约 7% 的任务。

整体成本:

托管服务 Vercel:20 美元 

薪酬:3500 美元

估计用于开发所有内容:45,000 美元。并预计 11,000 美元用于添加测试。

托管/运行成本:20 美元/月

起初,Ab Advany 和他的朋友都认为 Hamid 会在 8-10 周内完成 MVP 的构建,而 Alex 会多花一两周,但结果让他们都感到吃惊。

不会用 GPT-4、Copilot 的程序员,不是好的程序员?

带着这样的结果,Ab Advany 的朋友与 Alex 进行了交谈。

不过,Alex 坚持认为,运行自己开发的这个应用程序会便宜得多,而且一切都可以在掌控之中。

Ab Advany 则在 Twitter 上点评道,”Alex 不理解产品发布速度慢 13 倍和开发成本高 25 倍之中蕴藏的机会成本。“

最终因为只想自己”手动编码“而不信任无代码/AI,Alex 被解雇了。

Ab Advany 表示:

”我朋友的开发机构有 100 多个像 Alex 这样的开发人员。现在他要用 Hamid 这样的开发人员重新培训或替换他们......

我认为像 Hamid 这样的人五年后仍将有工作,而像 Alex 这样的人将不得不寻找其他工作/职业。你怎么认为?“

Monday, 5 June 2023

我养育你,并非恩情

 说姐想起了胡适写给儿子的一封信:


我养育你,并非恩情,

只是血缘使然的生物本能;

所以,我既然无恩于你,你便无需报答我。

反而,我要感谢你,

因为有你的参与,

我的生命才更完整。

我只是碰巧成为了你的父亲,

你只是碰巧成为了我的女儿和儿子,

我并不是你的前传,

你也不是我的续篇。

你是独立的个体,

是与我不同的灵魂;

你并不因我而来,

你是因对生命的渴望而来。

你是自由的,

我是爱你的;

但我绝不会“以爱之名”,去掌控你的人生。

Friday, 10 March 2023

语言本身并非思想的媒介,而更像一个信使。 ChatGPT

 语言常被认为是思维驾驭着的工具,人们“表达出”、“说出想法”,人们遵循着“思维的列车”或是“意识流”。而人类创造的一些巅峰——音乐,几何,计算机编程,则被定义为隐喻语言。这其中隐含了一种假设,即大脑通过一系列单词来处理世界以及我们对世界的体验。这种假定的联系也正是ChatGPT和类似程序如此神奇的原因:AI能够用类似人类的语言回答任何提词,这意味着机器具有某种意图,甚至是感知。

但随后程序说了一些完全荒谬的东西,例如在“nineteen”中有12个字母、或是旗鱼是哺乳动物——语言智能的“面纱”就此掉落。尽管ChatGPT可以生成流畅甚至优雅的散文,轻松通过困扰了AI领域超过70年的图灵测试基准,但它也可能看起来非常愚蠢,甚至危险:它在数学上会出错,无法给出最基础的烹饪建议,还会表现出令人震惊的偏见。

在一篇新论文*中,认知科学家和语言学家通过将语言交流和思维行为分离来解决这种不协调:具有一种能力并不代表具有另外一种。在专家们专注于生成式人工智能颠覆我们生活和工作的潜力之际,他们的争论也应该迫使人们去重新评估人工智能于人类智能的局限与其复杂性。

Mahowald, Kyle, et al. "Dissociating language and thought in large language models: a cognitive perspective." arXiv preprint arXiv:2301.06627 (2023).

https://arxiv.org/abs/2301.06627

*译者注

本文考虑了大语言模型在语言使用的两个不同方面的表现来评价其能力,即"形式语言能力"——包括指定语言的规则和模式的知识,以及"功能语言能力"——现实世界中语言理解和使用所需的一系列认知能力。大语言模型在形式语言的任务中表现令人深刻,却在很多需要功能语言能力的测试中失败。

研究人员解释道,作为思想的借代/提喻,语言的效果或许并不是很好。毕竟人们是基于视觉与语言思维的连续性来识别自我的*,无法用语言表达一个想法的体验,或许和语言本身一样是人类所特有的。这项研究的两位主要作者之一、麻省理工学院的认知神经科学家安娜·伊万诺娃(Anna Ivanova)也说道,当代对人脑的研究也表明“语言与思想之间存在分割”。对使用数十种语言的人们进行脑扫描后,研究人员发现了一个特殊的神经元网络*,其激活与所使用的语言无关(包括虚构的纳维语Na’vi和多斯拉克语Dothraki*)。

*译者注

识别自我:在Visual Thinking: The Hidden Gifts of People Who Think in Pictures, Patterns, and Abstractions一书中,Temple Grandin提到了一种思维风格的连续体,大致分为三部分,其中一端为语言思考者——更倾向于有序的、基于符号的方法,而另外一端则是,对象可视化思考者——他们通过使用具体的、类似于照片的心理图像来得出结论,而在中间的则是空间可视化思考者,他们似乎结合了抽象和具体的方法。

链接:https://www.newyorker.com/magazine/2023/01/16/how-should-we-think-about-our-different-styles-of-thinking

研究人员发现了一个特殊的神经元网络:

https://www.nature.com/articles/s41593-022-01114-5

虚构的纳维语Na’vi和多斯拉克语Dothraki:分别为《阿凡达》与《冰与火之歌》中的虚构语言。

该神经元网络一般不涉及包括数学,音乐与编程在内的思想活动。此外,许多丧失了理解和处理语言能力的失语症患者,仍然拥有计算或是其他非语言性心智任务的能力。结合来看,这两项证据表明语言本身并非思想的媒介,它更像是一个信使。人类语言的特殊之处便在于,它能够使用语法和词汇来与涉及了其他脑区的功能相连通,例如社交与逻辑。

-Carmela Montanero -

虽然ChatGPT和其他类似的软件,展现出了将单词串联在一起的令人难以置信的能力,但它们在其他任务上却很吃力。如果你想要一封向孩子解释“圣诞老人是虚假的”的信,它会生成一个由圣诞老人本人签名的感人回复。这些大语言模型,或被称为LLMs*,基于前文的一切预测一句话中的下一个单词(例如在“相较于”后接上“主流看法”)。但如果让ChatGPT做一些基本计算和拼写,或是为煎蛋给出建议,你可能会得到语法完美的废话:“如果你在煎蛋时用力过大,蛋壳就会碎裂。”

*译者注

LLMs,Large language models

这些缺陷表明了一种与人脑中所存在的相同的区别,即拼凑单词与拼凑想法的区别——论文的作者分别称之为形式语言能力与功能语言能力。该论文的另外一名作者,德克萨斯大学奥斯汀分校(the University of Texas at Austin)的语言学家凯尔·马霍瓦尔德(Kyle Mahowald) 表示“语言模型确实很擅长生成流利且合乎语法的语句,但这并不一定意味着一个东西能够生成符合语法的语言,它就能够进行数学计算、逻辑推理、思考或者确认社会语境。”

-Shahbaz Ali Khan -

如果人类大脑的语言网络不负责数学,音乐或编程这些思考任务,那么一个在TB级文本上训练的人工“神经网络”也就没理由擅长这些。作者写道,“与认知神经科学的证据一致,LLMs的行为突出了擅长语言和擅长思考之间的差异。”ChatGPT在一些商学院和法学院的考试中取得中等分数的能力,与其说是理解能力的象征,不如说只是泡影。

尽管如此,关于下一代语言模型的炒作仍然四起:下一代将会在更多的单词之上进行训练,并且拥有更强大的计算能力。ChatGPT的创始者OpenAI声称,他们的程序正在靠近所谓的通用智能,这将会使机器与人类处于同等智慧水平。如果该比较成立,那么仅仅是让模型更擅长于单词预测并不能让他们接近这个目标。换句话说,你可以驳斥ChatGPT这样的AI程序具有灵魂或是像外星人入侵这类观念。

伊万诺娃和马霍瓦尔德认为需要不同的训练方式来促进AI的更进一步发展——例如针对逻辑或是社会推理的方法,而非单词预测。ChatGPT可能已经在该方向上跨出了一步,它不仅是阅读大量文本,还包含了人类反馈,监督者(用户)可以评论是什么构成了好或坏的回答。但由于缺乏ChatGPT的训练细节,尚不明确人类输入的目标是什么,程序显然认为1000同时大于和小于1062。(OpenAI在2023.2.2发布了对ChatGPT的更新,据说提高了它的“数学能力”,但据报告,它仍在努力解决基本的文字问题。)

-Paweł Jońca -

而应该注意的是,有人认为大语言模型在语言方面并不如伊万诺娃和马霍瓦尔德写的那样优秀,它们不过是被美化了的自动填充器,其缺陷和能力一样大。认知科学家和著名的人工智能研究人员盖瑞·马尔库斯表示“语言不仅仅是句法,它还和语义相关。这不仅仅是因为人工智能聊天机器人不懂数学或如何煮鸡蛋,它们也难以理解一个句子是如何从其各部分的结构中衍生出含义的。”

例如,想象三个排成一排的塑料球:绿色球、蓝色球、蓝色球,有人让你抓“第二个蓝色球”,你能够理解他们指的是序列中的最后一个球,但一个聊天机器人可能会将指令理解为指的是第二个球,而它恰好也是蓝色的。马尔库斯说“大语言模型擅长语言的说法是被夸大的。”但是对伊万诺娃而言,像蓝球这样的例子需要的并不只是编译单词,还需要设想一个场景,因此“这并非关于语言本身,而是语言使用。”

-Shahbaz Ali Khan -

无论它们的语言使用多么令人叹服,像ChatGPT这类程序仅通过书籍和维基百科输入数据,关于它们实际上“理解”了多少这个世界,仍然存在着一场有益的辩论*。伊利诺伊大学厄巴纳-香槟分校的计算语言学家罗克珊娜·吉鲁(Roxana Girju)认为“意义不是给出的。意义是在我们的互动和讨论中商定的,不止是和其他人,还有和这个世界的互动。这是我们在参与语言活动的过程中所达到的目标。”如果这是正确的,那么构建一个真正智能的机器将需要一种不同的结合语言和思想的方式,不只是分层不同的算法,还需要设计一个程序,例如同时学习语言和如何处理社会关系。

*译者注

https://arxiv.org/abs/2208.02957

伊万诺娃和马霍瓦尔德并没有彻底否认语言是人类智慧缩影的观点,他们将其复杂化了。人类之所以“擅长”语言,是因为我们将思想与表达结合在了一起。一个能够熟练掌握语言的规则并运用的计算机,必然是智能的;然而另一方面,正是狭隘地模仿人类语言限制了其发展。但在我们用我们的有机体大脑更好的理解硅基大脑前,我们需要新的观点和新的单词来理解语言本身的意义。

后记

阿朔:看到这篇文章后,我的第一反应是《我是谁,或什么》中收录的一篇文章——《马克3型兽的灵魂》,文章描述了机械动物,主人公启动了它之后,它便开始在地板上搜寻,在插座面前停下,伸出一对插头试着插进了电源,并发出了和猫一样的呼噜声——就像在进食。主人公的朋友在用锤子打伤它之后,它流出了红色的液体,并发出了轻柔的哭声,给了那位朋友很大的冲击。

这只机械动物没有任何的语言能力,也没有很高的“智力”,但却让人难以对它下杀手。所以对我来说,认同一个个体,是取决于它的语言能力吗?亦或是身体内的蛋白质?或许重要的是它能否向我传达“意义”,我能否将自我投射于它,马克3型兽虽然简单,却明确的传达了生存的欲望,仿佛是它意识到了自身的处境。

在ChatGPT刚面世时,我便开始思考:“这是我想要的强人工智能吗?”我想,至少暂时,答案是否定的。

Qiumsky:在ChatGPT能说出“语法完美的句子”背后,(至少)有两点需要大家明确:第一,句子的内在结构应该呈现出树状的层级,而不是表面所显现出的线性结构;第二,单词之间的组合并不依靠概率,而是存在一些其他的决定性因素。在更深入探讨ChatGPT如何反映“言说与思考之差”之前,如何让ChatGPT真正地理解语言,同样值得我们去思考。

本文来自微信公众号 “神经现实”(ID:neureality),作者:MATTEO WONG,36氪经授权发布。