Saturday, 15 June 2024

世界的本质是无法量化的

 摩根·豪泽尔是美国最受欢迎的新晋投资理财作家,跟其他投资畅销书作者不同的是,豪泽尔并非成功的华尔街专业投资者,也不是金融科班出身,在出版《金钱心理学》(Psychology of Money )之前,他的工作是给个人理财投资网站 The Motley Fool写专栏,就连这本书也曾被多家出版社拒绝,最终由一个仅有五名员工的英国出版商Harriman House出版,从最初的无人问津到好评如潮,这本书最终发行了52种译本,销售超过300万册,成为近五年来全球最畅销的投资理财书籍。本文选摘自豪泽尔的新著《一如既往:不变的人性与致富心态》中的《不可量化》一章,跟豪泽尔以往的文章一样,一如既往的发人深省。 


世界由不可量化的力量驱动。

世界上有很多事情不符合情理——数据可能前后矛盾,分析可能漏洞百出。尽管不合理,但这样的事情屡见不鲜。人们常常违背理性,做出各种疯狂的决定和奇怪的行为。

大多数情况下,人们做决策并不是在电子表格里将几个数字简单相加就大功告成。做决策还需要考虑人的因素,而这一因素很难被量化和解释。它看起来往往和最初的目标联系不大,但实际上它的影响更大。

历史学家威尔·杜兰特说过:“逻辑是人类的发明,却被宇宙忽视。”事实确实如此,如果期待世界的运转一直保持理性,你一定会大失所望。

试图把受情绪和激素支配的人的行为提炼为数学公式,给这个世界带来了太多沮丧和惊诧。

不能理解越南人感受的“奇才”国防部长

第二次世界大战结束后,福特汽车的经营状况十分糟糕。亨利·福特二世说,公司需要一个“奇才”。他能把企业经营当作依靠客观数据驱动的运筹学,于是聘用罗伯特·麦克纳马拉帮助公司扭转颓势。

后来,麦克纳马拉在越南战争期间担任美国国防部长,将这种数字化管理方式引入华盛顿。他要求对所有战事进行量化,按日、月、年绘制报表,对每一项能想到的统计数据进行追踪。

然而,在福特奏效的策略在被应用于国防部时却出现了一个明显的缺陷。五角大楼特种作战部门负责人爱德华·兰斯代尔看过麦克纳马拉的数据,指出有些东西缺失了。

“什么东西?”麦克纳马拉问。

“越南人的感受。”兰斯代尔回答。

的确,你无法将越南人的感受简化为统计数据或图表。这是指挥越南战争的一个核心问题。美国政府收到的作战数据,与战争中人们的真切感受可能完全不是一回事。

指挥美军的威斯特摩兰将军告诉弗里茨·霍林斯参议员:“我们和对方目前的死亡比例是1∶10。”霍林斯回答说:“不在乎10,只关心1”。

据说越南领导人胡志明听说后说得更直白:“尽管你们杀害我方10个人,我们才消灭你们1个人,但先被拖垮的必定是你们。”

这种较量,很难用图表来呈现。有些事情确实很难或者无法被量化,却极为重要。由于不可量化,人们往往低估这些因素的相关性,甚至否认其存在,但事实上,它们能够产生关键的影响。

芝加哥大学的一面墙上刻着英国科学家开尔文勋爵的名言:“如果你不会量化分析,那就说明你学识浅薄。”他说得不无道理,但如果有人认为一些因素因无法被量化而无关紧要,这样的观点就非常有害了。事实恰好相反,世界上有一些重要因素,尤其是与人的个性和观念相关的因素,几乎都无法被量化,也无法被预测。

亚马逊创始人杰夫·贝佐斯说过:“我发现,当统计数据解释不了一件事情时,事情一般没有问题,而是你量化的方式有问题。”

我对这番话又爱又恨,我知道它说得对,但又希望它不是真的。让我们回顾历史,体会其中的智慧。

二战中的突出部战役是美国有史以来伤亡最惨重的战役之一。1944年12月,纳粹德国孤注一掷对盟军发动了最后的进攻,在一个多月的时间里,1.9万名美国士兵阵亡,7万名士兵受伤或失踪。

伤亡如此惨重,部分原因在于美军措手不及;而美军措手不及,又是由于美军将领“理性地”认为,德国人根本没有理由发动进攻。

德军没有足够的兵力反攻,他们所剩无几的士兵大多未满18岁,也没有战斗经验。而且,德军已经燃料匮乏,存粮不足。交战地区比利时阿登森林的地形对他们也极为不利,天气条件还十分恶劣。

盟军对这一切了如指掌。他们推断,德军指挥官但凡有些理性思维,就不可能发动反攻。因此,美军兵力部署薄弱,补给有限。

然而意想不到的是,伴着隆隆的炮声,德军竟然发起了反攻。

美军将领没想到,此时希特勒已经丧心病狂,失去理智,沉浸在自己的世界里,分不清幻想和现实。德国将领问他如何获得充足的燃料以保障反攻,希特勒叫他们从美国人那里偷。他已经把德军的不利局面完全抛在脑后。

历史学家斯蒂芬·安布罗斯指出,1944年末,盟军司令艾森豪威尔和奥马尔·布拉德利将军在战争布局上表现出了良好的逻辑推理能力,但就是没有料到希特勒会疯狂反扑。

战争期间,布拉德利将军的一位助手当时曾断言:“如果我们的对手是正常人,他们早就应该投降了。”但德军不是正常人,他们这一奇招很难用逻辑去预估。这一点比什么都重要。

无法计算人类奔跑极限的诺奖得主

英国生理学家阿奇博尔德·希尔每天早上7点15分会准时在跑道上跑步。他非常擅长跑步,是一名优秀的运动员、竞技跑者。

希尔出生于1886年,是一位在多个学科颇有建树的杰出科学家。在职业生涯的大部分时间,他专心研究一个自己最感兴趣的问题——人类能跑多快、跑多远?他甚至在自己身上做起了实验。

依你我或希尔的身体条件,人类奔跑的速度和距离的理论极限是多少?这就是希尔想要解决的问题。

希尔早期的研究观点是,跑步速度的极限取决于运动员的肌肉(主要是心脏)功能。如果在跑步时一个人的心脏能够比别人的心脏给发力的肌肉输送更多的血液,他就能跑得更快,这是一个你可以清楚测算的指标。由于对人类身体机能研究所做的卓越贡献,1922年希尔荣获诺贝尔生理学或医学奖。

我们能够测算一个人跑步速度的极限,这一想法合情合理,在实验室和测试跑道上做实验基本上也是可行的。

但是,在现实世界的竞技赛道上,却是另一回事。希尔的测算方法对预测径赛冠军几乎毫无作用。

如果最具竞争力的运动员靠的只是一颗强大的心脏及其向肌肉输氧的能力,那么预测比赛冠军会是一件轻而易举的事。

但事实并非如此。与不爱户外运动的电视迷相比,运动员的心脏更强大。但心血管能力强并不意味着运动表现就一定更强。正因如此,马拉松和奥运会短跑等竞技性比赛才会扣人心弦。有时候,头号种子选手会输掉比赛;有时候,黑马选手会一鸣惊人。

希尔曾坚持认为,跑步表现只与肌肉力量相关,这导致他后来陷入尴尬境地。当被问及为什么他早期对运动能力的计算对预测比赛冠军毫无作用时,希尔回答:“说实话,我们那么做不是因为预测方法真的有效,而是因为它很有趣。”

但希尔最终弄清了原因,也从此改变了科学家对运动表现的认识。

事实是,运动表现未必仅取决于人的身体机能。它还取决于你的大脑对特定时刻的风险与回报进行权衡后所发挥的机能水平。

大脑的首要任务是确保你没有生命危险。因此,就像汽车上的调速器一样,不到万不得已,大脑不会让人发挥出最大的机能,因为这样可能会使人筋疲力尽,从而脆弱不堪。倘若发挥机能带来的风险与回报不匹配,大脑就会让人在达到一个较低的机能“极限”时停止运动。

一个人在测试跑道上测得的体能极限,可能与奥运会决赛中的体能极限不同,而后者又不同于被杀人狂拿着斧头追赶时所发挥的体能极限。

这也解释了某些不可思议的事。例如,当有人被压在车下,生命危在旦夕时,众人能够合力将汽车抬起。所以说,人的能力是在特定时刻和特定环境中所发挥出的潜能。

希尔早年曾写道:“人的身体如同机器,应该可以精确测算其消耗的能量。但后来,在对人类表现有了更进一步的认识后,他指出:“运动表现不单纯取决于身体的化学反应。”还取决于一些更难被测算的行为和心理因素。

如果运动员不走进紧张激烈的比赛现场,我们永远不会知道他们的能力极限,因为我们无法在实验室中模拟出现实环境中的压力、风险与刺激。

巧合的是,希尔的妻子是英国经济学家约翰·梅纳德·凯恩斯的妹妹。凯恩斯在研究中发现,经济不是机器。它有灵魂,有情绪,有感受。凯恩斯将其称为“动物精神”。

关于人的身体,希尔也有同样的发现,他称之为“道德因素”。我们的身体不是机器,不应当期望身体像机器一样运转。身体有感知,有情感,会恐惧,这些都会影响人的能力。然而,所有这一切都很难被测算。

破产的雷曼兄弟与狂飙的游戏驿站

投资家吉姆·格兰特曾说:如果认为普通股的价值完全由公司的收益、相关利率以及边际税率决定,那就等同于忘记了人类在历史上曾经烧死女巫,曾经因心血来潮而发动战争,也曾轻信电影大师奥逊·威尔斯在广播中宣告火星人已经登陆地球。

历史经常重复上演,以后还会继续上演。

每一笔投资出价,每一个市场估值,都是公司的现值乘以公司明天的故事。

数字易于测算、追踪和解释。随着当今信息的普及,这些工作变得越来越容易。

但故事往往可以夸张地反映人们的希望、梦想、恐惧、不安、种族归属感等内心情感。随着社交媒体为博取眼球而大肆渲染,有些故事变得越来越离奇。

以下几个例子可以说明其影响之大。

2008年9月10日,雷曼兄弟的经营状况良好,公司的一级资本比率(衡量银行承受亏损能力的指标)为11.7%,较上一季度有所增长,而且高于高盛和美国银行。雷曼兄弟比上一年拥有更多的资本,银行业也一如既往地稳健。

不料,72小时后,雷曼兄弟破产了。

这三天里唯一变化的是投资者对雷曼兄弟的信心。前一天,投资者出于信任准备购买雷曼兄弟的债券。第二天,他们不再信任雷曼兄弟了,雷曼兄弟的资金顷刻化为乌有。

信任是其中唯一重要的因素,但也是事先难以被量化、模拟和预测的因素,传统的估值模型无法对它进行估算。

游戏驿站公司(GameStop)的故事截然相反。2020年,这家公司本来已濒临破产。但是它忽然在红迪网上受到狂热追捧,随后股价一路飙升,募集到大量资金。2021年,该公司市值一度达到110亿美元。

雷曼兄弟和游戏驿站两家公司,两种境遇,却体现了同一个道理:最关键的变量是人们所讲的故事,故事无法被事前计算与预测,结局也无法通过计算来预估。

一旦发生这种事情,你就会看到人们大惊失色,愤愤不平,因为他们觉得这个世界充满了意外,一切都不可靠。但吉姆·格兰特说得对:事情历来如此。

世界的本质难以被量化

好故事的力量大于冰冷的统计数据

回顾整个20世纪,20年代让人眼花缭乱,30年代让人惶恐不安,40年代仿佛世界末日来临,50年代、60年代、70年代繁荣与萧条更迭,80年代、90年代疯狂不羁,21世纪初则像一部真人秀,亦真亦幻。

如果你想凭借数据和逻辑思维理解经济现象,那么你会困惑整整一百年。

瑞典经济学家裴德荣指出:“经济价值的概念很简单:任何东西只要有需求,无论是出于什么原因的需求,它都有价值。”价值取决于人是否想要某个东西,而不是取决于其效用或利润。很多经济活动受人们情感的驱动,而情感往往很难被量化。

在我看来,就像在军事上一样,在商业和投资领域,如果有某个因素你无法衡量、无法预测,也无法在电子表格中建模,那么它很可能是最强大的力量。在政界、职场、人际关系等领域也是如此,无法被量化的因素,其力量也无法被预估。

投资中最常见的风险就是,人们像罗伯特·麦克纳马拉一样,长期痴迷于数据,相信模型,认定不会出现任何错误或意外,认定事情不会深陷疯狂、愚蠢、莫名其妙的境地。结果,他们总是不断地问“为什么会发生这种情况?”,并期待得到一个合理的解释。或者更糟的是,他们永远不愿接受已经发生的事实,一味沉溺于过去不切实际的幻想。

世界充满了荒诞离奇、困惑迷茫、人际冲突、自身缺陷,只有认识到这一点,才能成为人生赢家。

理解这个真实的世界,需要我们接受种种现实。

美国数学家约翰·纳什是有史以来最具天赋的数学家之一,曾获得诺贝尔经济学奖。但是,他也被诊断患有精神分裂症,大半辈子时间他都坚信,外星人不断向他传送加密信息。

哥伦比亚大学新闻学教授西尔维娅·娜萨在《美丽心灵》一书中,描述了纳什和哈佛大学教授乔治·麦基的一次对话:“作为一个数学家,一个终生致力于逻辑推理的学者,你怎么会相信外星人向你传送信息?你怎么会相信来自外太空的外星人招募你来拯救世界?你怎么可能……?”

“因为,”纳什操着柔和的南方口音慢吞吞地说,“我对超自然生物的想法就像我的数学思想一样,自然出现在了我的脑海里。所以我很认真地对待这些想法。”

要接受有些事情无法被量化,首先要明白,人类社会之所以有创新和进步,世界上有些人的思维方式与我们普通人不同,这是我们之幸。

如果世界是可预测的,是理性的,那再好不过了。但是,事实是,我们要经常面对不确定性、误解和不可预测性。美国作家罗伯特·格林曾经写道:“追求确定性是人最大的心理疾病。”它让我们错误地认为世界是个电子表格,我们可以通过量化建模预测事情的结果。如果每个人都把世界理解成一套需要遵循的理性规则,我们注定一事无成。

其次,要接受这样一个事实:在你看来合情合理的事情,在他人看来可能是疯狂的。如果所有人都有相同的时间维度、奋斗目标、雄心壮志和风险承受力,那么一切皆可测算。但事实并非如此。对长期投资者来说,在股价下跌5%时慌乱抛售是不明智的,但对专业股票交易员来说,此时抛售股票是其职业生涯的当务之急。在这个世界上,别人所做的商业决策或投资决策,不可能完全符合你的希望和想象。

再次,要了解动机的力量。金融泡沫看似不合理,但是那些身处泡沫中的人,就像美国2004年的抵押贷款经纪人或1999年的股票经纪人,却赚得盆满钵满,在金钱的刺激下,他们已经无法停下脚步。他们不仅欺骗客户,也欺骗自己。

最后,要明白,好故事的力量大于冰冷的统计数据。“目前,房价与收入中位数的比例高于历史平均水平,而且通常会出现均值回归”,这是一项统计数据。“吉姆刚刚通过炒房赚了50万美元,现在可以提前退休了,他的妻子觉得他很了不起”,这是在讲故事。两个例子相比,故事比数据更有说服力。

世界的本质就是这样,难以被量化。

本文来自微信公众号“巴伦周刊”(ID:barronschina),作者:摩根·豪泽尔,36氪经授权发布。

Friday, 24 May 2024

从玻尔兹曼机到多模态大模型:Geoffrey Hinton的最新AI洞见

 Joel Hellermark:是什么让这些大语言模型能够学习各种不同领域的知识?

Geoffrey Hinton:这些大语言模型所做的是寻找共同的结构,通过发现共同结构,它们可以用更有效的方式对事物进行编码。让我给你一个例子,如果你问GPT-4"为什么堆肥堆和原子弹类似",大多数人都无法回答,他们认为堆肥堆和原子弹是完全不同的事物。但GPT-4会告诉你,虽然能量和时间尺度不同,但它们都涉及链式反应,当堆肥堆越热就会发热越快,当原子弹产生的中子越多,产生的中子就越快,所以它们其实都是链式反应的形式。

我相信GPT-4已经理解了这一点,并将这种理解压缩到了它的权重参数中。如果它真的这样做了,那么对于成百上千种我们还没有发现的类比,它也会这样做,这就是创造力的来源,即看到表面上完全不同的事物之间的相似之处。所以我认为,随着模型越来越大,GPT-4 将变得非常有创造力。认为它只是在重复它所学到的知识,拼凑已有的文本是完全错误的,事实上它将比人类更具创造力。

Joel Hellermark:你认为它不仅能重复目前人类开发的知识,还能超越这些知识,走向更高层次。我认为这是我们目前还未完全看到的。你认为是什么将使它能够超越当前水平?

Geoffrey Hinton:在一些有限的领域里,我们已经看到了这一点。比如在著名的与人类职业棋手李世石的对抗赛中,第37手时AlphaGo下出了一步棋,所有专家当时都认为那是一步错棋,但后来他们意识到那实际上是一招妙棋。所以在这个有限领域内,它已经展现出了创造力。我认为随着这些系统变得越来越大,我们将看到更多这样的例子。

Joel Hellermark:AlphaGo最初是通过模仿学习,观察人类下棋来学习的,然后通过自我对弈,它的表现远远超出了模仿学习的水平。你认为这是目前缺失的关键部分吗?也就是自我对抗性的学习?

Geoffrey Hinton:这可能确实是目前缺失的一个重要部分。但我不认为这是完全必需的。

很久以前我做过一个小实验,训练一个神经网络识别手写数字,这是最经典的例子。在训练数据中,我将一半的答案设置为错误的。问题是,在有一半错误标记的情况下,它能学到多好?而且我保持了这些错误标记,并没有在不同的样本中给出正确答案,让它有机会通过平均来抵消错误。也就是说,对于某些样本,无论如何都会给出错误的标记。所以训练数据有50%的错误,但如果你用反向传播训练,它最终的错误率能降到5%以下。换句话说,即使有错误标记的数据,它也能获得比训练数据更好的结果。它可以识别出训练数据是错误的。

这就像一个聪明的学生可能比他的导师更聪明一样。导师告诉他们很多东西,但对于其中一半,学生会想"这太荒谬了",然后只听从另一半建议。最终,学生比导师更聪明。这些大型神经网络也能做到比它们的训练数据更出色的表现,但大多数人并没有意识到这一点。


Saturday, 27 April 2024

生物方法战胜了逻辑方法

 作者:卫sir

链接:https://zhuanlan.zhihu.com/p/686217224
来源:知乎
著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。

Geoffrey Hinton教授,人称“人工智能教父”、“神经网络之父”。

他最近(2024.2.19)给牛津大学做了一个公开演讲,从哲学角度对AI的未来走向,提出了严肃而重要的思考。

这个演讲37分钟,PPT32页,全文6422个单词,我之前发过全文,有人说太长,希望精简。

Geoffrey Hinton(1947年12月6日~),是英国出生的加拿大计算机学家和心理学家,多伦多大学教授。他是神经网络反向传播算法和对比散度算法的发明人之一。他、约书亚·本希奥、杨立昆一同被授予了2018年的图灵奖。

所以我略微整理了一下,以下是他在本次演讲中所传达的主要观点。

1、看来,生物方法战胜了逻辑方法

逻辑方法(又称符号方法)认为智能的本质是符号和规则;生物方法(即神经网络方法)则大不相同,它认为智能的关键是神经元之间的强度。

Hinton在演讲中说:

2012年,我的两位学生Ilya Sutskever(后来成了OpenAI首席科学家)和Alex Krizhevsky,在我一点帮助下,展示了可以通过这种方式(反向传播)制作一个非常好的神经网络,在有一百万张训练图片时,可以识别一千种不同类型的对象。伊利亚很有远见,他知道这个神经网络会在ImageNet竞赛中获胜。他是对的,他们赢得相当炸裂,他们的神经网络只有16%的错误率,而最好的传统计算机视觉系统错误率超过了25%。
然后,科学界发生了非常奇怪的事情。通常在科学界中,如果有两个竞争的学派,当你取得一点进展时,另一个学派会说你的成果是垃圾。但在这个案例中,由于差距足够大,使得(符号学派)最好的研究者Jitendra Malik和Andrew Zisserman转换了研究方向来做这个,Andrew Zisserman还给我发送邮件说“这太神奇了”。

Hinton认为,在AI方面,生物方法显然占了优势。

2、大型神经网络可以无师自通地学会语言

符号学派认为他们在语言处理方面应该很出色,他们认为,神经网络是无法处理语言问题的,很多语言学家也持这样的态度。

然而,事实表明,大型神经网络仅仅通过学习大量的文本,就能无师自通掌握了语言的语法和语义!统计学家和认知科学家认为这完全是疯狂的。

Hinton说,乔姆斯基(Noam Chomsky)曾说语言是天赋而非习得的,这很荒谬,他曾经做出了惊人的贡献,但他的时代已经过去了。

3、大模型完全有理解力

关于人是怎么理解事物的,有两种理论。一种理论(符号方法)认为,一个词的意义在于它与其他词的关系;另一种理论(心理学方法)认为,一个词的意义是一大堆特征组成的,比如“狗”有一大堆特征,它有生命、它是哺乳动物、它捕食等等。

大模型很好结合了以上两种理论:它学习每个单词的特征,并学习单词的特征如何相互作用。在推理时,大模型分析文本,列出文本中每个单词的特征,并计算所有特征之间的交互(通过注意力算法),从而预测下一个单词的特征。

Hinton举了一个小例子,来说明其工作原理。

在符号方法中,回答“詹姆斯的妻子是谁”这种问题时,人工智能是这么做的:它看到科林有父亲詹姆斯,科林有母亲维多利亚,它用规则推断出,詹姆斯有妻子维多利亚。(前提大家都是正经人)

而在大模型中,它学到“詹姆斯”有一堆特征,“妻子”有一堆特征,推理时,它让这些特征相互作用,得出了“詹姆斯”的“妻子”应该有的特征,然后发现“维多利亚“最匹配这些特征,那么“维多利亚”就是”詹姆斯“的”妻子”。(虽然可能认错了人)

Hinton坚定地认为,在大模型中,数百万个特征以及特征之间数十亿次的交互,就是理解!

大模型当然也是一种模型,只不过是一种人类以前从没见过的巨大的模型,它如此巨大,大到能够包容人类拥有的所有知识。



Geoffrey Hinton

4、大模型是人类认识自己的最好方法

大模型是了解人类如何理解语言的最佳模型,大脑就是在给单词分配特征,并让特征交互。

神经网络模型就是为了模拟人类理解而设计的一个模型。

大模型正如大脑那样工作,大模型正如大脑那样理解。

5、大模型的幻觉不是问题,人也会胡说

心理学家从来不说大模型有幻觉,因为心理学家知道人类也经常编造东西。

任何研究过记忆的人都知道,对人类而言,真实记忆与虚假记忆之间并没有明确的界限。

Hinton说,“如果某件事是最近发生的,并且它与你理解的事情相符,你可能会大致正确地记住它。如果某件事是很久以前发生的,或者是比较奇怪的事,你会记得不正确,而且你经常会非常自信地认为你记得正确,但你错了。”

6、超级智能不需要太久就会出现

Hinton说:“我一直以为我们离超级智能还有很长很长的路要走,我过去常告诉人们可能需要50到100年,甚至可能是30到100年,我们现在不需要担心它。”

“但是,由于我在之前两年所从事的工作,我突然开始相信我们现在拥有的数字模型已经非常接近于大脑的水平,并且将变得比大脑更好。”

为什么GPT4比人类知识更丰富?它不是由一个模型实现的,而是由不同硬件上运行的大量相同模型的副本实现的,一千个副本都去互联网上查看不同的内容并学习东西,然后,通过平均梯度或平均权重,每个代理都掌握了其他代理学到的东西,这种沟通比人类要强太多了。GPT-4的权重只有人类大脑权重的2%左右,但却拥有比人类多上千倍的知识。

数字计算的缺点是需要大量能量,但我们可以通过进化硬件,使大模型的能量消耗降低。

Hinton认为,“很明显,在未来的20年内,有50%的概率,数字计算会比我们更聪明,很可能在未来的一百年内,它会比我们聪明得多。”

“很少有例子表明更聪明的事物被不太聪明的事物所控制。”

7、超级智能有若干种方法将我们消灭

当我们迎来工业革命时,我们拥有强有力的机器,体力劳动的工作岗位消失了。

现在在智力领域,有些工作也将会消失,取而代之的是比我们聪明得多的东西。

Hinton认为,人工智能会产生致命的自主武器,它们将非常可怕,而且真的会自主运行。

他说,“人工智能有若干种方式将我们消灭“,”任何打算关闭它们的人都会被超级智能说服。”

“有些人认为我们可以使这些东西(人工智能)变得善良,但如果它们相互竞争,我认为它们会开始像黑猩猩一样行事。我不确定你能否让它们保持善良,如果它们变得非常聪明并且有了自我保护的意识,它们可能会认为自己比我们更重要。”

Monday, 15 April 2024

对「AI 味」反感不止于审美疲惫,它还藏着我们对其隐喻的抵触。

 去年年底以来,更多人 感受到了 AI 对生活的「入侵」 —— 我们开始在地铁、电梯间和商店看到了 AI 生成的广告图像。

之所以称之为「入侵」,那是因为这些图像不仅具有浓浓的「AI 味」,其中不合常理之处也未经修正,让不少人大呼「阴间」。

这种广告,简直就是在花钱广而告之人们不要相信这个品牌 —— 连广告都那么随便,那产品如何值得信任?

然而,很多广告公司似乎坚信 AI 是未来。

让消费者反感的「AI 味」没有削减广告公司对 AI 兴趣,反倒激起了一轮「去 AI 味」的工作流创新。

当我们在「去 AI 味」的时候,我们在去什么?

图片来自:小红书@rataalada、@摸头姐姐

在正处于 AI 发展洪流中的当下,「AI 味」注定是一个将不断被重新定义的词语。

现在,「AI 味」在图像中大多指的是某种特定「既高清,又模糊」 —— 光亮平滑,缺乏真实细节。

作为人类,我们的眼睛会被不完美的细节吸引。

所以当我们看到现在这些(AI 生成的)图像……我就觉得挺反感,老实说。

工业设计师 Ti Chang 说道。

正因如此,如何找到那些可以「让假变真」的「不完美」细节,成为了「去 AI 味」一大重点。

你也许开始可以先用 AI 提示词来做生成,但之后你一定要去调整,有时候甚至需要用 Photoshop 这类传统工具来让它更好。

视觉艺术家和设计师 Vaunn Yevo 分享道。

在做商单的时候,Yevo 会先用 AI 来生成图像,然后用 PS 去增加人像的「不完美」,如人脸上的毛孔、细纹、或者微小的毛发。

Yevo 也曾经试过想用 AI 提示词直接给图像增加这些「不完美」,但出来的效果并不理想:「有时候如果你让 AI 模型去添加雀斑,出来的效果会让整片皮肤都很怪。」

左图为 Yevo 的标志性风格,右图为尽量模仿其风格生成的照片。右图也彰显了想用 AI 来生成自然人像的困难:混乱的手指固然致命,非常夸张的雀斑也很不自然

毫无悬念,当有人找到了可以「让假变真」的规律,就会有人开始基于此开始做 AI 工具。

2023 年年底,名为「Magnific」的工具开始外网火了起来。

这个被称为「AI 生图精修师」的工具,可以为 AI 生成图像增加更多细节,并支持不同生成模式,在发布一个多月就吸引了 40 万注册用户。

右图为 Magnific 修图后效果

全球著名广告公司 McCann Worldgroup 现在也在开始尝试在工作流中加入 Magnific 这类工具。

在 McCann Worldgroup 为文化组织 Black & Abroad 做的图中,原本模糊的 AI 生成图,经由细节调整后有了很大改善(右图)。

对比可见,第二个不仅在人像添加了更多皮肤、头发细节,背景场景和人物手上的饮料都进行了调整。

与此同时,McCann Worldgroup 还在尝试另一种「以 AI 治 AI」的方法 —— 多模型 + 人工混合模式。

去年在为墨西哥食品公司 Bimbo 设计数字广告时,McCann Worldgroup 就用一个模型来生成图像的前景,然后再用另一个模型来生成图像中的汉堡和热狗,再用另一个模型来生成背景,至于海报字体部分,直接开用人工设计。

这是一个和技术以及技术专家来回往复的对话过程,但我们会有一套统一但不断进化的创意构想,其中也会包含很多层次。

McCann Worldgroup 全球 AI 创意负责人兼加拿大首席创意总监 Ian Mackenzie 解释说。

正如前文提及,我们这个时期对「AI 味」会有一种特定的风格定义。

今年超级碗上的一则广告就因为风格太过「AI 味」而遭吐槽,但这些摄影作品的确是人类摄影师拍摄的

这也意味着,只要跳出了那种风格,人们就不会觉得那「AI 味」有那么浓,即便那其实也是 AI 生成的图像。

数字营销公司 Media.Monks 今年就组了一队特别的艺术创作者:动画师、色彩专家、导演、摄影师等,特别之处在于他们不仅懂得 AI 图像生成技术,更是能够做出独特的视觉美学。

在这支团队协作下,Media.Monks 对 AI 提示词进行了非常精细化的设计,更充分地表达出想要艺术风格的色彩、灯光、饱和度、摄影角度和景深等等,最终生成出和一般「AI 味」相当不同的风格化图像。

制作公司 Tool 和广告公司奥美则直接打造了自己专门的设计系统,可以将服务品牌的过往物料用作素材,给系统转录出特定的参数,最后做出和品牌美学相符的生成图像。

奥美的首席转型官 Antonis Kocheilas 表示,这套方法下,AI 生成出「六个手指」这类情况会减少,但依旧无法完全避免。

我不认为生成「假人」是当下必须的。

Tool 制作总裁 Dustin Callif 说道。在他看来,用 AI 来生成超现实和更具幻想性质的图像会更合适。

Tool 做的 AI 生成图主题更超现实

「AI 味」为何不受待见?

我们对「AI 味」的厌恶,有时候不仅来自于风格审美上的疲惫,它也带着我们对背后隐喻的抵触。

有位读者曾写信给《连线》分享了一个有趣的故事:

我有一位艺术家朋友给我送了一幅 AI 生成的画作作为礼物。

我能看出她尝试将概念更个人化,装裱得也很精美,但我还是觉得自己被骗了。

在回信中,《连线》肯定了这位读者的感受,并指出模型生成的图像既「不要求任何金钱上的牺牲」,也不「需要任何真正的创意上的投入,除了写提示词以外」,它「缺乏你朋友创意头脑的独特印记」。

大白话来说,就是「没诚意」和「不真心」。

这种对「AI 味」的反感,甚至并不限于图像。

Y Combinator 联合创始人 Paul Graham 就曾在 X 上发帖吐槽,自己收到了一份「AI 味」过浓的邮件:邮件里单词「delve(钻研)」一词出现了很多次,而这也是 AI 语言模型很常用的词语。

在这帖子下,AI 公司 Akto 创始人 Ankita Gupta 也表示自己深有共鸣,她也开始看到那些「标志性 ChatGPT 词汇」就转头走人:

这些词语本身没有问题,但它们让人类语言变得更机械化了。

显然,这种情绪存在时间也不短了。毕竟,现在 GPT store 上写作类工具推荐里就有不少「Humanizer」,也就是让 AI 生成文字看起更不像 AI 文字的工具。

更夸张的是,现在甚至已经有公司将「100% 不用大语言模型」作为卖点来宣传。

这也算是一种终极的「去 AI 味」方法。

回到 AI 图像领域,「AI 味」让我们产生的反感还来自于它夺走了一种特别的情感 —— 敬畏感。

因为 AI 实在太「无所不能」,现在当我们看到一张从前会让你发出「大自然/世界真是太神奇了」的照片时,我们脑海里第一句冒出来的话却变成了 —— 「这是 AI 生成的吧」。

摄影师 Aytek Çetin 的作品现在常被怀疑是 AI 生成的图像

在这之前,社交媒体和短视频都已经将我们的「刺激阈值」拉得巨高,而 AI 影像技术则几乎快要把我们的头脑注满,让大部分事物都变得廉价和无聊。

然而,我们需要感受到惊喜和敬畏。

这是其中一种让我们之所以为人的根本感受。「Big Think」作者 Kevin Dickinson 在一篇从心理学角度探讨「敬畏感」的文章中解释:

(敬畏感)是一种过程 —— 人们在遇到新的体验或信息时,对自己的想法和信念开始进行重新评估。

换言之,当我们感受到敬畏感,人们会开始质疑其世界观并且有可能会走向改变。

自然的力量,或者人类成就的美好,这些事物会减少我们以自我为中心的影响,要求我们去重新审视我们对世界的理解以及我们在其中的位置。

这让人感到失落。

但我们并非未曾感受过这种失落。

Photoshop 和其他修图软件的普及,让「有图有真相」一说变得过时。

随着数字图像处理技术发展,人们开始恐慌,认为摄影已死。但那并不是真的。

媒介一直以来都有「被操控」,通常被用来制造复杂的「欺骗」。

研究艺术史和视觉文化的 Derek Conrad Murray 评论说。

随着 AI 技术的发展,「AI 味」会不断改变,很可能将变得越来越微妙和难以识别。

对于在这个全新的,充满不确定性的互联网世界中,《连线》作者 Jason Parham 的建议挺实在:

让我们拥抱被扭曲,接受生活在图像充满了欺骗性的无常中。

我们要保持勤勉,因为未来是一个持续理解和「去理解」,崩塌和重建的游乐场。

本文来自微信公众号“APPSO”(ID:appsolution),作者:方嘉文,36氪经授权发布。