话题 · 2025
「话题」栏目 2025 年汇总,共 47 期
第 379 期:《硅谷钢铁侠》摘录
最近,我读了一本十年前的马斯克传记《硅谷钢铁侠》(中信出版社,2016)。

按理说,这本书已经过时了,这十年马斯克发生太多事情了。
我是睡觉前随手拿起来,翻了几页,看得津津有味,就读完了。
这本是马斯克的授权传记,他本人亲自接受了采访,还挺有料的。而且,因为我已经知道后续的发展,所以读到十年前的采访,反而有更多启发。
他的人生确实传奇,白手起家,家里给的最大帮助就是从南非移民到加拿大,后面都是自己奋斗出来的。
他创立了 Paypal,然后把卖掉它的钱拿来又创办了三家公司:特斯拉、SpaceX 和 SolarCity。
这太疯狂了,他一个外行同时进入了三个不同的行业——电动汽车、宇宙航天和太阳能——这些行业都刚萌芽,没有任何个人创业成功的先例。
更疯狂的是,他居然把这三家公司都做成了,而且都做到了世界第一(SolarCity 后并入特斯拉),他也因此变成了世界首富,你说神奇不神奇。
读完全书,我的最大感受是,还是要动手做事,没准真能做成。想他人不敢想,做他人不敢做。即使最狂野的梦想,只要全心投入,用力去做,也是有可能成功的。
下面就是我的一点摘录。
(1)
特斯拉最艰难的时候,非常接近于破产倒闭。
马斯克对外宣传,特斯拉是一家汽车公司,但实际上,他们只是一群年轻人租了一间大厂房,更像是在捣鼓汽车的大型实验室。
(2)
马斯克非常不理解,为什么有人设计了车灯开关。
他说:“真是多此一举。天黑时车灯自动打开,就这么简单。”
(3)
特斯拉的第一版设计稿,因为设计师没想好门把手的形状,就没画上去。
没想到马斯克很喜欢这个没有门把手的车型,就决定门把手应该在有需要的时候自动弹出。

(4)
马斯克认为,未来会有人口危机,主张多生孩子。
他认真考虑了,怎么在特斯拉后排安装婴儿座椅。传统的车门设计,使得把婴儿座椅和小孩安置在后排非常不方便,所以特斯特的车门设计采用了“鹰翼门”。

(5)
特斯拉的第一款车型是跑车,但没有大量生产。真正大量生产的第一款车型是 Model S,最初的名字是 Model Sedan。
Sedan 这个词的意思就是轿车,用来跟跑车相区别。但是马斯克认为这个词太平淡了。英国人习惯称轿车为 Saloon,这听上一样不伦不类。最后,就索性只保留第一个字母,称为 Model S。
(6)
马斯克对员工的要求是,全情投入你的工作,并把事情搞定。
不要等待上级的指导和详细指示,也不要等待别人的反馈意见,你要主动想办法把工作完成。
(7)
他认为,一个人独立工作,是最佳的工作状态。
一个人不需要开会、不需要与谁达成共识,也不需要在项目中帮助其他人。你一个人就可以持续地工作、工作、再工作。
(8)
特斯拉员工最害怕的事情,就是向马斯克申请额外的时间或者经费。
你一定要事先做好详细准备,跟他解释为什么必须招更多的人,以及需要追加的时间和资金预算。如果有招聘目标,还要准备那个人的简历。
(9)
如果你一上来就告诉马斯克,某件事情做不了,他会马上把你轰出办公室,甚至可能当场解雇你。
在马斯克看来,某件事办不成的唯一原因,就是违背了基本的物理原理。但是即使这样,你也必须做足了功课,深入每一个技术环节,向他解释为什么行不通。
(10)
马斯克要求员工,项目没完成之前,周六和周日依然要努力工作,并睡在桌子底下。
有些人反对,表示员工也需要休息,有时间陪陪家人。
马斯克说:“我们破产之后,你们会有大量时间陪家人。”
(11)
马斯克有自己计算时间价值的方法。他预期10年后,公司的日营收可以达到1000万美元,所以进度每拖延一天,就相当于多损失1000万美元。
(12)
马斯克的根本想法是改变这个世界,他总是喜欢谈论人类的生存问题。
早在他开始创业的时候,就已经得出了结论,那就是生命是短暂的。如果你真的意识到这一点,你就会知道,活着的时候工作越努力越好。
第 378 期:预测是新的互联网热点
大家大概想不到,美国互联网的热点,现在不是 AI 网站,而是一种全新的网站,叫做“预测市场”(prediction market)。
这类网站像雨后春笋一样,每天都在冒出来。最有名的预测市场,目前是 PolyMarket。

预测市场的用途,就是预测各种各样的事情。以 PolyMarket 为例,首页顶部就是各种预测的分类。

热门事件、突发事件、最新预测、政治、体育……
只要是你能想到的事情,它都提供预测。

以上周末为例,首页热门预测如下(上图)。
- 《时代》杂志的年度人物是谁?
- 《时代》杂志年度人物名单会泄露吗?
- 美联储一月份的决定是什么?
- OpenAI 下一次的大模型发布是哪一天?
你随便选一个,点进去就能看到,各种情况的概率。

上图预测的是,2025年12月5日至12日期间,马斯克会发多少条推文。
可以看到,概率最高的情况是440条~450条,概率33%,概率最低的情况是400条~419条,概率1%。
正是因为对于几乎任何问题,它都有实时的详细预测,美国人现在已经不怎么看民调了,改成看这种预测网站了。因为民调的抽样方法和样本大小,总是有局限的,反而是预测网站更反映市场的真实看法。
你可能会问,这些预测结果怎么产生?如何确保准确?
答案很简单,结果来自于用户的下注。
你看好哪一种情况,就可以对它下注。看好的人多,这种情况对应的概率就会上升,反之下降。
实质上,它的每一个预测都是一支股票,股价就是它的概率,1%的概率就是股价0.01元,100%的概率就是股价1元。
举例来说,某种情况的当前概率是2%,那么相当于0.02元。你看好这种情况,假定就花了100元买入。
结果,正如你的预测,它变成了现实,概率上升为100%,价格就变成了1元,相比你的买入价,整整上涨了50倍。于是,你投入的100元就变成了5000元。
反之,你预测错了,这个结果没有实现,概率变为0%,也就是0元,你投入的100元将一分都收不回来。
最近,美国的一条热门新闻就是,一个男子在 PolyMarket 上,对一个2%的小概率事件投入3000美元。结果,预测准确,他收回了12.5万美元。

为了方便世界各地的人参与,也是为了保证匿名,这种预测网站都采用稳定币交易。
所以,它的本质就是一个巨大的彩票市场,允许用户买卖自己最感兴趣、最熟悉的事件,这是它快速流行起来的根本原因。参与的人多了以后,反过来提高了预测的准确性。
我觉得,它的前景不可限量,一定会火爆的井喷式发展,传统彩票可能会被它彻底淘汰。
它把任何不确定的事情,都变成了彩票,实时量化了每一种可能性的概率,并且提供了金钱翻倍的途径。这一方面很有参考价值,可以用来判断未来情况,另一方面也非常有娱乐性和刺激性。
第 377 期:14万美元的贫困线
一个人需要多少钱,才能摆脱贫困?

我看到一篇美国人的文章,作者说,美国政府规定的贫困线是,四口之家的年收入不足3.12万美元。
根据统计,美国四口之家的年收入中位数是8万美元,远超贫困线。按照这个标准,贫困的美国家庭应该不多,8万美元可以让一家人过上“中产阶级的生活,或许还算舒适”。
但是,事实却是,这点钱在美国会过得手头很紧,根本不够一家人的开销,你经常会烦恼钱不够用。
作者就问了,美国的贫困线为什么是3.12万美元?真正的贫困线应该是多少?
他发现,贫困线的计算方法,来自1963年的一次调查。调查发现,美国家庭那时收入的三分之一用于食品,政府就把食品的最低开销乘以3,得到了贫困线,沿用至今。
2025年,美国四口之家一年最低的食品开销是1万美元,乘以3就得到了贫困线3.12万美元。
但是,半个多世纪过去了,家庭的消费结构和物价彻底变了。
现在,家庭的食品支出不是三分之一,对大多数家庭来说,大概仅为5%至7%。家庭支出的大头变成了住房、教育、医疗,其中住房占支出的35%至45%,医疗占15%至25%,子女教育占20%至40%。
所以,如果要覆盖基本开销,总支出不再是食品支出乘以3,而是乘以13到15。
这样计算的话,美国四口之家的贫困线应该在14万美元左右。只有年收入达到这个数字,才足以覆盖一家人的基本开销。
这很惊人,14万美元约等于100万人民币,这样的家庭收入在美国还是存不下钱。
这就是为什么,你的收入看上去不低,却总感觉钱不够用的原因,因为实际的贫困线比名义的贫困线,高出非常多。
我觉得,这篇文章的最大价值在于提供了一种方法,估算收入应该是多少,才能免于贫困。
具体来说,真实贫困线就是食品开支乘以它所占比例的倒数。
假定你的食品开支是每天30元,每年1万元左右,占总支出的十分之一,那么你的年收入如果低于1万元乘以10(即不足10万元),你就还是属于贫困阶段。
第 376 期:太空数据中心的争议
AI 大发展,数据中心不够用了,建造和运营成本飞涨。
越来越多的人提出,数据中心可以建在太空。

先是马斯克说,SpaceX 公司考虑在地球轨道上,建造数据中心。

然后本周,北京市科委、中关村科学城管委会发布了《太空数据中心建设规划方案》。

目标是“在距地面700公里的轨道上,建设可容纳百万卡集群的数据中心,开展天基数据中继传输和计算服务”。

根据报道,专家认为太空数据中心“势在必行”(上图)。
(1)高轨太空数据中心可 7×24 小时使用高强度太阳能,且不受大气影响,发电效率可达95%。
(2)深空温度约为-270度,只需部署导热材料即可完成散热,无需部署大量液冷结构,成本优势显著。
我觉得,这是两个很大的优势,太空数据中心确实应该尽快建设。
但是,我紧接着又看到了一篇文章。

作者是美国宇航局的资深工程师,曾经参与设计卫星。
他根据国际空间站的经验,认为现阶段技术制约太大,太空数据中心很难实现。真要建设的话,花费巨大,收益有限。
这可是我第一次看到,有人认真地质疑这件事。我不具备这方面的专业知识,不知道他的计算对不对,再说国际空间站完成于25年前,现在的技术早就超越了那时。
我把他的几点质疑分享出来,大家看看太空数据中心有没有前景。
(1)能源问题
太空能源主要来自太阳能。迄今为止最大的太空太阳能板就在国际空间站,峰值功率200千瓦以上,但是面积巨大,约为2500平方米,超过半个美式橄榄球场。
英伟达的 H200 显卡功耗约为 0.7kW,实际运行可能需要 1kW 的电源。国际空间站的太阳能板只够供电200个 H200。
作为比较,OpenAI 即将在挪威建设的数据中心计划容纳10万个 GPU,每个的功耗可能都比 H200 更高。
(2)散热问题
太空很冷,接近绝对零度,初看上去散热应该很容易。但是事实是,散热只有两种方式:要么通过介质散热,要么通过辐射散热。
太空没有空气,接近真空,根本没有介质,无法使用空气对流来散热,所以 GPU 的散热片和风扇不起作用。
唯一可用的是液冷,通过液体将热量传递到散热板,再辐射到太空(散热板必须放置在远离太阳的一面)。
国际空间站就采用辐射散热。它的散热系统非常复杂,散热上限为 16kW,大约相当于16个 H200,略多于一个地面服务器机架的四分之一。
国际空间站的散热板尺寸为13.6米×3.12米,即大约42.5平方米。如果要为200个 H200 散热,面积需要扩大12.5倍,即大约531平方米。这个面积是同样功率太阳能板的2.6倍。
这样一来,太空数据中心将变得非常庞大,远超国际空间站,而容量只相当于地面的三个标准机架。
(3)粒子射线问题
太空有各种高速粒子,由于没有大气层保护,它们可以直接撞击芯片材料造成损伤。最常见的后果是单粒子翻转(SEU),即粒子直接撞击晶体管,导致某个比特翻转。
太空数据中心必须长期运行,还存在总剂量效应,即反复的粒子撞击导致晶体管开关速度变慢,进而停止工作。
所以需要有一个屏蔽层,但是最强的宇宙射线可以穿透惊人厚度的铅层。而且受限于飞船的运送能力,太空中不可能部署很厚的屏蔽层。
为了增加 GPU 和内存的抗辐射能力,有必要为太空环境重新设计芯片,增加容错性能。但是,这样的芯片性能将远不及目前地球上的 GPU。
(4)通讯问题
大多数卫星通过无线电与地面通信,速率超过 1Gbps 都很困难。虽然有一些激光方案可以提高带宽,但需要良好的大气条件才能实现。
相比之下,地球上的数据中心之间的通讯,最低速率也能达到 100Gbps。
第 375 期:一扇门的 Bug
最离奇的软件 Bug,你听说过哪些?
下面这个是我本周看到,绝对可以排进史上前十名。
我把它译出来,跟大家分享,以下是第一人称的叙述:

2013年,我在 Valve 公司从事游戏开发。

当时,第一代虚拟现实 VR 头盔 Oculus DK1 刚刚发售。公司决定为这款头盔移植游戏,让我来移植,搞清楚 VR 的游戏环境。

我就选了2004年我们公司开发的《半条命2》来移植。

移植了一个片段后,我们发现实际效果很好,就决定移植整个游戏,并且发布了发售预告。
移植过程中,我试玩了很多片段,但没有从头到尾玩一次。
等到移植完成,就在发售前夕,我决定完整玩一次,如果发现有什么问题,就写在发布说明里面。
我心想,应该不会有大问题,毕竟这个游戏已经发售10年了,无数人玩过,反响良好。
但是,万万没有想到,我居然遇到了一个重大 Bug。

游戏的开头部分,玩家来到火车站,一个守卫让你进去一个房间。很奇怪,房间的门是关着的,你进不去,就……卡住了。
你没死,就是哪儿也去不了。前面的门关着,你进不去,也退不出去,身后的大门已经关上了。你被困在一个走廊里,旁边有个守卫,无路可走。真是奇怪。
游戏的剧情是,你必须进入这个房间,才能往下玩。你又去找守卫,他指着锁着的门,仅此而已,你被困住了。
我上网查了视频,心想自己是不是记错了。没错,门应该是自动打开的,你走进去就行了,但是……现在这扇门却关了!

我心想完蛋了,这游戏没法发布了。
我赶忙联系了其他人,包括一些十年前参与这个游戏开发的人。他们测试后,都说确实有问题,而且在非 VR 模式下也一样,门也是关着的,所以肯定不是我移植弄坏的。但没人知道原因,因为代码根本没改过。
有人甚至追溯到游戏的原始源代码,编译了最初发售时的游戏版本——结果发现,那个原始版本也坏了,门也是关着的。
这怎么可能?大家慌了,这意味着这个 Bug 十年前就存在,但当年编译为什么没出现,十年后重新编译就出现了,这到底什么回事?
在花了大约一天时间,重新使用当年的调试和回放工具之后,一位同事弄明白了哪里出了问题。
如果仔细观看游戏,你会发现这扇门有一瞬间,其实自动解锁并打开了,但是房间里还有第二个守卫站在门后。这个守卫站得离门非常近,门打开的一瞬间会轻轻碰到守卫的脚趾,然后又弹回,重新关上,并自动上锁。由于游戏没有考虑怎么处理这种情况并重新打开门,所以游戏就卡住,你无法前进了。

一旦弄明白怎么回事,解决方法就很简单。我们把守卫往后移大约一毫米,门就很顺利自动打开了。
现在我们可以发布游戏了。但是,问题还是没有彻底解决。为什么这个游戏当初没有出现这个 Bug,原版里守卫的脚趾也挡着门啊?为什么十年后重新编译,Bug 就出现呢?或者说,Bug 其实一直都在,为什么十年前这扇门没有关上呢?
于是,一场旷日持久的漏洞搜寻就此展开。
我们终于发现了答案,就是老生常谈的浮点运算。
《半条命2》于2004年发布,当时编译用的是较旧的8087或 x87 数学指令集。这些指令集的浮点数精度五花八门,有些是32位,有些是64位,有些是80位,不同的代码段使用了不同的精度。
十年后的2013年,SSE 指令集已经成为所有 x86 CPU 的标准配置,编译器默认使用 SSE,它有明确的精度,根据代码需求使用32位或64位,是可以预测的。
真相就是,十年前编译用了32位精度,现在用了64位,小数点的差异造成了几毫米的误差,让守卫的脚趾碰到了门。
好了,现在玩家终于可以走进大门,继续玩下去了。

第 374 期:6GHz 的问题
本周的新闻,欧洲做出决定,6GHz 怎么分配。

欧洲把 6GHz 一分为二,较低的频段给 WiFi 使用,较高的频段留给手机通信。
这跟美国和中国都不一样,美国把整个 6GHz 分配给 WiFi,中国则是全部分配给手机通信。
我来说说,对于这个新闻的感想。

对于不了解的朋友,我先说说 6GHz 是怎么回事。
家庭的无线局域网(WiFi)只能使用固定频率的信号。最早的频率是 2.4GHz,所有设备都用这个频率,就造成了信道拥挤、信号不稳定。
后来,增加了 5GHz。但是这个频率现在也不太够用,在大城市的高层住宅,打开手机,能搜到几十个无线网络。那么多设备都用这个频率,通信就很拥挤了。

大家就想到,再给 WiFi 增加一个频段,目光就瞄准了 6GHz。这个频段还没有指定用途。
如果 6GHz 用作 WiFi,最大的好处就是不会发生拥堵。因为它的波长短,所以穿墙能力差,实际上不能穿墙。也就是说,你在屋里只能连上你自己的 6GHz 信号,别处的信号传不进来。
而且,它的带宽大,网速更快,可以打造高速 WiFi,适合 VR 头盔这类吃带宽的设备。
但是,问题就来了,6GHz 除了用作 WiFi,还可以用作手机通信。手机通信的频段能够供大量人群同时使用,比只供一家人使用的 WiFi,频段利用效率更高,公共效益更大。
前面说了,中国的决定是,整个 6GHz 都留给手机通信,也就是说 WiFi 不能使用这个频段。
所以,有些追求高网速的国内用户,就会去买国外的无线路由器,以及支持 6GHz 的硬件(比如苹果设备),实现家庭的高速 WiFi。

我的想法是,WiFi 只有 2.4GHz 和 5GHz 确实不太够,如果能增加一个高速频段就很好,不仅满足大带宽通信,还能促进设备升级,带动消费。
6GHz 的完整频段是 5925MHz 到 7125MHz,听过国内明确留给手机通信的是 6425MHz 到 7125MHz 这一段,至于剩下的 5925Mhz 到 6425MHz 怎么分配还没明文规定(参见百度百科)。
如果是真的,是否可以考虑放出 5925Mhz 到 6425MHz 这一段,就像美国的规定,任何人无需许可就能使用这个频率。这样的话,个人和企业就有了一个可以自由使用的高速通信频率,为更多的创新创造条件。
第 373 期:数据模型是新产品的核心
(1)
著名计算机学家、Pascal 语言之父沃斯说过一句著名的话。
算法 + 数据结构 = 程序
他甚至写了一本书,书名就是这句话。

在他看来,数据结构跟算法一样,是最重要的事情,反倒是编程语言不怎么重要。
如果数据结构不对,程序十有八九会有问题;反之,数据结构对了,解法往往很容易看出来。
(2)
我前些天看到一篇文章,也是这个观点,甚至更进一步提出,数据模型不仅是程序的核心,也是新产品的核心。
他认为,数据结构决定了产品的形态,只要改变一下数据模型,往往就是一种新产品。
文章举了很多例子,非常有启发,我跟大家分享。
(3)
最初的聊天软件,都是以人为中心,两人或两人以上组成一个聊天。

它的数据模型就是围绕人建模,要是成员全部退出,聊天就结束。
后来,新的群聊软件 Slack 诞生了。

它的数据模型变了,核心不是人,而是话题。一个话题就是一个容器,所有相关的聊天都在里面,又叫做频道(channel)。

即使成员全部退出,没人聊天了,频道依然存在,话题的完整上下文也不会消失。新成员加入后,可以看到以前的所有讨论。
由于这个特点,Slack 特别受企业欢迎,是目前公司内网工作聊天软件的首选。
你看,就因为 Slack 的数据模型变了,哪怕其他都没变,它就成了一个全然不同的产品,杀出了聊天软件的重围,在企业市场大放异彩。
(4)
再看两个例子。Notion 和谷歌文档都是文档软件,都用来写文档,但是它们的数据模型不一样。
谷歌文档就是传统模型,以单篇文档为中心。

Notion 模型的核心其实不是文档,而是页面。一个页面就是一个容器,你可以组合多篇文档,呈现在一起。

Figma 和 Photoshop 都是设计软件。
PhotoShop 模型的核心是图像,所有编辑都归属于某张图像。

Figma 模型的核心,我觉得,是工作区。一个设计稿就是一个工作区,里面可以有多张图像,其他人可以参与进来,留言讨论。

(5)
总之,数据模型稍作变化,就会产生一种新产品。它跟现有的产品有区别,从而能够打开新的市场。
这启发我们,如果你的产品跟别人雷同,那么不妨思考一下,能否改变数据模型。
第 372 期:软件界面如何设计
(1)
软件的用户界面(UI)是一门大学问。有一个行业专门研究它,就叫做“UI 设计”。

我觉得,很多写软件的程序员,对 UI 设计毫无感觉,不知道什么样的界面好用又美观。
他们自己搞的图形界面,只要把所有功能都堆积在界面上,就觉得完成了,也不管用户是否搞得明白。
这种例子很多,我举一个刚刚看到的。
(2)
有一个很有名的软件 Handbrake,可以转换视频格式。

它的功能非常强大,几乎所有视频格式都能识别,各种需求都能满足,而且免费、支持多平台。
但是,当你打开这个软件,看见界面的那一刻,顿时会产生一种畏惧感,除非你是高级用户。

上图就是它的主界面,各种设置一个接一个,布满了让外行摸不着头脑的文字说明。
如果用户不是专家,就会想:我该从哪里入手?会不会点错?如果去看教程,是否要花很多时间?
那些坚持不放弃的用户,也许接着会去打开“设置”菜单,想寻找一点提示,却遭受了更绝望的一击。

这个密密麻麻、充满术语的界面,会让你感到自己水平太低,够不上它的使用门槛。
你看,用户只是想找个小工具,转换一下视频格式,结果却被工具提示“你的能力不足”。
这就是糟糕的界面,不仅难用,还打击人。
(3)
一个老外程序员实在看不下去了,大众软件的界面有必要做成这个样子吗?
他自己动手做了一个新的 UI。

是不是一下子顺眼了?
这个界面一看就懂,完全没有心理负担。唯一的操作,就是上传视频,不可能搞错,因为其他地方都没法操作,只有当你添加文件后,唯一的按钮才可以点击。
你能相信吗,这个界面和上个界面,是同一个软件,做同样的事情?
这就是优秀 UI 设计的奥秘:避免多个操作入口,避免让用户做选择,所有设置尽量提供默认值。这样才不会让人迷惑,可以一路回车。
肯定有很多高级用户不赞同,提出一大堆置疑。
- 为什么要放弃 Handbrake 的强大功能?
- 如果有人想要不同的设置呢?
- 你考虑过特殊需求和极端情况吗?
解决方法很简单,就是再做一个专业版界面,也许就是 Handbrake 现在的样子。用户想要更多功能和个性化设置,那就自行切换。
(4)
很多生活用品也是类似的情况,有着一个复杂的界面。
就拿电视遥控器来说,布满了按钮,有必要吗?

以至于有人就把不需要的按钮,用胶布贴起来。

其实,贴了胶布以后,才是电视遥控器该有的界面!只留下那些必需的按钮。
大多数人用不到的按钮,完全可以藏在一个滑盖下面,让那些确实有需要的人,自己打开盖子去找。
第 371 期:一个乐观主义者的专访
(1)
凯文·凯利(Kevin Kelly,简称 KK,1952-)是著名的作家和未来学家,曾经出版过《失控》等多本畅销书,在国内有很高的知名度。

老爷子今年73岁,依然充满了活力,个人网站 kk.org(下图)几乎每周更新。

如果仔细看首页,你还会发现顶部有一行字。

这行字写着:
长期中,未来由乐观主义者决定。
这句话概括了他的信念:要乐观,要看好未来。因为乐观主义者会动手做事,而世界是由动手去做的人决定的。
这让我想到了另一句话“悲观者正确,乐观者成功”。
它的意思也类似。悲观者看不到希望,就不去做事了,所以什么也不会改变,悲观预言就成真了;乐观者愿意做事,做了才有可能成功,所以成功属于乐观者。
这就像古人说的:行者常至,为者常成。
(2)
凯文·凯利在美国加州的乡下有一间工作室,平时在那里工作。
一本美国杂志最近派出记者,对他进行专访。记者按着地址找到工作室,都惊了,简直身处童话之中。
“这是瓦莱玛镇外围公路边最后一栋房子,一座巨大的谷仓式建筑,背后就是一座陡峭的山坡,山坡上长满了野花和参天大树。天气阴沉,弥漫着海洋和桉树的气味。我看到门上挂着一块小小的招牌‘kk.org’,才知道没有找错地方。”
记者走进工作室,眼睛都瞪大了,屋里跟 KK 本人一样奇妙。

门边是一个一直到屋顶的落地书架,放满了各种各样的书,还有一个铁架子,让你可以爬到书架的上层。

另一面墙前面,则是一个多层的置物架,堆满了奇奇怪怪的小玩意。

这些东西全是 KK 从世界各地搜罗来的,比如蒙古老鹰的皮帽、小鸟的骨架等等。

他让记者试着举起地板上的一个小球,这个球非常重,记者根本举不起来。他告诉记者,这是钨做的球,密度跟黄金差不多。所以,电影里罪犯抢了一袋黄金撒腿就跑,这是根本不可能的,你走路都困难,怎么可能跑呢。

这些东西和装饰反映了 KK 的个性:他喜欢新奇有创意的东西。
记者问道,工作室里最古老的物品是什么,他立刻转移了话题。这位未来学家对怀旧和过去毫无兴趣。
(3)
记者问,你人生中喜欢这么多东西,做过很多项目,但是都没有做大,也没有加入独角兽公司,你怎么想?
KK 回答,我只是追随自己的兴趣,不管什么事情,只要我觉得有意思,就想去做。我不追求目的地,我追求的是内心的方向。
其实也不是刻意追求,只要你做自己感兴趣的事情,内心会自动推着你往下走。而且,遇到失败时,你能忍受下来,因为那是你喜欢的事情,你明确地感受到,只要坚持下去,以后会得到更多(内心的)补偿。

我做的项目,并非出于我想战胜别人或者战胜世界,而是出于我满足了内心的好奇心或者实现了创意。
回顾一生,我没有创造伟大事业,也没有创造出股东价值,但是我得到了内心的满足感,而且不是以自我放纵的方式。我以一种充满快乐、活力,没有焦虑、痛苦,也没有自负的方式,度过了人生。
第 370 期:正确的代码高亮
程序员一般都使用代码高亮,就是代码有不同的颜色(下图),方便阅读。

问题就来了,什么样的颜色组合,最适合阅读代码?
大多数的人大概跟我一样,就挑自己觉得好看的。比如下图五颜六色的,我觉得很悦目。

不久前,我读到一篇文章,作者说:错了,好看的颜色未必适合阅读代码。
正确的代码高亮,应该让你一眼注意到最重要的代码信息。太多的颜色,只会让人眼花缭乱,找不到重点。
他提出代码高亮的五条原则。
(1)最多使用4种颜色,再多的颜色会分散注意力。
(2)变量、函数和类的定义最重要,一般来说,它们是代码的最关键部分,所以定义时的变量名、函数名、类名应该高亮显示。
(3)注释也很重要,往往是关键信息,或者是作者希望别人阅读的信息,所以要高亮显示。很多配色方案将注释变灰,这是不对的。
(4)常量和函数嵌套(即括号)也是重要信息,需要高亮显示。
(5)其他代码不必高亮,包括变量读取、函数调用、关键字(class、function、if、else 等等),因为它们无所不在,你很少会去寻找它们。
这五条原则,你认同吗?
如果认同的话,你可以试试看作者设计的配色方案 Alabaster。
下面就是这个方案的高亮效果。

作为对比,再看看前面那个“好看”配色的高亮效果。

你觉得,哪一种效果好,是否突出了代码的关键信息?
第 369 期:Tim 与罗永浩的对谈
10月10日,罗永浩的新节目《罗永浩的十字路口》,邀请了嘉宾“影视飓风”创始人 Tim(潘天鸿)。

他们进行了一场对谈,Tim 从头部 UP 主的角度,分享自己对视频行业怎么看,有意思的内容非常多。
他们谈了三个小时,谈得非常深入尽兴,整理成文字稿有六、七万字。想看全文的同学,自己网上找,也可以下载字幕文件或者 AI 转录。
下面是我的摘录,尽量囊括那些我觉得有意思的点。下面主要是 Tim 的叙述,也包括一些罗永浩的话,出于篇幅和阅读流畅性的考虑,就不一一注明了。
一、短视频的流行,导致了表达极端化
1、
短视频的传播能力比长视频强很多。
人的本性就是追求更高的信息密度,更容易接受短视频。但是只追求传播能力,最终就是博眼球,表达就会极端化。
这两年我们最明显的一个变化就是,做视频封面也只能跟着极端起来,不然别人根本不会点进来。那我直接输给营销号了,我都不用看里面内容,我就输给他了。那怎么办?
标题党这件事儿变得史无前例的重要。
2、
这两年视频的响度比十年前响了超级多。所有人都在偷偷把音量往上拉一点,音乐再往上拉一点。所以导致所有视频平台大家都在比谁叫得更响,这个响度比10年前要响了很多很多。
所有的平台都在疯狂的竞争电平(音量),因为你第一秒就要让他感受刺激。
3、
现在手机有 HDR,就是屏幕变亮的这个功能,本来是为了看视频体验更好,但现在所有的广告都开始用,HDR 会特别亮。
有一瞬间你会感觉你刷到朋友圈里面某个东西会特别亮,或者看到一个平台上面特别亮。这是因为厂商开始用 HDR 广告抢你的注意力。
我的手机亮度本来是合理的,偶尔刷到一个 HDR 片子的时候,闪光让眼睛就特别疼。但是这件事可能会导致大家都使劲 HDR,该上不该上都上,最后就全是刺激眼睛的东西。
4、
还有一个例子,摇一摇跳转广告,这我觉得超级逆天。张衡都不用发明地动仪了,我在桌上放8台手机,哪边打开广告了,哪边地震。
这就是网络的表达极端化的结果。因为博眼球的一方最终会胜利,所以各方都想尽一切办法赶上。
二、互联网的平民化和碎片化
5、
在五年以前,我认为互联网在乎精英式表达,就是特别漂亮的置景,以及你讲话要侃侃而谈,给人一种精英高高在上的感觉。
但是这两年,我明显感觉做内容你必须要接地气的平视化表达。就比如说,拍 vlog 我就是直接拿着相机拍我自己,大家已经开始拒绝精英式高密度表达,接受平视的表达。
6、
互联网起来之后,越来越产生了大量的碎片化内容。以前是有碎片化,也有大部头的内容,但现在读者越来越满足于那种即时的兴奋。
现在超短的视频火到大家可以一晚上刷6个小时,我也有一点不安的感觉。年轻一代如果只看这些,会不会真的变笨?
7、
全社会包括精英阶层,都已经沦陷于那些不停地追求短时间的刺激和爽感的短视频了。
不只是中国,全世界都是这样。以前咱们老说那些霸道总裁的爽文爽剧,好像就是在中国没受过文化的阶层特别喜欢。后来发现杀到全球都管用,中国做这些内容的杀到全球都管用。美国人太喜欢了。
三、如何对待商单
8、
我们的核心收入是给汽车厂商、游戏厂商、手机厂商拍样片,这个钱我们都很乐意赚,这个是最赚钱最稳定的。
9、
汽车手机数码这种自媒体,你会发现超级难站着挣钱。因为你是观点的输出者,观众是来看你评测、看你来讲这个东西好不好的。但其实厂商只想你讲好的。
当然你一开始可以保持中立,优缺点都讲,直到有一天厂商拿一笔大的预算来找你。
我们跟厂商有合作。我们评测本身确实不收钱,但是现在有的时候是厂商雇我们去拍样片,跟我们拍样片时,他会问你能不能出个评测,这个时候会稍微有点难办,这是我们最近遇到的一个难题。评测必须好的坏的都说,但是你只要说一句坏的,厂商就不愿意给钱了。
但是因为我们体量已经相对比较大了,影响力大,我们可以讲坏的。但就是你会有点意识到,他其实并不是真的想找你拍那个样片,他就想要你这个评测,他想要你这个曝光。这就拧巴了,其实我们已经算是比较好的,我们尽可能羊毛不出在羊身上。
10、
如果你的内容做得足够精彩和有足够多看的人,你完全拒绝这类合作也是可以的。但现在绝大多数自媒体做不到。
怎么抵得住这个诱惑吗?你做得足够精彩,足够多的人看了,对面的价码也在不断加。他说我给你一千万,你接不接嘛?
四、自媒体如何赚钱
11、
中国的 SaaS 太难做了,SaaS 就是订阅制,这个东西特别难做。
我们这个时代,就是用户不愿意为内容付费,你必须得想办法。
12、
内容行业的最大问题是没有规模效应,你为别人出一期内容,收一笔钱,就算赚得多,它是没有规模效应的。每一期都要给厂商想个新的创意,这是个巨累无比的事情。
怎么样实现规模效应呢?我们最终的答案是衣服。我现在身上穿的衣服就是我们的自有品牌。
我们的T恤今年能卖到几十万到上百万件,已经超过大部分服装厂商了。今年单款可能到20万件,但是我们品类很多,所以这是我们今年跑出来的一条路。
我发现电商可以靠规模效应,因为电商最重要是获客,这个我们有优势。
13、
美国的野兽先生做巧克力,我去了他那边看了以后,意识到真的可以奏效。他们巧克力能卖到人民币百亿一年。
现在去线下任何一个国外的超市,你只要走进去,你会看到他的巧克力摆在最前面。我吃过,挺好吃的。
重点是在于他的获客成本会比别家低很多很多,而且溢价也多一点。
14、
我们发现做硬件特别难。我们做过硬件,得出的结论就是,只要有电源的东西都得很小心。
只要有电源,你会发现品控、东西复杂度就迅速上去了,然后利润也保证不了。
五、Tim 的目标
15、
我们确实没有融资。很多人给我们开过很高的价码,有特别大的平台给我们特别高的价码,就是一亿往上很多的这种。
我觉得,内容公司的扩张,钱没有太大帮助。你拿了钱,就是相当于把你同事一起卖了,然后换了钱。
你可以用钱收购一堆团队,但是内容不是越多人就越好。最终你只是一个提款机,给投资人打款,帮他接商务推广而已。
16、
我把长视频和短视频当作 X 轴,把专业观众和大众观众当作 Y 轴,这样就有四个象限。我的目标是每个象限都有一个对应的账号,把这四个象限全部都吃透。
17、
我们现在的利润状况挺好的,现金流还是非常正的,整体运营都还是挺稳定的,也不用融资。
我其实想探索自媒体的上限,就是我有点想探索这个点。假如我做服装我能做到多大?假如我做商业型的内容或者广告,我们最高能报到多少?
全世界最成功的视频作者就是野兽先生,他们一年的收入是百亿人民币级别。
六、视频的选题和指标
18、
赚钱就赚钱,播放量就播放量,这两个必须分开。你要做爆款内容,就别想做商单,你要做商单,就不要经常去想做爆款内容。这两个结合的确实有,但是很少能够做到,容易两头不讨好,内耗折磨自己。
19、
我觉得,自媒体最大的修炼的点是大众情绪感知。你必须能感知大众的情绪,才可以获得增长,这很难。
我们的选题,必须是有高受众的内容。
20、
短视频的5秒留存最重要,只要一个人看不到5秒,这个作品就废了。
长视频最重要的是三个指标。(1)CTR(基础点入率)就是看到你封面的人,有多少会进来;(2)AVD(平均用户观看时长)就是观众平均能停留多久;(3)平均播放百分比,就是观众平均看到百分之几走了。这几个指标能够维持住的话,内容就是好的。
21、
我一直有个理念,就是短视频已经证明比长视频的受众更大,然后有什么东西能比短视频更好呢?我认为就是把短视频拼成长视频的短视频合集。
比如说,车祸视频有很多人喜欢看,但是车祸集锦视频看的人更多,因为它不需要有滑动的这个操作。
人是越来越懒的。短视频需要划动,但整理好的短视频合集就不需要划。每个话题都是你感兴趣的,那当然是更优质的一个存在,所以这个内容形态是更领先的。
短视频拼成一个长视频,你预测到观众会对下一个短视频感兴趣,所以你把它拼起来,变成一个长视频。以前长视频是花很长时间讲一件事,现在长视频是不断转场给你讲八件事。
七、AI 的冲击
22、
AI 这玩意儿,你会渐渐发现一个很恐怖的事情,就是你的努力,以前的努力,十年的努力,其实在 AI 面前配不上,你变得没有价值,你的努力变得没有价值。
AI 打破了一个最核心的点,就是努力有回报,现在没有回报了。它是全知全能的,你的学习能力都比不过它的模型进化的速度。
我觉得大家现在还坚持说,我手做的比 AI 做的好,那和以前老妈说洗衣机洗的没有手洗的干净,不是一样的吗?那不是笨蛋吗?
23、
AI 大面积的落地,最多就是两年里面的事情。
我们的工作流里,AI 会先替代的岗位是调研和制图,制图就是做视频封面,已经不怎么需要人了。自动化拍摄目前还有点距离,但也不是很远,AI 生成电商图那些也很成熟了。
AI 剪辑也可以,剪了十年的非常优秀剪辑师,AI 绝对能在两年内替代掉。
我觉得,内部推动学习使用 AI,强调是没用的,主要靠员工的个人意识,不懂的人就是不懂,懂的人就已经疯狂在用了。我们公司5%的人已经懂了,还有95%的人没有意识到这个恐怖性。
24、
我主要使用 ChatGPT,用于文稿的校验和真实性核查,AI 的真实性核查比人好多了。生成类 AI 我不怎么用。
我在疯狂学 AI,一直在看,哪怕没有亲自上手,我也是全行业的 AI 都在了解。
25、
我们这行的从业人员在 AI 时代最核心的竞争力,还是真实性的记录,就是讲故事的能力,AI 长时间连续性还是差一点。
创意是绝对不安全的,这是我的观点。不在于你的创意好不好,而在于有这么多人现在加入了这个战场,你怎么确定你的创意是安全的?
我觉得最安全的是人生经历,AI 对你的信息收集是不完整的,这个时候你就具有独立性。
第 368 期:不要这样管理软件团队
我读到一篇文章,讨论软件团队怎么管理,写得很好。
文章举了 IT 公司常见的六种管理,看得我心有戚戚焉,分享给大家。
作者说,下面这些做法都属于低级管理,是经理人级别(manager),最好提升到领导者级别(leader)的高级管理。

(1)发生事故时,严厉追责,惩罚员工
假如项目出现问题,客户怒不可遏,团队充满矛盾,这时低级管理的经理人立即开始追责,召开紧急会议,要“查明真相”,还会发送一封口吻严厉、措辞简洁的电子邮件,阐明“员工责任和公司期望”。
真正的领导者则会召集团队,跟大家说:“现在很困难,但不是互相责怪的时候,而要同舟共济,我们一起想办法解决这个问题。”
(2)囤积信息
很多经理把信息当成机密情报,把关键细节藏得严严实实,以为这样就能赋予他们权力或控制权。给人的感觉是他们在管理一个秘密俱乐部,而你不在成员名单上。
真正的领导者恰恰相反,他们直接告诉大家,什么事我知道,什么事我不知道,什么事我在乎。因为他知道,信任建立在透明之上,而不是保密之上。
(3)政策武器化
低级管理的管理者会逐字逐句地引用手册,将政策作为挡箭牌,避免艰难的决策或令人不快的对话。
真正的领导者将政策视为保护人的护栏,而不是束缚人的手铐,一旦有必要,可以为人改变规则。如果团队成员遇到困难,他会当面询问:“我怎样才能帮到你,即使这意味着要打破规定?”
(4)快速解雇员工
低级管理的管理者喜欢“慢慢招人,快速解雇”。他可能会对你说:“你没有达到预期。今天是你最后一天了。”他的目的是杀鸡儆猴。
真正的领导者不会在员工离职时摧毁他们的信心,而是帮助他们搭建通往未来生活的桥梁。他会说:“我注意到你工作很艰难,我们来谈谈哪些方面出了问题。如果这里不合适你,我们看看怎么帮助你在其他地方上岗。”
(5)回避艰难对话
一位经理注意到两位团队成员的关系紧张,但却什么也没说,心里希望事情能尽快过去。遇到困难的谈话,他会粉饰、回避或躲在电子邮件后面,以避免尴尬。
真正的领导者会积极应对,和双方一起坐下来,说:“你们发生了什么,我们谈谈吧。”他明白,回避只会让事情变得更糟。艰难的谈话虽然会让人不舒服,但无论如何还是需要去做。
(6)奖励服从者
低级管理的管理者喜欢唯唯诺诺的人——那些点头称是、毫无异议地服从命令的人。他们表扬那些在会议上总是附和的人。
真正的领导者会积极寻找那些敢于挑战自己的人。他们想要那种能说“我觉得我们犯了一个错误”并详细说明理由的人,因为这样才能进步。
(7)总结
管理团队的关键是领导力,这跟你的头衔和位置无关,只跟你每天的心态和选择有关系。
你将员工视为人而非消耗品,与他们建立信任而非命令他们服从,创造一个让别人能够发挥最佳工作效率的环境,那么你就是领导者。
真正的领导者将每一次与他人的互动,都看作一次引领团队的机会。问题不在于你是否有权威,而在于你是否有勇气,站出来引领团队向正确的方向前进。
第 367 期:Nano Banana 的几个妙用
上个月,谷歌发布了图像模型 Gemini 2.5 Flash Image(项目名 Nano Banana)。

谷歌称它是目前“最先进的图像生成和编辑模型”。
我试用后,感觉确实很强,而且免费使用,打开官网(下图)就能用。

(备注:如果你访问不了官网,周刊讨论区也有接入官方 API 的第三方网站,不过大部分要收费。)
对于这个模型,网友发现了各种神奇的用法,有人甚至收集成了一个 Awesome 仓库。

我从这个仓库里面,挑了几个很实用的例子,分享给大家。需要说明的是,我想其他图像模型也能做这些事,大家可以试试。
(1)人像处理
图像模型的最常见任务,一定是人像处理。我们先上传一张生活照片。

然后,让模型将其转成证件照,提示词如下。
请为照片里面的人物生成1寸证件照,要求白底,职业正装,睁眼微笑。

这个效果有点惊人啊。它意味着,人物的表情、发型、妆容、服饰、姿势都是可以改变的。
下面就是改变人物表情,让其侧脸对着镜头微笑。


改变人物的姿势,“将下面第二张图片的人物,改成第一张图片的姿势。”



照相馆以后危险了,肖像照、旅游照、集体照都可以交给 AI 了。
(2)建筑处理
图像模型的另一个用途是家居装潢,要看家装效果图就让 AI 生成,更改装潢配色和家具,都是小 case。
下面是一个难度更高的例子,上传一张户型图,让它变成 3D 模型渲染图。


从照片提取建筑模型,也挺神奇。


(3)包装处理
下面,让模型更改物品的包装,“将图二的漫画形象,贴到图一的包装盒,生成一张专业的产品照”。




书籍的封面、软件的包装盒,也可以同样生成。
(4)地图处理
图像模型的另一个大市场是地图应用(地理信息),只不过还没想到可以收费的玩法。下面就是一个创新的用例。
上传一张地图,上面用箭头标注你选定的地点,让模型“生成沿着红色箭头看到的场景。”


它甚至可以从地形等高线图,生成红色箭头处的实景图。


第 366 期:旧金山疯狂的 AI 广告
上期周刊提到,旧金山有一个广告牌,上面是一个谜语,指向某个 AI 公司的网址。

我原以为,这只是个别现象,但是本周看到了一篇报道,才发现我错了。
旧金山市已经为 AI 疯狂了,城里的 AI 广告铺天盖地。相比之下,中国的 AI 热潮只能算是静悄悄。
旧金山的地理位置,就在硅谷旁边,美国主要的 AI 公司大部分位于这个地区。另外,斯坦福大学也在这里。
过去两年中,AI 概念支撑着美国股市不断疯涨,造就了无数富豪。旧金山就是最狂热的风暴中心,资金和人才正在疯狂涌入。
站在大街上,每一栋高楼顶上都是 AI 广告牌。



上面第一张图,有一个广告牌写着“你妈妈也会喜欢的 AI 客服”(AI customer support even your mother will like),这是词穷到找不到其他广告词了吗?
你开车上高速公路,路边也都是 AI 广告。



你在公交车站等车,看到的也是 AI 广告,上面写着“停止雇佣人类”(Stop Hiring Humans)。

不仅 AI 公司做广告,那些跟 AI 没关系的公司也在做。

上面是 Postman 公司的广告,它是一个 API 测试工具,按理说跟 AI 没关系。
但是,广告上写着“你的 API 为 AI 做好准备吗?”,言下之意就是可以用它来测试,就是这样蹭热度。
这些无所不在的 AI 广告,不是科幻电影,而是旧金山眼下的样子。
这么多广告,一方面因为确实有商机,但是更大的原因是 AI 公司钱太多,他们吸引到了源源不断的风险投资,还能去股市圈钱。资本急需看到效果。
于是,这些公司拼命做广告,曝光越多,市场占有率和公司估值也会随之提高,从而吸引更多的资本。
这就叫泡沫经济,只要没破,你就用力吹,能吹多大就多大,这样会有奖赏。
但是,作为一个普通人,每天被这些广告包围,狂轰滥炸,是不是有点太荒诞了。AI 作为一种新技术,目的是提高工作效率,解放人类,可现在变得像一种宗教,向你灌输,让你膜拜。人好像成了它的附庸,活在一个 AI 构建出来的世界里。
第 365 期:流量变现正在崩塌
上周,Cloudflare 创始人兼 CEO 马修·普林斯(Matthew Prince)接受了访谈。

他说了一个全新的观点,互联网“流量为王”的时代就要结束了,AI 将终结传统的互联网商业模式。

我觉得,他表达得很完整,很有说服力,不愧是英语系和法学院的毕业生。我整理出来,分享给大家。
1、
过去25年,互联网的操作入口一直是搜索。你想要什么,就要去搜索。
谷歌主宰着搜索。
为了自己的利益,它有动机推动互联网发展。互联网越多样化,越混乱,对谷歌越有利,因为人们就会离不开搜索,来处理混乱的信息。

所以,谷歌一直激励人们为互联网创造内容。只有源源不断的内容,才能提升搜索的价值。
2、
作为回报,它为内容生产商提供流量,并帮助生产者将流量货币化(主要方法是为内容配上广告)。
谷歌是世界最大的搜索引擎,也是世界最大的广告商,这绝非偶然。
实际上,谷歌是过去25年互联网最大的赞助商。如果没有像谷歌这样的公司来创造流量激励机制,让内容生产商可以把流量变成金钱,互联网就不会是今天蓬勃发展的样子。
3、
情况现在发生了变化。互联网的操作入口,正从搜索引擎变成答案引擎。
以前,谷歌给你一张藏宝图,你需要自己去访问链接找出答案。现在,大模型直接给你答案,省去了藏宝图。
甚至就连谷歌都有单独的 AI 模式,只有答案,不需要访问链接。

这确实方便了用户,但这样就无法产生流量了,整个基于流量的互联网模式就开始崩溃。
4、
一旦没有了流量,内容生产商就没有了货币化方式。他赚不到钱,只能减少或放弃内容生产。
现在互联网上,人类生产的内容已经萎缩了,根本原因就是传统的“流量变现”模式行不通了。
未来有两种可能。一种是大模型公司和平台公司,自己雇人来生产内容;另一种是它们分出一部分收入给内容生产者,换取后者向它们提供内容。
无论是哪一种可能,都意味着我们熟悉的互联网形态将不复存在。
第 364 期:最难还原的魔方
说来奇怪,我认识的很多程序员,平时看上去没有共同点,但是一问,他们都喜欢魔方。
而且,水平都很厉害,一般来说不超3分钟,就能还原魔方。

有一段时间,我们办公室有好几个魔方,没事的时候,大家就拿在手里拧。
我想过一个问题:什么样的魔方最难还原?
不同的魔方,还原难度肯定是不一样的,但是怎么衡量难度呢?
最近,我意外发现,这个问题在国外早有人研究了。
而且,他提出了衡量标准,最难还原的魔方应该同时满足下面6个条件。
- 每一面都包含6种颜色。
- 每一面的任何一种颜色不超过两个色块。
- 任何一面上,不能有两个相同颜色的连续色块。
- 任何一面上,不能有两个相同颜色的色块在对角线上。
- 八个角上,不能有相同颜色的色块。
- 每一面的图案都必须不同。
更让人佩服的是,他写了一个 C++ 程序,去找出最难还原的魔方。
魔方的排列方式共有 43,252,003,274,489,856,000 种,他的家用计算机花了5天,才跑完所有计算。
最终发现,只有下面一种排列,满足上面六个要求。

上面这个图案,就是最难还原的魔方。
这个图案包含了魔方的6个面。由于这6个面可以随机组合,因此一共有48种形态。

第 363 期:最好懂的神经网络解释
神经网络是 AI 的算法基础。
前些天,我在美国科普网站《量子杂志》(Quanta Magazine),读到一篇科普文章,用一个浅显的例子 + 插图,解释了神经网络,堪称我见过的最好懂的教程。
下面就是我整理出来的中文版。
1、

你的计算机里有一堆照片,你想要从中找出猫的照片,应该怎么做?
你很快意识到,这其实是一个机器分类问题,计算机要把照片分成两类:一类是猫,另一类不是猫。
2、

让我们把这个问题想成一张地图,中间有一条分界线,把地图分成两个国家。
你的任务是,找出这条分界线的确切位置。这样的话,给出任意一个点,你就知道它在分界线的左边还是右边。
3、

作为已知条件,地图上很多点的归属,是已知的。比如上图中,三角点属于 A 国,方块点属于 B 国。
你要做的就是,从这些点推测出分界线。
4、

我们可以建立一个数学函数(上图的点 N),处理这个问题。
这个函数接受两个参数,分别是每个点的 x 坐标和 y 坐标,函数的返回值是0~1之间的一个值,表示该点有多大概率属于当前国家。
5、

你就用已知的点,去训练这个函数。
计算机自动根据每次训练的误差,调整每个参数的权重值,最终得到一条最接近的分界线。
6、

笔直的分界线只是最理想的情况,现实世界中,分界线更可能是七拐八弯的曲线。
7、

这时,只用一个函数来确定分界线,就不太够了。你需要多个函数,从不同角度进行判断。
8、

判断过程甚至需要分阶段进行,也就是需要多层函数。
这些函数组成的网络,很像人类的神经系统,所以称为神经网络。每个函数就是网络中的一个神经元。
9、

好了,现在再回到猫的照片。我们同样需要建立一个函数,来判断照片是猫的概率。
地图分界线的函数只需要 X 和 Y 两个参数,猫照片的函数就不行了,需要把整张照片输入进去。假如照片大小是2500个像素,那么函数就有2500个参数。
10、

函数的参数个数,可以看成空间的维度,2个参数就是二维空间,2500个参数就是2500维的空间。
猫照片的函数就是在2500维空间里面,通过大量训练,找到一条分界线,从而算出任意一张照片落在线内的概率有多大。
第 362 期:GitHub 工程师谈系统设计
上周,我读到一篇文章,作者是 GitHub 的高级工程师肖恩·戈德克(sean goedecke)。

文章题目是《我所知的良好的系统设计》。

读完后,我觉得写得不错。GitHub 工程师总结经验,教大家设计一个良好的系统,不是空泛之谈。下面是我的一些摘录。
1、
程序设计是组装代码,系统设计是组装服务。
程序设计的组件是变量、函数、类等,系统设计的组件是服务器、数据库、缓存、队列、事件总线、代理等。
2、
如果一个系统很长时间不出错,它的设计就是良好的。
如果你进一步看了代码,脱口而出:“哈,这比我想的要简单”,或者“这个部分不用我操心,即使出问题也容易解决”,它的设计就是优秀的。
3、
良好的系统设计,总是从一个有效的简单系统发展而来。千万不要从零开始设计一个复杂的系统。
4、
系统设计的难点在于状态。尽量采用无状态组件,最小化“有状态组件”的数量。
状态的复杂性在于,你无法简单地重启服务。一旦出错,往往需要手动修复状态。
5、
状态需要保存在数据库。数据库是最重要的系统组件,用来管理状态。
数据库的设计目标是每张表易于理解:打开看一下表结构,就能大致了解存储的数据内容及其原因。
千万不要采用复杂的表结构(也就是数据结构),会给代码带来极大的复杂性和性能约束。
6、
数据库往往是系统瓶颈,因为每个页面请求可能要调用数十次、数百次数据库,而且是按顺序调用。
为了避免瓶颈,数据库可以做成一个写入节点和多个只读副本。数据查询都发往只读副本,数据写入发往写入节点。
写入节点与只读副本之间,存在数据复制延迟。如果更新一条记录后,你需要立即读取它,那么可以将数据放入内存,写入数据库成功后从内存读取。
7、
耗时的操作要拆分出来,放在后台作业(即系统外部的单独服务),排队完成。
后台作业主要分成两个组件:一个队列服务,一个作业运行器(从队列中获取任务并执行)。
队列任务的软件,可以用 Redis(需要尽快执行的任务),也可以用数据库(不着急的任务)。
8、
如果数据的生成速度和读取速度不匹配,经典解决方案就是缓存。
缓存的最简单做法,就是把数据保存在内存,否则就使用专门的键值存储软件(比如 Redis 或 Memcached),后者的好处是多个服务器可以共享缓存。
初级工程师希望缓存所有内容,而高级工程师希望尽量少用缓存。因为缓存是状态的来源,不可避免需要校验状态和处理状态过期。
9、
除了缓存和后台作业,大型系统通常还有事件中心,一般用的是 Kafka。
事件中心也是一个队列,存放的是“某件事发生了”的消息。比如,用户注册触发了“新帐户创建”事件,该事件就放入事件中心,然后由事件中心去通知订阅该事件的多个服务:发送欢迎电子邮件、设置个人空间等等。
事件中心适用于,发送事件的代码不关心其他服务如何处理事件,或者事件量很大且对响应时间不太敏感。
不要过度使用事件,很多时候,更简单的做法是让一个服务请求另一个服务的 API。
为了便于除错,所有日志最好都放在一起,你可以立即看到另一个服务的响应。
10、推拉
如果数据需要传送到多处,有拉取(pull)和推送(push)两种选择。
一般来说,拉取比较简单(比如大多数网站采用的轮询),推送更节省资源,不需要用户主动请求数据,一旦后端数据发生变化,服务器主动将数据推送给每个客户端。
如果你确实需要向100万个客户端提供最新数据(就像 GMail 那样),应该采用推送还是拉取?这要视情况而定。如果采用推送,就要把每次推送放入一个事件队列,并让一大群事件处理器从队列中拉取数据并推送。如果采用拉取,就要部署一堆(比如100台)快速的只读缓存服务器,处理所有读取流量。
第 361 期:暗网 Tor 安全吗?
1、
大家知道 Tor 浏览器吧?
它是访问暗网(dark web)的主要工具。

所谓暗网,就是普通浏览器打不开、必须用专门工具访问的互联网。

之所以暗网要用专门工具访问,是因为它采用了特殊的设计,保证让访问者高度匿名,难以追踪。
如果你希望执行秘密的互联网操作,就可以使用暗网。同样的,地下网站希望保密,不愿意暴露自己,那就可以做一个暗网版本,正常互联网无法访问。
暗网有专门域名 .onion,这种域名的网站都是要用 Tor 打开的。

2、
我一直以为 Tor/暗网很安全,可以保证访问者的匿名,无法找到真人。
因为它的设计是防追踪的。它不是直接访问目标网址,而是寻找一个随机的中继节点。
它规定,必须通过3个中继节点,才能连接目标网站。每个中继节点,只知道上一个节点和下一个节点,因此该节点即使被黑,黑客也看不到完整的通信线路。
理论上,只有三个中继节点都被破解,才能追踪用户。但是,这些节点是在全世界随机选择的,全被破解的概率实在很低。
这种设计叫做“洋葱路由”,就像剥洋葱一样,必须一层层解开所有的中继节点,才能了解完整的访问链路。事实上,Tor 这个词就是洋葱路由(The Onion Router)的首字母缩写。
3、
上周,我读到一篇文章,彻底动摇了对 Tor 的信心。
我震惊地发现,Tor 是美国政府开发的。
1997年,美国海军研究实验室(NRL)发明了 Tor。最初的动机是,防止外国政府追踪美国的机密通信。
美国的情报人员在国外,要向中情局的服务器发送机密消息,不希望被外国政府察觉和追踪,但又必须使用外国的民用线路,怎么办?
答案就是 Tor。通过洋葱路由,Tor 可以在民用通信线路上,让外国的互联网提供商无法找到人员位置和目标网址。
2004年,美国政府公开了这个项目的源码。电子前沿基金会 (EFF) 接手继续开发,逐渐演变成今天的 Tor,但是底层设计并没有大的改动。
开源之后,美国政府并没有放手这个项目,多年来一直大力资助。2012年,Tor 项目的年度预算200万美元,80%来自美国政府。
我查了最新的2023~2024年度财务报表,790多万的总收入中,依然有200多万来自政府。
美国政府大力资助 Tor,是因为这个项目对他们有利用价值。
我相信,Tor 源码应该是可靠的,没有植入后门,毕竟它是开源的,要经受全世界程序员的审查。但是,美国政府肯定了解源码的所有细节,很可能会部署他们自己修改过的版本,添加一些不为人知的改动。
根据以前透露的消息,很多的 Tor 中继节点是美国政府架设的(具体比例无法查实)。所以我认为,不能假设 Tor 是安全的,美国政府很可能监视 Tor 的通信。

曾经非常著名的暗网黑市网站“丝绸之路”(上图),就是完全依托于 Tor 来访问。但是,2013年被美国政府查封,创始人也被抓了。这也从一个侧面说明,Tor 并不安全。
第 360 期:Dan Wang 的新书
Dan Wang(我不知道他的中文名),7岁随家人移民北美,现在是知名的经济分析师,在斯坦福大学胡佛研究所任研究员。

他对中国问题的分析,非常有洞察力,在国外知识界很受重视。
2017年~2023年,他住在上海,并在国内各地旅行。
疫情后,他回到美国,开始专心写作一本关于中国的新书。上周,他宣布写完了,并且本月就要出版,书名叫做《冲:中国对未来的探索》(Breakneck: China’s Quest to Engineer the Future)。

他在个人网站上,写了一篇长文,介绍这本新书,内容很有趣。下面是我的一点摘录。
1、
这本书始于2021年的一次旅行,我从贵阳骑行到重庆。
我欣喜地发现,贵州这个西部省份的基础设施,比加州或纽约要好得多,而后两个地方的富裕程度比贵州高出几个数量级。
在令人叹为观止的青山绿水间,五天的艰苦骑行让我瞥见了真正的中国。它远不止于高耸的桥梁、宏伟的基建,而是在进行一种前所未有的社会工程,试图解决这个国家面临的问题。
2、
2023年我回到美国,在耶鲁法学院待了一段日子。那里是精英法学院,是雄心勃勃、想要跻身美国政府高层的人的捷径。
这段日子让我强烈感受到,美国是一个律师社会。
律师在美国社会占主导地位,这促使美国沦为一个诉讼至上的否决制国家。无论你想做什么事,反对者都会试图通过律师来否决你。
我相信,如果美国如此执着于一个主要为富人和权贵阶层服务的体系,它就不可能继续保持强国地位。
3、
我逐渐形成了这样的观点:中国是一个工程国家,它用大型工程(包括社会工程)来解决物质和社会问题,而美国则是一个律师社会,它用法律阻止几乎所有的事情,无论好坏。
除此之外,美国人和中国人从根本上来说很相似:永不停歇,渴望走捷径,最终推动着世界上大多数重大变革。
中国和美国的竞争不应该用上个世纪的陈词滥调来解释,比如社会主义 vs 民主主义。两国经常以竞争的名义,实现那些最疯狂的梦想,探索自己的道路。
4、
“工程国家”与“律师社会”的对比,可以解释很多事情。
美国依赖法律手段,比如征收关税和设计各种严苛的制裁机制。而中国则专注于用工程创造未来,比如建造更好的汽车、更美丽的城市、更大规模的发电厂。
5、
工程师并非能言善辩,往往表达不出他们不理解的内容,所以尽管中国在海外修建了道路和桥梁,但它们难以激发中国在全球的文化吸引力。
6、
我写这本书,部分原因是为了整理自己对中国的看法。
中国建立了一个资源丰富国家的良好运营模式。它在过去四十年里修建了多少英里的公路、建造了多少座新的核电站、生产了多少钢铁,写出来真的令人震惊。
我认为,美国不必像中国那样去建设基础设施,只要达到法国、日本或西班牙的建设成本水平就足够了。
尽管如此,美国仍然应该向中国学习。中国在公共交通、充足的住房、功能齐全的城市建设方面已经取得了很多成功。
7、
美国太多地方感觉像是被完好保存下来的、曾经的伟大文明的遗迹。美国人应该更清晰地审视那些通常被忽视和蔑视的工业成就。
8、
2024年底,我再次去上海,发现消费降级是真实存在的。高档餐厅不再难以预订,川湘菜馆正在占据主导地位。许多餐厅的菜品都是在集中式配送中心制作的。越来越多的餐厅更注重外卖,而不是堂食。而且,似乎有一种趋势是,三线城市的连锁餐厅正在向一线城市迁移,以更便宜的价格提供略逊一筹的菜品。
最糟糕的是网红文化。中国的网红文化比美国浓厚得多。在公共场所,随处可见许多人对着手机自拍。任何迷人的地方,无论是咖啡馆还是山顶,都挤满了专心拍照的人。在中国,经常可以看到情侣或朋友聚餐时几乎不怎么互动,只是低头看着手机。我记得有一次在上海丽思卡尔顿酒店喝咖啡,一群女孩坐在我旁边,围着蛋糕互相拍照,竟然拍了一个多小时。网红文化促使餐厅的菜肴更注重拍照效果,而不是味道。
9、
我没有在这本书的任何部分使用 AI。一位经济学家曾写道,他人生中大约有一半时间没有接触过互联网,这让他在互联网出现后更能体会到它的价值。我突然想到,三十年后,回首往事,我也会发现自己的人生分成 AI 之前和 AI 之后。
为了更贴近 AI,我最近搬了家,从耶鲁大学来到斯坦福大学胡佛历史实验室,现在我是那里的研究员。我原本想留在纽约市,但湾区太有吸引力,我决定今年年底重新开始写我的年度信件。硅谷是一个和中国一样奇特而又引人注目的地方,我感觉搬到那里完全合适。
第 359 期:Palantir 值得关注
Palantir(中译帕兰提尔,或者帕兰泰尔)是一家美国的高科技公司。

它在中国不出名,但在美国鼎鼎大名。最近两年,股价涨了十几倍,市值达到4000多亿美元,排进世界前30大公司,高于三星。

它有鲜明的意识形态,自称使命是“防止西方的衰落”,要使用高科技,巩固自由民主制度,支持美国及其盟友。
它的业务主要是,接受美国政府和美军的订单,为它们做咨询和开发软件,提升美国的军事实力。
举例来说,它帮助美军在阿富汗识别路边的炸弹,帮助美国移民局发现非法移民,以及参与以色列的军事行动。
传说中,发现本拉登的藏身之处,也有它的功劳。它对此既不承认,也不否认。
它对于自己的业务和客户严格保密,从不泄漏,即使在美国,也是一家非常神秘的公司。
上周,我读到一篇 Palantir 离职员工的回忆文章,透露了很多公司的内部情况,很有意思,下面是一点摘录。真的极其特别,我觉得,大家应该关注这家公司。
1、
找工作的时候,我想找那种能够接触医疗保健、航空航天、安全等关键行业的工作,但又想要硅谷的工作文化,Palantir 基本上是唯一的选择。
我就是因为这一点加入的。
2、
刚进 Palantir 的时候,我发现里面充满了奇怪的人。事实上,如果你是一个怪咖,会更容易加入这家公司。
有一个同事,办公室放了好几个降低二氧化碳浓度的设备,杯子里还放了一大堆冰块,跟我交谈时,不停地嚼着冰块。据他说,这样可以促进认知能力。
3、
公司的 CEO 亚历克斯·卡普(Alex Karp)是一个哲学博士,面试候选人时,他喜欢没有任何资料直接面试,避免先入为主的成见。
他不看重候选人的经历,而会观察他们如何分解问题,能否从不同视角理解问题。
面试的问题通常与工作或软件无关,他甚至花了一个小时跟我讨论哲学家维特根斯坦。
4、
公司要求员工,同时具有宏大的知识背景和激烈的竞争精神,是具有奇思妙想的知识型思考者。
公司的各种制度,都是为了挑选出一种特定类型的人:独立思考,专注于目标,不会过度关注坏消息。
正是因为它招聘了众多优秀的、与众不同的员工,进而吸引了更多这样的人。
5、
它要求员工每周有3~4天去客户办公室,在那里工作,掌握复杂行业的业务流程和各种知识,然后运用这些知识,设计出能够真正解决问题的软件。
我的第一个客户是空中客车公司,我因此搬到法国图卢兹待了一年,每周四天在工厂与制造人员一起工作,在那里开发软件。
6、
公司的整体氛围,有点像一个要拯救世界的邪教团体,而非一家普通的软件公司。
但重要的是,它对批评非常宽容和欢迎。有人给我看了一封电子邮件,一位初级软件工程师正与公司一位董事进行公开的、激烈的争论,全公司(大约一千人)都抄送了这封邮件。
我对宗教不感兴趣,但喜欢看到,有人深切关注并探讨世界的发展方向,以及软件如何融入其中,这才是真正有趣的事情。
7、
公司的一个理念就是不给员工头衔,每个人的头衔都是“项目工程师”。除此之外,还有五六位董事和一位首席执行官。
原因是公司相信,如果创造出头衔,人们就会开始想要它,最终在公司滋生内部政治,破坏团结。最好还是给每个人同样的头衔,让大家专注于目标。
因为大家头衔都一样,也就没有等级,没有人可以指挥别人该做什么。你完全可以不在意别人,或者他怎么看你,直接无视他们,去做一些你认为正确的事情。
公司文化就是推崇无视上级的意见、但开发出了关键的基础设施的人。这种事在公司被当作榜样来效仿。
8、
“无头衔”的代价是,你常常感觉公司缺乏明确的战略或方向,更像是一个培养皿,里面的聪明人各自建立小领地,然后朝着随机的方向发展。
但这也带来了令人难以置信的创造力,人们低估了 Palantir 涌现出多少新颖的概念和想法。
第 358 期:如何拯救一家濒临倒闭的创业公司
上周,Medium.com 的 CEO 发表了一篇长文,透露2022年曾经濒临倒闭。
“我们每月亏损260万美元。”

这不意外,它是一家博客托管平台,现在是短视频的时代,文字网站都活得很艰难。
“订阅用户在流失,平台上的垃圾文章越来越多。出资者不愿意再投入资金了(我们确实不值得投资),也找不到人愿意收购我们。”

意外的是,三年后,它还没死,并且盈利了。
它怎么活下来的?那篇文章透露了答案。
“我们决定最后试一次,如果不能扭亏就关门。”
凡是能用的常规操作,他们都用了,完全可以当作教科书。大家了解一下,万一公司要倒闭了,管理层会怎么做。
(1)裁员
他们高峰期有250名员工,目前只有77人,员工规模缩减了70%。
“如果还是250人的团队,即使业务好转,我们也肯定破产。”
(2)办公室退租
以前,他们在旧金山租了一个120个办公桌的办公室,每月租金14.5万美元。
现在全部退租,一年可以省下100多万美元。
(3)远程办公
疫情期间他们远程办公,员工都在家里干活。疫情结束后,发现公司可以这样运作,而且省钱,于是决定保持下去。
“我们现在致力于成为一家完全远程办公的公司,办公室的概念已经永远没有意义了。”
(4)业务重组
凡是盈利少、成本高的业务,全部砍掉。他们原来有一支高级编辑团队,负责制作高质量的内容。但是现实是,优质内容看的人并不多。
“我们平台上点击最多的文章,标题都是点击诱饵,它们的制胜策略是:找一篇维基百科文章,作为知识点,配上一个病毒式传播的标题,再加一些夸张的个人情感故事,然后从我们这里领取流量奖金。最高的一篇赚到了2万美元。”
他们别无选择,取消了高级编辑团队,调整了文章奖励。底下几家从事其他业务的子公司,也全部关掉。
(5)债务重组
他们有很沉重的债务,是从出资人借来的,已经有3700万美元逾期,根本无力归还。
另外,出资人还有优先清算权,就是说公司清算时,出资者可以优先于员工拿回资金。这让出资人有动机推动公司破产。
他们就跟出资人谈判,要求取消优先清算权,并将债务转为股本。如果不同意,公司就会破产,出资人可能什么拿不回来。
(6)重新协商员工股权
创业公司招人,都会给股权/期权,这些本质上都是公司债务。
如果不想破产,员工的股权/期权也必须甩掉,简单说就是缩水或者作废,否则无法进行新的融资,对于同意放弃一部分权益的出资人也不公平。
“我打电活给几位老员工,告诉他们股权缩水了。不这样做,我们就会破产,他们的股权很可能一文不值,现在重新估值可能还会值一点钱。更重要的是,这样也可以让他们创建 Medium 的努力不会白费。”
(7)总结
上面就是 Medium 起死回生的措施。
如果你想效仿,一定要记住,这些措施有一个前提:Medium 有现金收入(会员费),只是成本过高,所以值得试一下,压低成本求生。
大多数创业公司的现实是,几乎没有现金,全靠烧钱支撑,也没有市场份额。这样的公司不值得拯救,理性的做法是尽快止损。
有一句至理名言“failing fast”(快速失败),说的就是这种情况。如果注定失败,资源越早释放越好,转投更有前景的项目。
第 357 期:稳定币的博弈
稳定币(stable coin)是最近的热点,新闻媒体不断提及。

起因是今年5月,香港通过了《稳定币条例》,8月1日马上就要生效,允许企业申请牌照、发行稳定币。

可以想象,香港有了稳定币,对于大家来说,就多一个金融机会和金融工具。
但是,大多数人并不清楚,稳定币是什么?有什么用?
我就来谈谈看法,为什么香港发行稳定币意义很大,其实很好懂。
(一)
稳定币属于加密货币的一种。它的由来跟比特币有关。
比特币是最早的加密货币,价格波动十分剧烈。今天值5个烧饼,明天可能值8个,后天又变成4个。
这注定了,它不适合作为交易工具,你根本不会用它来买卖其他东西。
于是,人们想到可以创造一种价格稳定的加密货币,也就是稳定币。以目前最大的稳定币 USDT 为例,它是 Tether 公司在2014年开始发行的(比特币是2009年诞生的)。

Tether 承诺,USDT 的价格保持不变,始终为1美元。你给 Tether 公司1美元,就可以得到1枚 USDT(不是实物,而是记录在区块链账本上)。等你不需要了,就把 USDT 再卖给 Tether 公司,拿回1美元。
理论上,只要 Tether 始终保留足够的美元储备,那么稳定币与美元的比价就能维持在1:1。Tether 公开了自己的财务,绝大部分收到的美元都购买了美国国债,所以大家觉得它的承诺是可信。
一旦人们认可,稳定币等价于美元,那么凡是可以使用美元的地方,都可以使用稳定币,你就可以用稳定币购买各种各样东西。
现在,USDT 是世界上交易量最大的加密货币,超过了比特币。大部分情况下,它被用来买卖其他加密货币。
(二)
使用稳定币时,人们发现,它可以逃避美国政府的监管。
稳定币的流动完全脱离银行体系,是匿名钱包之间的交易,根本没办法追踪和监管。
举例来说,美国政府某一天突然发布命令,禁止张三使用美元。这种情况下,张三改用稳定币,向李四购买想要的东西,李四再将稳定币兑换成美元。
美国政府完全不会察觉,发生了这样一笔交易。即使政府监控美元的兑换,由于稳定币还可以兑换成其他加密货币,追踪是不可能的。
美国政府也意识到了这个问题,于是本周正在通过一个《GENIUS 法案》,它是历史上第一个稳定币的全面监管法案。

这个法案的主要内容有三条。
- (美元)稳定币的发行机构,必须在美国管辖范围内,且获得政府许可。
- 发行机构所得的美元必须 1:1 转成银行存款。
- 美国政府有权阻止、冻结、销毁外国机构发行的(美元)稳定币。
(三)
香港政府这次通过的《稳定币比例》,实在是很妙的一招。它允许持牌机构发行港币支持的稳定币。
大家知道,港币跟美元汇率是不变的,7.8港币等于1美元,因此港币稳定币与美元稳定币的汇率也是不变的。
所以,港币稳定币可以替代美元稳定币,进而间接替代美元。这里最重要的一点是,港币稳定币的发行和使用,都不受美国控制。
也就是说,香港创造出了一种价值跟美元挂钩,但可以逃避美国监管的金融工具。可以设想,如果某些情况下,国际贸易无法用美元结算,也许就可以用港币稳定币结算。
(四)
最后一个问题,人民币稳定币可能出现吗?
就像上面说的,稳定币很难监管,且可以自由兑换成美元,所以我认为,跟人民币挂钩的稳定币应该不会出现。
第 356 期:公司强推 AI 编程,我该怎么办
前两天,“黑客新闻”论坛有一个求助帖。
程序员求助,公司强制使用 AI 编程,他不想用,怎么办。
下面七嘴八舌,大家说了很多想法。这是现在的热点问题,我今天就来分享这个帖子。

2025年的现实就是,AI 编程(AI coding)已经从实验室技术变为成熟技术,无法回避了。
它自动写代码,成本低、产出快,公司管理层不可能不推广。程序员就很尴尬了,跟 AI 是合作竞争关系,既要用好 AI,又要防止岗位被它抢走。
求助帖这样写道:
我是一个高级工程师,已经在公司工作五年了。公司越来越推崇快速工程,CEO 和 CTO 都对 AI 编程痴迷不已。
公司强制大家使用 AI 编程,甚至提倡让 AI 生成单元测试,对于失败的测试用例,也是扔给 AI 处理,而不是手动解决,以加快开发速度、产品尽早上线。
我考虑辞职,不想参与这种流程,成为不写代码、只写提示的“提示工程师”,眼睁睁看着自己的技术停滞或退化。我也不想两三年后,负责维护一堆由 AI 生成的意大利面条代码。
我想听听大家的意见,怎么应对公司推行 AI 编程。
网友的看法,总结起来就是三种选择,都有一定的道理。换成你,会怎么选择?
选择一:听从内心
如果你确实精疲力竭,那就离开吧。即使你还能忍,做一份自己讨厌的工作,也很快会精疲力竭。
最糟糕的情况是,你平时在公司里,表面上假装对 AI 充满热情,但心里又不愿意,那真的是煎熬。
放任自流的 AI 编程会快速积累技术债,最终导致项目失败。公司迟早会要求你,修复 AI 造成的代码混乱,如果你回答唯一解决方法就是大规模的手动重写,可能还是会被解雇。
而且,你们的 CEO 和 CTO 看上去盲目信任 AI,公司的前途堪忧。
已经有一些公司明确声明,现阶段不打算将 AI 编程用于线上代码,你可以试试找这样的公司。
不过,如果没有足够的积蓄,你还需要再忍几个月,一边攒钱,一边找工作,并学习一些 AI 不容易取代的复杂枯燥的技术。记住,除非你是超级技术明星或非常富有,否则不要在找到新工作之前就辞职。
选择二:接受现实
你去其他公司也一样,现在到处都在使用 AI 编程。有些公司实际上通过采用 AI,来清除那些“拒绝改变”的人。
我认为,我们永远不会再走回头路了,你用过就知道回不去了。下一代程序员都会在 AI 的陪伴下成长。你不愿意使用 AI,就好比不愿意用电脑替代打字机。AI 编程的普及,只是时间迟早的问题,不接受它的人都会被淘汰。
再说,反正是公司付钱,让你学习使用 AI。聪明点,留下来接受这笔交易。
现在的市场是雇佣者市场,有的是人愿意接替你的位置。即使你找到一家目前不使用 AI 的公司,很可能意味着他们远远落后于时代潮流,也许很快也转向 AI。
你最好适应现实,找到在公司立足的方法。即使心理上接受不了,也要用公司的钱来试试新技术。
你可以先在小范围使用 AI 编程,检查它做的代码变更。AI 代码需要大量审查和重构,你能做的比你想象的要多。
选择三:静观其变
你可以继续留在公司,一边学习 AI 和其他新技术,一边观察会发生什么情况。
如果公司发展比你预期的要好,AI 效果不错,那么你应该改变想法,为新的工作模式做好准备。
如果结果跟你预计的一样,代码快速劣化,项目面临失败。你得到了使用 AI 的经验,知道它在第一线的优势和劣势,把它写进简历,为应聘下一家公司提供帮助。
无论哪一种情况,你接下来留在公司的几个月,都会对你的职业生涯有帮助。
私底下,你必须现在就开始找下一个更符合你期望的职位,为不利局面做准备,为自己留一条后路。
第 355 期:两本《芯片战争》
前些日子,我想找芯片知识的书籍,想起有一本很有名的畅销书,叫做《芯片战争》。
搜索发现,《芯片战争》居然不止一本,而有两本书都叫这个名字。

《芯片战争》,余盛(华中科技大学出版社,2022)

《芯片战争》,[美]克里斯·米勒(浙江人民出版社,2023)
一本是中国人写的,另一本是美国人写的。我都读了,下面就是简单的读后感。
为了便于区分,我把中国人写的那本称为“国人版”,美国人那本称为“老美版”。
这两本书的内容,都是芯片行业的发展史。读完以后,我的最大感受是,它们可以帮你了解芯片历史,但是帮不了你了解芯片知识。
因为它们不是科普图书,更不是技术图书,而是经管图书。
我有点后悔,没查一下作者背景。读了才发现,这两个作者,都不是芯片行业人士,甚至不是科技从业者。
国人版的作者是会计系毕业,后来在食品公司工作,他的上一本书写的是粮油贸易。
老美版的作者是政治系毕业,现在是大学教授,专门研究地缘政治,上一本书写的是俄罗斯历史。
可想而知,这样的作者写芯片行业,不会有深入浅出的技术分析,只会关注商业经营层面。
事实上,国人版的内容,不客气地说,全部都是从新闻报道搜集整理而来,编辑成一个个故事,完全是商战书籍。
老美版相对好一些,作者采访了一些当事人,有第一手资料,内容条理比较清楚,更像一本商业历史书。
虽然我对缺乏技术讲解挺失望的,但是我认为,这两本书还是能带给读者收获。
很多内容我以前就知道,比如晶体管是怎么来的、集成电路的发明人之争,但还有不少事情是这次读了才知道。
国人版有一个专门的部分,介绍中国芯片发展史,收集了很多相关材料,我还没在其他地方见过,比如江上舟的故事、张汝京的故事、汉芯造假事件、从武汉新芯到长江存储等等,内容详细,带给人很多冲击。
老美版的优点,前面说了,有第一手材料,站得比较高,按照编年史顺序,以人物故事的形式,理清了行业的发展脉络。虽然作者的专业是政治学,但总体上没有加入政治观点,写得比较中性客观。
另外,老美版偶尔会有一些技术概念的通俗讲解,写得挺好。我摘录了一段芯片的种类介绍,放在后面的文摘部分,大家可以看看。
我的结论就是,如果你单纯想了解芯片行业的基本历史,可以读老美版;如果还想了解国内芯片行业的历史,可以读国人版。
第 354 期:8000mAh 手机电池,说明了什么?
大家发现了吗,手机的电池正在越变越大。

你可以看一下你的手机,电池容量是多少。
仅仅三四年前,手机电池一般都是 4000mAh(毫安时),最多就到 5000mAh。
但是在去年(2024年),电池容量增加到了 6000mAh。今年(2025年)更是出现好几部 8000mAh 的手机。

更让人惊奇的是,这些手机并没有因为更大的电池,而变得更重更厚。
以某品牌的 8000mAh 手机为例,重量209克,厚度7.98毫米,跟一般的大屏手机差不多。
为什么手机塞进了更多的电池,却没有变重?
原因很简单,电池技术在这几年出现了突破。
大家应该听说过“固态电池”。它不同于现在的锂电池,最大特点是更高的能量密度,也就是同样的重量可以储存更多的能量。
但是,固态电池还在测试中,量产时间最快也要等到2027年。目前,真正进入市场的是“半固态电池”。
半固态电池介入传统锂电池与固态电池之间,电解液是固态和液态的混合物。

2023年4月份,宁德时代宣布将要生产凝聚态电池,也就是半固态电池。
根据厂家公布的数据,这种电池的能量密度是 500 Wh/kg,也就是每公斤可以储存0.5度电,传统锂电池的能量密度是 250 Wh/kg。
所以,手机从锂电池换成半固态电池,重量不变,电量翻一倍,正好从 4000mAh 增加到 8000mAh。从时间上看,半固态电池是2023年发布,2024年投产,2025年进入消费电子产品,时间也刚好。
可以预期,随着越来越多手机换成半固态电池和将来的固态电池,续航时间不再成为问题,充电焦虑将彻底消失。
以今年发布的 8000mAh 手机为例,续航时间就非常惊人。根据评测,它可以连续播放25小时的视频。也就是说,中度或轻度使用时,可以两天一充,甚至三天一充。
半固态电池只有中国厂商量产了,目前只用于中国品牌的手机。三星旗舰手机 S25 Ultra 的电池容量,还停留在几年前的 5000mAh,苹果就更差劲了,iPhone 16 Pro 是 3582mAh,iPhone 16 Pro Max 是 4685mAh。所以,中国品牌手机在电池上是世界领先。

固态电池的应用,不限于手机。有报道说,比亚迪正在测试固态电池的汽车,续航里程居然可以达到1875公里。
这意味着,一次充满电,可以从上海开到成都(直线距离1600公里),太不可思议了。
固态电池还使得电动飞机成为可能。飞机需要大量能源,同时又不能有太大的起飞重量,固态电池正好满足。中国的电动飞行器,很可能会像电动汽车一样,成为下一个在全球竞争中脱颖而出的产业。
第 353 期:苹果的“液态玻璃”是为了 AR
上周,苹果公司发布了新的设计风格“液态玻璃”(liquid glass)。

这种风格使用液体玻璃,作为控件(上图)。早先的扁平化风格,被一股脑抛弃。
下图左面是原来扁平化风格的 iPhone,右面是这次测试版的液态玻璃。

我知道的绝大部分人,对这种新风格都是差评,觉得不好看。大家想不通,为什么苹果要在屏幕上,添加一个额外的半透明玻璃层。
甚至有人说,如果乔布斯看到 iPhone 变成这样,会解雇所有人(下图)。

那么,到底为什么呢,苹果好端端的,突然要大改界面?
官方完全回避这个问题,我倒是看到一篇解读,提出了一个很有见解的猜测。
他说,苹果这样做,压根不是为了审美,而是为了下一代的空间计算,也就是 AR。
现在的计算设备,都是二维的平面交互,用户面对一个扁平的屏幕,所以适合二维的扁平化风格。
但是,对于 AR 设备,用户进入的是一个 3D 空间,接触的东西都是立体的,所以需要一个立体的界面。
AR 设备没有屏幕,只有空间。屏幕不重要,空间才重要。
液态玻璃就是一个空间设计,目的是让界面有一个实体,让你感觉每个按钮都是一个有体积的实物。并且,它半透明,不会遮住后面,从而产生空间层次感。
从这个角度,苹果的界面设计副总裁 Alan Dye 对液态玻璃的介绍,就很容易解读。
每个元素都经过精心设计,赋予了它们物理感:它们具有维度,能够动态响应光线,并投射阴影。
苹果的 AR 设备,目前只有 Vision Pro 头盔。

液态玻璃界面,应该最初是为了这个头盔设计的。在 AR 空间中,操作界面就是一块悬浮的玻璃,这非常合理。

苹果为了统一设计语言,索性让 iPhone 和 Mac 也用了它。开发者只需要设计一次,就能适配所有苹果设备。
这样做,有利于推广 AR。试想一下,用户在手机和电脑上,已经熟悉了液态玻璃风格,当他最终戴上 AR 设备时,就不会对这种界面感到陌生,仿佛 AR 设备只是 iPhone 的自然延伸。
如果苹果确实是这样的考虑,那么我们可以确定,苹果下一步会大力推广空间计算。
Vision Pro 虽然卖得不好,但是苹果不仅不会放弃它,反而会加大投入,很可能还会推出轻量级的 AR 眼镜。

AR 也许是计算机行业的下一个热点,苹果已经在布局。
并且,液态玻璃界面要求实时模糊、动态透明、情境照明。这些效果需要强大的 GPU 实时渲染,这正是苹果芯片的强项,对手的硬件可能会出现卡顿,从而进一步加大苹果的优势。
第 352 期:Bug 追踪系统的正确样子
上周的话题是 GitHub Issues,把它当作笔记工具,很强悍。
但是,有些话来不及说。它的本职工作——Bug 追踪系统——并不好用。

你用它来管理 Bug,就会发现有设计缺陷,用起来不顺手。

现在还活着的、历史最悠久的 Bug 追踪系统是 Bugzilla。
它的一个早期工程师,前不久写了一篇文章,介绍 Bugzilla 的四条设计原则。
他说,只有满足这四点,才是一个好的 Bug 追踪系统(bug tracking system),我感到很有启发。
(1)所有任务都要列入 Bug 追踪。不仅包括代码 Bug,还包括待开发的新功能、缺失的文档、令人困惑的用户体验、糟糕的性能等等。
换言之,Bug 追踪系统本质是任务管理,应该当作项目管理系统来用。
(2)Bug 的状态有多种,不只“打开”和“关闭”两种。
大公司的 Bug 处理流程,可能很复杂,下面是一张从 Bugzilla 文档拷贝的流程图。

Bug 追踪系统应该足够灵活,可以自定义优先级、严重程度、是否已分配、是否有依赖等等,以便适配各种流程。
(3)每个 Bug 只能由一人负责。
这样才能明确责任,方便查看每个人正在做什么、接下来要做什么、以及最近做了什么。这也有利于培养开发者的归属感和成就感。
(4)支持自定义视图。
由于 Bug 有多种状态,追踪系统必须支持自定义视图查看,拥有强大的查询功能。
系统的默认视图:按照优先级,列出当前版本的所有没有关闭的 Bug。
开发者的个人视图:列出分配给他们的所有 Bug,同样按优先级排序。另外,用户可以保存自己的自定义视图。
以上四条,就是好的 Bug 追踪系统的标准。问题是 GitHub Issues 一条都没做到。
- 项目管理功能太弱。
- 状态只能靠标签。
- 任务可以分配给多个人。
- 视图默认按创建时间排序,且只能切换成标签视图。
在这方面,GitHub 甚至不如 Gitea。
举例来说,GitHub 没有办法让最重要的 Bug(P0 级别),自动出现在第一位(下图),除非手动置顶。

相比之下,Gitea(包括分叉的 Forgejo)提供了“标签集”(label set),允许一个标签有多个值,并可以按同一个标签的值排序。

上图中,标签“Priority”(优先级)有多个值,然后系统允许按照 Priority 的值排序。
第 351 期:GitHub Issues(几乎)是最好的笔记应用
Issues 是 GitHub 的 Bug 管理工具,所有代码仓库都默认启用。

它不仅可以管理 Bug,还可以用于其他用途。
比如,我把它当作投稿论坛,大家在那里提交自己的项目。
再比如,很多人把它当作内容管理系统,用来写博客,或者存放自己的文章。

上周,著名程序员 Simon Willison(Django 框架的作者)提出,GitHub Issues(几乎)是世界最好的笔记应用。

笔记软件这么多,为什么他独独看上了,根本不是用于写笔记的 GitHub Issues?

他给出了几点理由。
(1)免费,可以无限制使用。
(2)笔记可以公开,也可以私密。
(3)支持标签,可以给笔记分类,甚至还能分层(下图)。

(4)支持 Markdown 语法,有代码高亮,且可以插入各种图表(比如 Mermaid 图)。
(5)免费上传图片和视频。
(6)支持内部链接,可以将 GitHub 网址自动转成标题链接(下图)。

(7)自带评论和搜索。
(8)除了 Web 版,还提供 Windows、Mac、安卓、iOS 原生客户端。
(9)提供全面的 API,可以编程创建、编辑、导出笔记,还可以用 GitHub Actions 自动化几乎所有操作(比如发布到网站)。
它唯一缺少的功能,就是离线支持。如果没有网,就用不了。
这些理由,说服你了吗?
我觉得,他说的有道理,确实可以试试,将笔记软件换成 GitHub Issues。
第 350 期:Java 三十周年
上周是 Java 语言诞生三十周年。1995年5月23日,Sun 公司正式发布了这种语言。

三十年了,大家觉得 Java 算不算老语言?
说实话,我一直以为,Java 跟 C++ 是同一时期的语言。但是实际上,Java 与 Python、JavaScript、PHP 同时期,属于年富力强的年轻语言。

全世界的计算机语言有几千种,Java 是特别、特别成功的那一类。从发布的第一天起,它就很成功,一直保持到今天。
Java 的成功体现在两方面。
(1)它无所不在。日常生活中,我们接触到的软件服务,尤其是企业级服务,后端的开发语言大部分都是 Java。
Java 在服务端是霸主地位,在桌面端也有广泛应用,很多人用它写桌面软件。至于手机端,就更不用说了,安卓系统就基于 Java。
(2)它的工作岗位最多。
如果你问我,学习什么编程语言,最容易找工作?
没有其他前提的情况下,我会建议学习 Java,它的工作岗位最多,最容易找。
Python 语言虽然也很热门,但是工作岗位往往要求高级程序员,中级和低级的岗位并不多。不像 Java,你只要具有一般水平,就可以去应聘,需要普通 Java 程序员的地方非常多。
国外有一条经验法则,叫做林迪效应(Lindy effect),说的是一种事物的预期寿命与它已经存在的时间成正比。它已经存在多久,你可以预期,它还会存在这么久。
那么,Java 已经流行了30年,接下来30年,很可能还会继续流行。
第 349 期:神经网络算法的发明者
上周的《李飞飞自传》读后感,还有后续。
那篇文章的结尾是,2012年一支加拿大团队使用神经网络算法,夺得了 ImageNet 比赛冠军。
今天就来说说,这支加拿大团队的故事。

大家看了就知道了,神经网络算法是怎么诞生的,背后的推手又是谁。
(1)杰弗里·辛顿(Geoffrey Hinton,1947-)

辛顿出生于英国,后移居加拿大。他是神经网络算法的奠基人和主要发明者。
神经网络的概念,是上世纪40年代后期提出的(提出人不是辛顿)。当时的想法是,既然人类通过神经网络进行思考,那么只要让机器模拟神经网络,机器就能思考了。
但是,那只是一个概念,并没有具体的算法。机器怎么模拟思考,人们并不知道。
1984年,辛顿在加州大学担任博士后,与两个同事一起提出了反向传播算法。
这个算法可以建立多层网络,产生一个输出结果,让神经网络变成了现实,也是后来更高级算法的基础。
由于它需要多层计算,后一层在前一层的结果上学习,所以被称为“深度学习”,辛顿因此成为“深度学习之父”。
辛顿后来因为这个贡献,获得了图灵奖(2018年)和诺贝尔物理学奖(2024年)。
(2)杨立昆(1960-)

杨·安德烈·勒坎(Yann André Le Cun,中文名杨立昆)是法国人。上个世纪80年代,他是多伦多大学博士后。
这一时期,辛顿也来到了多伦多大学任教,担任他的指导教师。
所以,杨立昆是辛顿的大弟子,继承和发展了辛顿的算法。他的主要成就是,为神经网络引入了卷积算法,并且做出了第一个有实际用途的神经网络。
1990年代,他用神经网络识别银行支票的手写数字,成功获得了企业的采用。

但是,这个应用也暴露了卷积神经网络的弱点:它需要大量样本的训练,耗费巨大的算力。银行支票只需要识别10个阿拉伯数字,如果是更多样化的场景,当时的计算能力难以做到。
学术界因此认为,卷积神经网络只适用特定的、计算量较小的场景,不具备推广的价值。这导致这种算法,以及辛顿和杨立昆,被冷落了二十年。
这二十年,杨立昆一直混迹于企业实验室和大学教研室。等到世界重新认识卷积神经网络,他在2018年与辛顿一起获得了图灵奖,现在是 Meta 公司的副总裁和 AI 首席科学家。
(3)亚历克斯·克里泽夫斯基(Alex Krizhevsky,1986-)

亚历克斯·克里泽夫斯基是乌克兰人,少年时随家人移民到加拿大。2007年,他进入多伦多大学,成为辛顿的博士生。
这时距离杨立昆提出卷积神经网络,已经过去快20年了。辛顿始终没忘记它,他鼓励亚历克斯和稍后要提到的伊尔亚·苏茨克维,使用这种算法,去挑战李飞飞的 ImageNet。
亚历克斯就写了一个程序,用 ImageNet 的1500万图片,来训练他的卷积神经网络。但是,计算量太大了,他的个人计算机根本跑不动,他就买了两块 Nvidia 显卡,每天24小时一刻不停地运算。
事实证明,卷积神经网络+大训练集+高速计算硬件,超过了其他一切已知的算法。最终,他们的三人团队以巨大优势,夺得了2012年第三届 ImageNet 算法比赛冠军。
这件事轰动了业界,各大互联网公司纷纷邀请辛顿和他的学生加入。百度也伸出橄榄枝,邀请辛顿担任首席科学家,但是最后输给了谷歌。
2013年,谷歌以4400万美元收购了辛顿成立的空壳公司,将辛顿、亚历克斯、伊尔亚三个人一起招入麾下。
2017年,亚历克斯辞职,现在一家创业公司研究 AI 技术。
(4)伊尔亚·苏茨克维(Ilya Sutskever, 1986-)

伊尔亚·苏茨克维出生于前苏联,后去了以色列,然后来到加拿大。他是亚历克斯·克里泽夫斯基在多伦多大学的博士同学,也是辛顿的博士生。
他与亚历克斯组成团队,共同赢得了2012年的 ImageNet 算法比赛。辛顿作为指导老师,也是团队一员。
他在2013年跟随辛顿加入谷歌,2015年辞职,成为 OpenAI 的联合创始人和首席科学家,后来是 ChatGPT 的主要作者之一。2024年,他离开 OpenAI,现在创立了自己的 AI 公司。
(5)安德烈·卡帕斯(Andrej Karpathy,1986-)

安德烈·卡帕斯出生于斯洛伐克,15岁随家人来到加拿大,在多伦多大学读完了本科。
他跟伊尔亚·苏茨克维很可能大学里就认识。但是,他没在多伦多大学读博士,而是去了斯坦福大学,指导老师就是李飞飞。
他的方向也是卷积神经网络,博士期间开设了斯坦福大学第一门深度学习课程,担任主讲。
2015年,他跟随伊尔亚一起加入 OpenAI,成为主要研究人员。
2017年,他离开 OpenAI,去了特斯拉,担任特斯拉 AI 总监,2022年离职。
(6) 总结
上面五人是神经网络算法的主要创立者和推动者。没有他们,就不会有今天的 AI 大模型。
但是,单单靠他们的算法,AI 不会成功。因为算法需要大量的数据进行训练,而训练需要高速计算的硬件。这三者缺一不可。
只有等到2012年,才万事俱备。神经网络算法 + 李飞飞的 ImageNet 训练集 + Nvidia 高速显卡,同时出现了。
历史于是翻开了新的一页,AI 时代正式来临。
第 348 期:李飞飞,从移民到 AI 明星
大家知道李飞飞吧,AI 的明星教授。

她在斯坦福大学任教,是美国国家工程院等三院院士,担任过斯坦福 AI 实验室主任,以及谷歌云 AI 首席科学家。
她1976年出生于北京,在成都长大,16岁全家移民美国。
我一直好奇,她怎么走上 AI 这条路,从移民变成学术明星?

这几天,我读完她的自传《我看见的世界》(中信出版集团,2024),才发现她的人生很有戏剧性,每当重要关头,都有幸运的事情发生。
(1)高中阶段
她出生于一个普通家庭,中学阶段并无过人之处。
我们家位于成都当时的外环路旁边,小区由三栋一模一样的塔楼组成,我家住在四楼。这个环路是不断扩张的城市边缘,一侧是工厂,另一侧是农田。
我进入了一所吸引全市优秀学生的中学。在那几年里,对女孩的预设和偏见让我越来越不耐烦,这种情绪已经超出了课业的范围。在同龄人中,我已经有“假小子”的称号。
1992年,移民美国后,她家的生活顿时变得困难。一家三口挤在新泽西乡下一间一居室公寓,她睡客厅,床就放在餐桌旁边。
父亲在一家华人商店修理旧相机,后来被辞退,从此失业。母亲做杂货店营业员,后因风湿性心脏病,回家休养。李飞飞下课后,就要去打工,有时在中餐馆端盘子12个小时,每小时2美元。
最后,实在走投无路,她们家决定买下社区的一家干洗店,靠洗衣为生。买下干洗店需要10万美元,全家仅有2万美元储蓄,其余8万美元都是借的。
(2)大学阶段
1997年,李飞飞中学毕业,要申请大学了。
一开始,我的目标大学主要是州立大学和社区大学,而不是常春藤学校。但我一直对一所顶级高校念念不忘,那就是普林斯顿大学。
我们是一个靠从车库市场淘来的旧货才能勉强度日的家庭,连我用的计算器都是坏的,我们怎么可能负担得起常春藤学校的学费呢?
尽管如此,我还是无法抑制内心的冲动,提交了申请。就算只是象征性地申请一下,我也感觉具有特殊意义。
她申请了普林斯顿大学,结果好梦成真,普林斯顿给了全额奖学金。
如果没有全奖,以她家的经济状况,负担不了学费。如果不去普林斯顿大学,她就不太可能走上学术道路了,更不要说后面的成就了。
(3)博士阶段
大学毕业后,李飞飞原想去华尔街工作,解决家庭的经济问题。
母亲鼓励她,继续追求自己的梦想。于是,她选择去加州理工学院读研究生,方向是视觉识别机制。
2004年,李飞飞为了写博士论文,需要图片材料,来训练算法。她找了9000张图片,组成了一个图片集,手工对每张图片进行分类标注,一共分成101类。
这个图片集叫做 Caltech 101,算法经过训练,就能从新图片识别出这101类物品。她因此顺利拿到了博士学位。
(4)助教阶段
博士毕业后,李飞飞先去伊利诺伊大学,后去普林斯顿大学,都是担任计算机科学的助教。
她继续探索视觉识别,想找到一种通用算法,能够识别所有种类的物品,而不是 Caltech 101 那样,只能识别出101类物品。
这意味着她需要一个超大的图片训练集,能够包含了世界上所有物品。这可太难了,所有人都反对这件事。
我们都是年轻的助理教授,所处的院系竞争激烈,在事业起步的那几年里,我们都面临着“要么发表论文,要么完蛋走人”的局面。压力之下,我们必须马不停蹄、保质保量地完成工作,因为我们知道,稍有懈怠就可能与终身教授的职位说再见,一同失去的还有获得稳定生计的最佳机会。
我听到的劝阻之声已经多得够我用一辈子了(可能下辈子也够了).
有上万个类别的数据集有什么用?大部分模型连一两个类别都识别不准!
你知道用这么多图像训练一个模型要花多长时间吗?这个时间可是用“年”来计算的。
别人要怎么下载呢?你这个图像总量比大多数硬盘的存储量还要大。
具体怎么做,你有计划了吗?几百万张图谁来做标注?要花多长时间?怎么验证所有内容的准确性呢?
(5)ImageNet
李飞飞坚持要做,这个通用图片集起名为 ImageNet。那时是2006年。
她想到一个思路,英语词典有一些基本名词,用来解释其他所有物品。只要统计一下,基本名词有多少个,每一个又有多少变体,那就得到了所有物品的基本类别。
统计结果是3万类。因此,李飞飞估计,ImageNet 将有3万个类别,总共包含2000万张图片,每张图片都要有分类和标注,需要从几亿张图片里面筛选出来。
我们发出了邮件,招募愿意帮忙从网上下载和标注图片的本科生,工作时间灵活,每小时10美元。我们招募到一些学生,但是按照这样的进度,完成整个项目需要19年。
这太慢了,项目方法做了改进,用脚本自动去谷歌搜索图片,然后抓取。但是这样也需要人工核对和筛选,只把19年的时间缩短到18年。
幸运的是,亚马逊刚刚发布了众包平台“土耳其机器人”(Amazon Mechanical Turk,AMT)。在这个平台上,你可以出钱,通过互联网,把任务分包给世界各地接活的人。
他们通过这个平台,将 ImageNet 分包出去,投入的人数一下子扩展到几千人,而人均费用只是原来的几十分之一。
2009年6月,ImageNet 的初始版本终于完成了。我们成功达成了目标:收集了1500万张图片,涵盖了2.2万个不同类别。这些图片筛选自近10亿张候选图片,并由来自167个国家的4.8万多名全球贡献者进行了标注。
(6)ILSVRC 算法竞赛
ImageNet 虽然完成了,但在学术界毫无反响,没有太多人关注。
我们遇到了第一个也是最严重的挫折:在当年的“计算机视觉与模式识别大会”上,ImageNet 被降级为“海报展示”。
所谓的“海报展示”是一个学术术语,意味着我们将不能在演讲厅内向听众展示我们的工作,只能在会场的指定区域里摆放一幅印有项目摘要的大幅海报,希望能引起路人的兴趣。
我想过 ImageNet 可能被证明是对的,也可能被证明是错的,对于这两种可能性,我都做好了准备。无论是哪种结果,都会是一个学习的机会。然而,我万万没想到,它被忽视了。
由于 ImageNet 得不到承认,李飞飞想到一个办法,她要每年举行一次算法比赛,看看哪种算法识别 ImageNet 图片集的正确率最高。
这样一来,在计算机视觉领域,ImageNet 就会成为一个比较基准,各种算法都需要用它表示自己的识别能力,大家就不会忽视它了。这个比赛叫做 ILSVRC(ImageNet 大型视觉识别挑战赛,ImageNet Large Scale Visual Recognition Challenge)。
2010年,第一届比赛令人失望,11个团队提交了35个参赛算法。冠军算法是传统的图片向量比较,并无创新之处,正确率也不高。
2011年,第二届比赛更惨,获胜算法还是图片向量比较,正确率只提高了2个百分点。这意味着,没有任何创新和进展。
最糟糕的是,参赛人数也出现急剧下降,参赛算法从35个减少到15个,愿意为此付出努力的人似乎越来越少。
说这种经历“让人羞愧”已经远远不足以描述我们的心情了。为了推动 ImageNet 的发展,我们倾注了多年的心血,搜集的图片数量远远超过以往的任何数据集,还精心策划了一场国际竞赛来探索它的能力,但结果却只是简单地重复了现状。如果说ImageNet 是一场赌注,是时候开始思考我们是不是已经输了。
眼看这个项目就要失败了,几年的心血付之东流。就在这个时候,李飞飞人生最大的惊喜和反转来临了。
2012年,第三届比赛,一个加拿大团队使用被学术界遗忘已久的卷积神经网络,一举将图片识别正确率提高了10%。
接下来的事情,就是被写进教科书的历史了。全世界被神经网络的效果轰动了,AI 研究出现突破,人类进入 AI 时代。
李飞飞彻底翻身,一举成名,从助教变成世界知名的 AI 研究领头人物,人生从此海阔天空。
她的故事令人感叹,如果神经网络算法没有在2012年出现,而是再晚几年,或者更早一点,亚马逊的土耳其机器人众包平台没有在2005年诞生,一切会怎样?
这就是时运吧。科学家的人生和科学发现一样,都是由一些偶然事件推动的。个人奋斗固然重要,但是关键时刻还是离不开幸运。
第 347 期:冷启动的破解之道
新软件有一个超级难题,就是发布的时候,没有用户。
这叫做“冷启动”,比喻汽车在冬季发动,天寒地冻,很难点火成功。
我最近读了一本书,专门研究这个问题,新软件怎么才能有用户?
书名就叫《冷启动问题》(The cold start problem)。

它的作者是安德鲁·陈(Andrew Chen),美国著名的风险投资家。

他自己创业过,也做过高管,还投了很多创业公司。
他觉得,冷启动是创业公司的头号难题。做出产品不难,找到用户才难。
只有解决冷启动,用户不断增长,项目才能生存和发展。
这本书的有些论断,让我感到很有意思,跟大家分享。
第一点,他提出,解决冷启动,要靠网络效应。
什么是网络效应?就是通过人与人的连接,增加产品粘性,吸引并留住用户。
最好的例子就是电话。电话也是冷启动,早期只能跟一个固定对象通话,就像对讲机,想用的人很少。
只有组成电话网,它才变得真正流行。入网的用户越多,越能留住用户。
说白了,网络效应就是你的产品要有这样一个功能,能让用户之间产生连接。
第二点,新产品发布的时候,最好自带一个“原子网络”。
原子网络就是最小用户网络,以最少的用户数量,让网络功能生效。
你找亲戚朋友也好,花钱拉人也好,总之要组成一个原子网络,让新用户一进来,就能感受到一个已经生效的用户网络。
第三点,原子网络的大小,根据产品不同而不同。经验法则是,原子网络应该让新用户可以坚持使用3分钟。
如果低于3分钟,就表示网络功能太弱,可能不足以留住人。
(1)Uber:网约车的原子网络应该包含15-20辆车,让用户能在3分钟内叫到车。
(2)Airbnb:民宿的原子网络应该包含300套房子,也就是300个房东,供用户挑选。
(3)reddit:社区平台的原子网络应该有1000个子频道,让不同的用户都能找到感兴趣的频道。
(4)Slack:讨论群组的原子网络应该有3个人,并已经产生了至少2000条消息。
第四点,有些产品只是单纯的工具,不具备人际网络属性,怎么办?安德鲁·陈认为,如果产品没有网络属性,就要加上。
用户为工具而来,为网络而留。
Instagram 最早只是一个照片滤镜 App,根本留不住用户,人们用了几次就走了。
后来,它转型成照片分享网络,添加订阅机制,让你订阅其他人的照片,一打开就看到好友的照片流。
这个变动让 Instagram 上线 18 个月后,被 Facebook 以10亿美元收购。
其他例子还有,Yelp 最初是一个本地商家的目录工具,后来变成了商家评价网络。LinkedIn 最初是一个在线简历工具,后来变成了职业人脉网络。
总之,你想要网络效应,就必须变成网络。
第五点,只要(一个细分市场的)用户网络达到2万人,就能自己不断变大,最终覆盖整个市场。
也就是说,2万用户是单一市场的阈值,突破这个数量,就渡过了冷启动。
第 346 期:未来就是永恒感的丧失
有一类人叫做未来学家(Futurists),专门研究未来。

这类人通常很快被忘记,因为他们的预测基本不准。就算偶尔说对了,后人也会觉得稀松平常。
历史上最著名的未来学家,大概是一个叫做阿尔文·托夫勒(Alvin Toffler,1928—2016)的美国人。

上个世纪七十和八十年代,他写过很多预测未来的书,非常畅销。1983年,国内就引进了他的书,轰动一时。
时过境迁,现在几乎没人提他了。
前些日子,一个朋友对我说,你可以去看看他的书,居然没有完全过时。
我看了一些片段,很震惊。这些片段根本不像写于半个世纪之前,更像写于现在。

托夫勒的第一本书,叫做《未来的冲击》,写于1970年,国内有中文版。
下面就是他的主要观点。大家一定要记住,这些话写于1970年,那个时候还没有信息革命,既没有个人电脑,也没有手机和互联网。
托夫勒认为,人类以前是农业社会,现在是工业社会,即将进入超工业社会。
超工业社会有两个特征。
首先,工业人口只占少部分,大部分人从事脑力劳动。
其次,即使少部分人从事工业,生产出来的工业品,也大大超过需要。
那么,问题就来了。如果50%、甚至40%的工业生产能力,就能生产出满足所有人需要的工业品,那么会怎样?
托夫勒说,为了消化掉多余的工业品,结果就是加速。社会开始让消费加速,让技术也加速,最终让商品的流通速度变快,只有这样才能消费更多的商品。
这意味着,人类社会将变快。我们生活的根本特征,不再是持久,而是短暂。
(1)生活用品变得短暂,越来越多一次性产品:一次性筷子,一次性圆珠笔,一次性塑料瓶,甚至一次性衣服。
(2)即使长期使用的产品,也在快速升级换代。微波炉、洗衣机这样的耐用消费品,人们也只要今年的型号,不要去年的型号。
(3)社会充斥着速成食品、速成教育,甚至城镇也可以速成。
(4)知识短暂化,用过即弃。
(5)工作变得短暂。职位、公司、甚至行业,随时都会消失,新的部门和行业不断涌现。
(6)生活环境变得短暂。人们经常搬家,不会在一个地方久居。
(7)人际关系变得肤浅。人与人之间很难产生稳定深入的关系,交流持续的时间缩短,更多的是偶遇和点头之交。
(8)人们面对快速变化,内心感到疲惫和衰弱,情绪变得不稳定,精神病人变多。
总之,未来的根本特征,就是永恒感的丧失,取而代之的是短暂感。
第 345 期:HDMI 2.2 影音可能到头了
今年一月,有一个消息,大家可能没关注,那就是 HDMI 接口发布了2.2版。

今天说说这件事,我冒着打脸的风险,猜测一下,这个标准可能到头了。
HDMI 接口是最常见的影音接口,每个人应该都接触过,电视机和显示器一般都用它连接信号源。

这个接口一直在升级,每次升级都会提高信号的传输速率。
- HDMI 1.0-1.2(2002):4.9Gbps
- HDMI 1.3-1.4(2006):10.2Gbps
- HDMI 2.0(2013):18Gbps
- HDMI 2.1(2017):48Gbps
- HDMI 2.2(2025):96Gbps
从上表可以看到,HDMI 接口的每次升级,信号的传输速率都会翻倍。这是为了应对现在的视频,越来越高清,数据量越来越大。
这一次,从2.1版升级到2.2版,速率从 48Gbps 加大到 96Gbps。
96Gbps 这个速率,大到吓人。
这是什么概念?最快的家庭网络现在是万兆网络(10Gbps),一般人根本不需要这么快,而 HDMI 2.2 比它还快10倍!
这是最快的影音接口,即使目前最高清晰度的视频,它可以同时传输多部,还有多余的带宽。

问题是,你用不到它。4K + 60帧 + HDR10 或杜比视界效果的视频,只需要 HDMI 2.0 就能实时传输。
8K + 60帧的视频,要用到 HDMI 2.1,而 HDMI 2.2 支持 12K + 60帧的视频。
可是,人们真的会在电视机上观看 12K 分辨率的视频吗?

大家可能听说过一个词“视网膜分辨率”(retina display),指的是人眼能够感知的最高分辨率。
超过这个分辨率,人眼就感知不到清晰度的提高,再提高分辨率就毫无意义。
2010年,乔布斯在发布 iPhone 4 时,提出了这个概念。他说,正常距离25-30厘米时,肉眼感觉不出 iPhone 4 屏幕的像素点。

视网膜分辨率跟两个因素有关:观看距离,屏幕大小。
屏幕越大,距离越近,所需要的分辨率越高;屏幕越小,距离越远,所需要的分辨率越低。
国外有人计算过,普通的家庭影院,坐在距离3.6米的地方,观看 12K 视频,屏幕可以大到550英寸,也能达到视网膜分辨率。
550英寸相当于宽12米,高6.8米,也就是广告牌大小!

换句话说,小于550英寸的屏幕,根本不需要 12K 分辨率。即使用到了,也是浪费,因为肉眼分辨不出这样的清晰度。
所以,普通家庭根本不需要 12K 分辨率。客厅里面,4K 电视机就能达到视网膜分辨率。
现阶段,视频效果的提升,主要已经不是通过分辨率了,而是通过色彩准确度、对比度(动态)等指标了。
音频也是如此。对于一般人的耳朵,CD 音质已经接近立体声的听觉极限,再提高也分辨不出来。它只需要 USB 2.0 (480Mbps) 就可以实时传输。
总之,影音标准在技术上还可以继续提高,但是人类的感官是有极限的。现有的技术已经达到感官的极限了,传输速率再提高,收益只会越来越少。
反正,我想象不出来,如果未来推出 HDMI 的2.3版或3.0版,传输速率将有多大,又是要满足怎样的场景?
第 344 期:制造业正在“零工化”

她主要研究劳动经济学,也就是劳动力问题。
她注意到一个现象:零工越来越多。
所谓“零工”,就是不与用人单位签订劳动合同,也不缴纳社保的工人。
这里面包括两种情况。一种是派遣工,合同是跟人力中介签的。另一种是真正的零工,没有任何劳务合同,又称“日结工”(当日结算工资)。

正常情况下,零工是少数,大部分员工应该是正式的长期工。
但是,现实情况恰恰相反。制造业自动化以后,零工不减反增。越来越多的长期岗位消失,变成短期的零工岗位。

张丹丹团队调查了长三角和珠三角,发现工厂的零工非常普遍。
以江苏省昆山为例,“那里聚集了上千家劳务和中介机构,每天向当地及周边的数千家大规模制造业企业输送劳动力,日均进厂工人数高峰时可达数万。”
他们调查的企业里面,派遣工占企业用工的比例,平时是1/3,旺季可以高达2/3。那些万人大厂,派遣工比例更高达80%。
这很惊人,意味着,工厂的主要劳动力是零工,那种干几天就走的工人。
根据他们估算,中国制造业的派遣工已经达到了4000万人,占从业人员的31.12%。也就是说,三个工人里面就有一个是零工,并且还在增加。
为什么中国的制造业大量使用零工?文章分析了六个原因。
(1)自动化增加了低技能岗位。机器容易替代中等技能岗位,反而是低技能岗位尚难以替代。对于这些岗位,企业倾向于招零工。
(2)招工平台极大方便了零工的招聘。企业只要网上发布招聘信息,就能快速找到人。
(3)消费市场存在季节性波动。制造业的用工需求是周期性的,旺季人手不够,淡季有冗员。零工能够满足临时的用人需求。
(4)城乡二元户籍制度,使得外来务工者倾向于短期岗位。很多打工者来自外地,没有当地户口,享受不到当地的社会福利。这使得他们更愿意“多拿工资、少缴社保”的零工(由于不缴社保,零工的日薪高于长期工)。
(5)企业降低用工成本。通过劳务派遣、劳务外包等方式招聘零工,企业的成本更低。而且,派遣工由劳务中介机构管理,企业无需直接承担解雇成本,能够更灵活地调整用工规模。
(6)市场的不确定性,加剧了零工化。国内经济和国际市场不确定性增加,使得企业不敢冒然招聘长期岗位。
上面六点原因将长期存在,因此零工化是不可避免的趋势,零工的比例还将进一步上升。
我分享这个研究,主要目的就是,希望大家意识到这一点。不仅是制造业,以后软件业大概也是这样,长期的工作岗位越来越少,职位短期化将是常态。
当然,这对劳动者不利。很多零工岗位是随时走人,或者项目结束走人,要是没有劳动合同,不交社保,权益难以保障。而且,零工岗位很多是高度细分的低技能岗能,劳动者无法积累人力资本。
张丹丹呼吁,政府要重视这个问题,更好保障零工的权利,一是加强零工的社保,规范企业用工,二是加强零工的教育培训,防止劳动者被低技能的零工岗位长期困住,无法找到更高报酬的工作。
第 343 期:如何阻止 AI 爬虫
AI 大模型公司,正在疯狂收集训练数据。
它们派出无数爬虫,在互联网上无节制地抓取数据。爬虫数量之多、频率之高,堪比 DDoS 攻击。

上周,代码托管网站 SourceHut 的站长,公开发表文章(下图),痛斥 AI 爬虫太过份,服务器无法承受访问压力,中断服务。

他非常生气,这些爬虫根本不遵守 robots.txt 文件,Git 仓库的每个页面、每个链接、每个提交都要爬取。
它们来自全球数万个 IP 地址,用户代理(user-agent 字段)也是随机的,伪装得像真实用户,难以有效拦截。
最可气的是,它们今天爬完了,过了六小时,又来爬同样的内容!
每一周,他要用20%~100%的工作时间,处理这些爬虫造成的服务器压力。SourceHut 已经中断服务好几次,对于一个 SaaS 工具,这是致命的。
最后,他说不只他遇到这种事,整个行业都深受其害。
“我的系统管理员朋友,都在处理同样的问题。每次我坐下来和他们喝啤酒或吃晚餐时,我们很快就会抱怨机器人。这些对话中的绝望是显而易见的。”
那么,有什么办法,可以对付这些 AI 爬虫?
最简单的方法,就是使用 Cloudflare 公司的免费防护,它的 CDN 可以帮你挡掉 AI 爬虫。
但是,有些企业级服务不适合使用 Cloudflare,这时你就必须自己来挡爬虫。
今天,向大家介绍一个专门对付爬虫的工具 Anubis。

它是一个采用工作量证明的反向代理。所谓反向代理,就是目标网站的所有访问请求,都会重定向给它。
你首先要架设一个它的实例,然后把这个实例放在目标网站之前,当作反向代理(比如像下面设置)。
reverse_proxy http://localhost:3000
于是,用户访问网站时,首先看到不是目标网站,而是 Anubis 的页面(下图)。

这个页面会在用户的浏览器上,执行一段 JS 程序,进行大量的数学计算。直到计算答案正确,才可以访问目标网站。
这个过程有时很耗时,可能需要1~2分钟。

(图片说明:上图的手机浏览器用了1分53秒,才计算完毕。)
对于爬虫来说,如果每个请求都要耗费大量计算,才能拿到数据,这会极大地消耗它的服务器资源,从而达到阻止爬虫访问的目的。
当然,真实的访问者也必须完成这样一个计算,这非常影响使用体验。但是,总比听任爬虫造成访问中断要好。
那么,Anubis 到底让爬虫计算什么?
具体来说,就是下面这行代码,计算一个哈希值。
const hash = await sha256(`${challenge}${nonce}`);
可以看到,它就是用 SHA256 算法,计算一个字符串的哈希值。
这个字符串由两部分组成,第一部分challenge,由用户的一些公开信息连接而成,包括用户的 IP 地址、浏览器 user-agent 字段、当前日期、Anubis 的公钥等。
第二部分nonce,表示迭代次数,第一次计算就是1,第二次计算就是2,以此类推。
Anubis 的默认设定是,计算出来的哈希值的前五位必须都为0,否则 nonce 自动加1,再次进行计算,直到满足要求为止。
有时,可能需要计算几百万次,才能得到合格的哈希值。熟悉比特币的同学,应该一眼看出来了,这就是比特币的算法。比特币是非常耗费算力的,所以 Anubis 也能很有效地消耗爬虫的 CPU。
当客户端终于算出满足要求的哈希值时(前五位为0),就会把这时的 nonce 值传给 Anubis 实例服务器,让后者验证哈希值是否正确。没问题的话,Anubis 就会将客户端重定向到目标网站,并在客户端写入一个 Cookie,以免后续请求再触发工作量验证。
这就是阻止爬虫的整个过程,不知道说清楚了没有,原理很简单,实施也不难。
事实证明,它很有效。一个站长说,两个半小时内,他的网站总共收到了81000个请求,其中只有3%通过了 Anubis 的工作量证明,这意味着97%的流量可能都是机器人!
这太疯狂了,可见现在的 AI 爬虫有多猖獗。如果你的网站也遇到了同样问题,又没法使用 Cloudflare,那可以试试 Anubis 的工作量证明。
第 342 期:面试的 AI 作弊——用数字人去面试
面试的 AI 作弊:用数字人去面试
大家肯定想到了,AI 的能力现在这么强,一定有人用来作弊。
求职作弊是最简单的,求职信和履历都可以让 AI 生成,但是你未必能想到,面试也能 AI 作弊,派一个数字人来面试。
“数字人”技术几年前就有了,现在添加了 AI,简直如虎添翼,可以乱真。
网上有很多教程,教你怎么生成数字人,哪怕不懂软件,都可以跟着做出来。



只要上传脸部照片和语音片段,AI 就会生成你的数字化身,它跟你长得一模一样,用你的声音和表情说话。你让它说什么,它就说什么,就像下图这样。

现在,很多公司采用视频面试,尤其是招聘远程员工,可能只有视频面试,根本没有线下面试。
数字人既然跟真人长得一样,当然可能冒充真人参加视频面试。
最近,网上就爆出了一个真实的案例,波兰的一家创业公司遇到了数字人参加面试。
这个叫做 Bratislav Rakočević 的应聘者,有着非常详细完整的 LinkedIn 主页(下图)。

简历也毫无问题(下图),看上去很有说服力,罗列了掌握的前后端技能,申请职位是全栈工程师。

顺理成章,他就进入了视频面试。面试官见到本人(下图右)时,就觉得跟网页头像(下图左)不太像。

而且,他使用了背景滤镜,整个人的影像是提取出来的,贴在背景上,头部边缘显得模糊而不自然。面试官当时也没有多想。
他的面试表现极佳,任何问题都能快速应对,在规定的2小时内完成了所有编码题目和后续提问,这是前所未有的。
但是,在交谈过程中,面试官逐渐产生了怀疑。首先,按照简历,这个人在塞尔维亚读大学,但是却不会说塞尔维亚语,只会说英语。(事后推测,原因很可能是,他的语音引擎没有塞尔维亚语,或者不如英语逼真。)
其次,他的英语缺乏语气语调变化,说话没有沟通技巧,让人感觉有点机械。
最后,他对以前职位的细节,说得不清楚,难以令人信服。
为了测试这是否真人,面试官临时加了一个项目。

面试官做了一个示范动作,举起一只手,张开五个手指,挡住自己的脸部,要求应聘者照着做(上图)。
结果,应聘者说了一堆理由,拒绝了这个要求。至此,面试官确定,对面是一个 AI 数字人。
他们把这件事公开到网上,希望其他公司提高警惕,不要被骗了。
这样的数字人面试,以后肯定越来越多,怎么应对呢?
下面是一些破解方法。
(1)要求应聘者给出推荐人,以供联系核对。
(2)查找应聘者的网络活动痕迹。如果网上根本搜不到什么痕迹,就说明很可疑。
(3)除了视频面试,再安排一场线下面试。
(4)在视频面试中,要求应聘者做一些数字人无法处理的事情,看看有没有破绽。比如,站起身围绕摄像头转一圈,头部前后左右转动,以及举起手做一些动作。
第 341 期:低代码编程,恐怕不会成功
这十几年,一批批程序员前仆后继,去搞低代码编程(包括无代码编程)。光在我身边,就有三四批。

他们搞的低代码编程,我理解就是通过图形界面,拖拉各种组件,自动生成软件 UI 的底层代码,减少手工编码。

这个想法很好,确实很多人需要,尤其不懂编程的人,这简直是生成程序的唯一可用方式。
但是很奇怪,他们无一例外都失败了,开发出来的低代码工具,开始还有一些好奇的用户,很快就不来了,用户越来越少,后来即使开源了,也没人用。
更奇怪的是,这似乎不是偶然现象,业界所有的低代码工具好像都不成功,至少我想不出成功的例子,哪一个受欢迎的应用程序是用低代码工具生成的。
它的背后有什么原因吗?是哪里没有做对,还是低代码编程本身就不可行?
我一直没有想通这个问题。虽然不看好,但是依然抱有一丝幻想,也许某一天醒来,低代码编程就成了主流,无论手机 App 还是桌面应用,鼠标拖几下,就可以生成。

直到上周,我读到一篇文章《低代码编程受困于形式》(下图),才恍然大悟,低代码编程有先天缺陷,恐怕不会成功。

文章说,优秀的作品都是形式(form)和功能(function)的统一。形式必须服从功能,功能决定了形式,英文叫做“form follows function”。

对于优秀的程序员,只要弄清楚了底层,UI(用户界面)就会显而易见。
低代码编程的问题在于,它是先有 UI(形式),再有代码(功能)。
用户先拖拉生成 UI,系统再根据 UI 生成代码。这是本末倒置,让底层代码适配 UI,注定了两者都有问题:UI 是空想出来的,代码为了适配 UI,注定冗余和低效。
所以,优秀的软件不可能用这种方式生成,低代码编程不会成功。
我认为,他说的很有道理。低代码编程解决不了这个根本缺陷,适用场景有限,大概只适合一些简单任务,或者生成原型,不会成为主流工具。程序员应该谨慎开发这类工具,付出的劳动很可能打水漂。
写到这里,问题就来了:AI 算不算低代码编程(或者无代码编程)?如果低代码编程不会成功,那么 AI 编程会成功吗?
我认为,AI 不同于低代码编程。低代码编程是使用者给出 UI,系统来生成代码,而 AI 是系统同时生成 UI 和代码,用户只需要说出需求即可。
这种情况下,形式与功能的结合,完全取决于 AI 的能力。如果有一天,AI 视频能够成功,画面美,情节好,那么 AI 编程大概也会成功,生成形式与功能统一的应用程序。
第 340 期:技术炒作三十年
大家有没有发现,每隔一段时间,媒体就会大肆炒作一种新技术,宣扬它将对人类产生巨大影响,全社会都在关注,人人都在谈论。

这种炒作就是大家常说的“风口”吧。突然之间,风就起来了,如果正好站在风口,猪也能飞起来。
你能举出多少个这种炒作的例子?
一个国外程序员根据回忆,列出了过去三十年主要的几次技术炒作。
- 1998-2001 年:互联网 WWW
- 1999-2006 年:Java
- 2004-2007 年:Web 2.0
- 2007-2010:云计算
- 2010-2015:社交媒体
- 2012-2015:物联网
- 2013-2015:大数据
- 2017-2021:区块链
- 2021 年至今:人工智能
大家觉得,这个时间列表是否准确?

我的亲身感受是差不多。这是主要的几次技术炒作,而且这些技术都成功了,所以炒作的时间才会持续这么久,两年到五年,然后被下一个热点取代。
当中,还有许多次小的技术炒作,但都没有那么成功,持续时间就没有这么久,很快退潮了,比如元宇宙、Web 3、AR/VR 眼镜、3D 打印、自动驾驶等等。
一种新技术能够带来大规模、长时间的炒作,有一个前提条件,那就是它有真东西,确实能对社会经济带来非常有感的变化。
上面列表的每一种新技术,确实都是大的突破,改变了技术方向,没有一个是虚的。如果再加上智能手机、短视频、加密货币,可能就把最近三十年大的技术“风口”都包括了。
我以前有一个误区,看不起技术炒作,认为那只是一窝蜂的音浪,跟娱乐版的明星炒作没什么不同。
人到中年,我才意识到,这种观念大错特错,技术从业者千万不能有这种想法。每一次技术炒作,不仅是音浪,更是机会,会带来空前的关注、疯狂涌入的资金、以及切切实实的需求。炒作规模越大、程度越厉害,带来的机会和资金也就越大。
每一次大规模的技术炒作,都会诞生一些快速增长的指标公司,创造巨大的财富效应。如果你正好身在其中,事业和财富都会随之起飞。
让我们现实一点,一个工程师最有技术生产力、创造力、事业起飞的时间窗口,就只有那么几年。如果个人事业要快速起来、为未来铺好道路,光有技术还不够,还必须赶上至少一个大的技术风口,用外部的资金和需求放大个人努力。
否则,单靠自己的成果积累,就太慢了,很难快速到达更高的层次,很可能辛辛苦苦干了二十年,还是在做一些基础的事情。如果出现技术升级,使得你的技能过时了,后面的路就难了。技术风口其实是实现个人阶层飞跃、人生翻转的最可行的路径。
所以,每一轮大的技术风口并不完全是一哄而上的炒作,里面包含了一些真正的机会,值得关注和跟上。这也是为什么周刊每一次都对新技术倍加关注、积极评价的原因。
当然,赶上技术风口的前提,还是要有真才实学,能做出实打实的产品。否则,真遇到风口,你也无法脱颖而出,拿到技术炒作的红利。
第 339 期:代币是什么
现在,媒体经常出现一个词“代币”(token),今天就来谈谈这是什么?

首先声明,代币属于加密货币,有交易市场。我完全不想碰这一块,只想谈谈它们的原理。
大家读了就能理解,它们为什么可以发行,可以交易。作为技术实验,这是很有意思的。
我想谈这个题目,是因为前些日子读到一篇文章《去金融化与超金融化》,让我想通了代币与金融的关系。

加密货币的起源,与纸币的弊端有关。纸币(比如美元)都会越发越多,形成通货膨胀,长期中贬值,购买力不断下降。
人们因此不愿意持有现金,而是想法设法保值增值,从而形成“金融”活动,比如储蓄、投资、购买房产等等。
所以,金融就是现金的对立面,货币越发越多,人们越不愿意持有现金,导致金融活动也越来越多。

比特币的最初动机,是创造一种无法增发的货币机制。由于比特币总额是确定的,所以如果把它当作货币,就肯定不会发生通货膨胀。
因此,人们会愿意持有比特币现金,而不是拿它去消费和投资。由此推论,比特币的世界应该没有太多的金融活动,它可以“去金融化”,减少金融投资的规模。
但是,没有想到,后来出现了“以太坊”。

以太坊跟比特币一样,建立在区块链之上,区块链可以看作是一个写入后无法修改的公开账本。此外,它还有一个比特币没有的特点,就是“智能合约”。它允许用户写自己的程序,放上区块链,让区块链去执行。
这意味着,用户可以基于“智能合约”,在区块链上发行自己的代币。比如,你在区块链上写入一条记录(可以是任意内容),然后用智能合约规定,这条记录的所有权分成10000份(即关联10000条子记录),每一份都可以单独交易。
这样一来,你就创造了一种自己的代币,总额为10000份。你对外出售这些代币,只要有足够的人愿意买,就会形成这种币的交易市场。
这里的关键是,你写入区块链的原始记录,可以是“任意内容”。这意味着,任意东西都可以代币化,比如一条笔记、一段录音、甚至一件衣服,都可以发行成代币,只要保证写入区块链的内容能够代表原始物品即可。
根据这个原理,就出现了各种奇奇怪怪的代币发行,比如狗币、猫币、月亮币、火星币、大蒜币等等。它们统称为 meme coin(中文译为迷因币或模因币)。
代币可以是同质的(每一份可以互相替代),也可以是非同质的,即每个代币都是独一无二,相当于有编号证书。后者称为“非同质代币”,英文为 NFT(Non-fungible token),曾经一度非常火爆。

2022年,一只称为“无聊猿”的猿猴头像,它的一份 NFT 最高价格到过147个以太坊(约42万美元)。本质上,你花了这么多钱,买到的只是区块链上你名下的一条记录,你有权再把这条记录转给其他人,仅此而已。
由于任何东西都能变成可以交易的代币,因此代币创造了一种“超金融化”,即任何东西都变成金融化的可交易资产。
所以,事情就有点讽刺了,加密货币发明的原意是“去金融化”,诞生一种有稳定购买力的货币,现在却变成了“超金融化”,无数原本不可交易的东西,变成了金融资产,从来没有稳定的价格。
第 337 期:互联网创业几乎没了
上周我写了,AI 削弱互联网,网站行业前景黯淡。
发布后,我突然想到,如果这个判断正确,那么,互联网创业也差不多结束了。

我说的“互联网创业”,指的是那些纯粹线上、不涉及线下的创业项目。
大家有没有同样的感觉,互联网创业者正在急剧减少。
我没有数字,但是自己的观察是,投身线上的开发者,一年比一年少。现在,除了 AI 和游戏领域,其他的互联网创业项目几乎没人敢碰。
回想十年前的氛围,简直天壤之别。那时,互联网创业堪称火爆,街头巷尾都在谈论。哪怕还没有一行代码,只要创业计划书写得好,就可能拿到风投。

那时的热门词汇是“互联网思维”,彷佛只要沾上互联网,就有钱景,就可以火箭式增长。

时过境迁,十年前的盛况,如今烟消云散。到了今天,创业意愿低落,创业者少,鼓励你创业的人更少。更多的人劝你求稳,尽量选择体制内或者留在大公司。
就算你还是想创业,寻找风险投资也非常困难。投资者一看是互联网项目,就加倍警惕,一再追问现金流和利润有没有保证。
为什么互联网创业现在几乎消失了?
我看到一篇文章,总结了四点原因。
(1)互联网行业已经成熟了,留给创业者的机会大幅减少。互联网的大部分果实已被摘取,早期的高增长难以再现。真正的创新机会即使还能找到,也会被现有的大公司快速抄袭,不会留给创业者。
而且,AI 大模型出现后,互联网本身都在衰弱,它的创业机会就更少了。
(2)创业的机会成本变大了。一个大厂的高级工程师,现在的薪酬(包括股票期权)超过百万,创业很难打动他了。
(3)风险投资的商业模式难以实现了。风投的模式是,项目高速增长,最终实现上市退出,这越来越难做到了,能够指数式增长的线上项目现在基本找不到。
(4)创业者的生活态度发生了变化。人们比以前更重视生活质量,越来越不愿意接受创业带来的没日没夜的劳作、倦怠、失败的人际关系、心理健康问题。
上面的四条,第一条是根本原因:互联网的高增长结束,行业的机会少了。
Hacker News 社区的一位网友说得好:“浏览器技术已经到头了,通过 HTML 和 JS 在网页上组织信息、创造娱乐,并从中获利,很难翻出新花样了,你能创新的地方非常有限。”
总之,单纯的互联网创业,应该再也不会像以前那样兴旺了,很可能就是社会的平均增长率和回报率。未来互联网的机会更多是与其他行业结合,就好像现在的 AI 创业,很多都是 AI 为主,互联网为辅。
第 336 期:面对 AI,互联网正在衰落
这一段日子,新闻焦点全是 DeepSeek,其他重要事件就不显眼了。
我说的重要事件是,1月23日,就在 DeepSeek R1 模型发布三天后,OpenAI 公司推出了一个新的 AI 工具,叫做 Operator(操作员)。

我认为,这个工具可能预示着,传统互联网的最终衰落。
Operator 与其他 AI 产品截然不同。它不是一个内容生成工具,而是一个自动化工具,能够自动操作网页。
OpenAI 公司展示了一个例子,你对 AI 说,去旅游网站 Tripadvisor 预定评分最高的“罗马一日游”,AI 就自动帮你预定了,你根本不必离开当前窗口(下图)。

大家想一想,这意味着什么?
以前,你要预订一个旅游产品,是这样操作的:首先去谷歌搜索 Tripadvisor 网址,然后访问该网站,找到发布“罗马一日游”的所有旅游社,最终预订评分最高的那一家。
现在,AI 把这些中间步骤都取代了,你不再需要访问谷歌、Tripadvisor 和旅行社的产品页了,AI 帮你自动访问了。
用户的体验就是,我不需要其他网站了,只要有 AI 就够了。
AI 越是强大,其他网站的重要性就越低。
如果未来的 AI 强大到无所不能,那么你有可能不需要访问任何网站,只要对着 AI 提出要求,它都可以帮你操作。
你可以让 AI 帮你买东西、叫外卖、投资证券、播放视频,而不再需要去电商网站、外卖网站、券商网站、视频网站了。
这意味着,传统的、以网站形式存在的互联网将走向消亡。
我看到,一个老外预测,以后的商业模式可能是,各种服务商不直接面对用户,也不搭建网站展示自己了,而是把服务卖给 AI 公司,或者提供 API 让 AI 付费访问。
互联网将不再面向用户,而是面向 AI,因为消费者最终可能只使用 AI。未来的互联网,可能会有一个结构化数据层,取代现在的网站,专门供 AI 使用。
第 335 期:年底的未来已来
大概两周前,我就在想,龙年的最后一期周刊,要写什么?
正好这一个月,有很多新发明、新技术发布。我想到,可以把它们放在一起,作为下一年的展望。
编辑过程中,它们勾起了我的一点回忆。
十年前,我接了一个活,为北京的一家杂志写文章,向普通读者介绍技术的新进展,以此赚一点稿费。写久了,我就有一个感觉,技术进展太快了,快于所有人的预期。我明明写的是真实事件,但是很多时候像在写科幻小说。
就是在那个时候,我开始意识到,那句有名的话是千真万确:“未来已来,只是尚未流行”。那些我们觉得很遥远、很科幻的事情,其实已经是活生生的现实,很快就会强烈地、不可避免地影响每个人的生活,可能是好的影响,也可能是不好的影响(技能过时了,行业消失了)。
2017年,我把那些文章结集,起了一个书名《未来世界的幸存者》,表达我的这种想法,希望读者对即将到来的时代变革有所准备。
十年后的今天,世界仿佛全然不同,我发现自己还在做同样的事情,还在介绍那些像科幻小说一样的真实技术。不同的是,我已经很明白了,为未来做准备,就是在为现在做准备,做一个未来世界的幸存者,就是做一个今日世界的幸存者。
第 334 期:年终笔记四则
下面是过去的笔记,我读到有意思的文章时,记录下来的感想,每一则都不长。
前几天翻阅,觉得可以放在一起,重新发布,今天先发四则。
一、工作也有利息
银行存款有利息,存得越久,利息越多。
工作也是一样,也有利息。如果今年的工作可以节省明年或未来的工作时间,就是一份有利息的工作。

工作有利息,意味着你未来的工作时间会变少,多出来的时间,就可以去做别的事情,创造更多的价值。
这提示我们:
(1)不要轻易更换工作领域,否则以前积累的利息就作废了。只有在同一个工作领域,才可能产生长期积累,以前的工作为以后打基础,最终产生巨大的利息。
(2)在职业生涯的早期,积累效果最好,最容易产生复利。开始积累越晚,产生复利就越少。
(3)有些劳动没有积累效果,不会产生利息,比如重复性的机械劳动(快递、咖啡店员、门卫……),你明年还是要重复做这些事情。
(4)最好的人生策略就是,找到你深感兴趣、可以长期做下去的领域,在上面投入大量的工作时间(包括质量和数量),然后随着年龄增长,享受以前工作的复利。
二、巴菲特的选人标准
巴菲特说,他考察候选人,就看三个“i”。

- integrity(正直)
- intelligence(智慧)
- initiative(主动)
这三个“i”当中,“主动”最重要。“正直”和“智慧”的人到处都是,但如果不主动,不是自己想去做些什么,就什么也不会发生。
三、快乐机
1974年,一个美国哲学家提出一个假设,如果世界上有“快乐机”,只要插上电源,就能带来源源不断的快乐,并且无法分辨,这种机器快乐与现实世界的快乐有何不同。

哲学家说,我们就可以观察人们的选择。
如果大多数人选择快乐机,而不是现实生活,这就证明人生的目标是体验尽可能多的快乐(享乐主义)。
当时因为不可能造出快乐机,所以无法验证他的假设是否正确。现在不一样了,有了游戏机、VR 头盔、短视频平台……
四、未来的三种关键能力
未来,你需要三种能力。
(1)专业能力。你需要有一个专长。
(2)写作能力。未来是远程工作,团队成员分散在各地,以写作——而不是当面交流——作为主要的沟通手段。
(3)视频制作能力。以前,文字能影响大众,现在视频是最强的大众传播渠道。如果你能制作好看的视频,将想法和产品可视化,就更容易让更多用户看见。
第 333 期:一切都要支付两次
有一句古语“书非借不能读也”,大家可能都听过。
它的意思是,很多人买了书却不读,觉得不着急,拥有书就相当于已经开始学了,后面就慢慢来吧,反而是借来的书有急迫感会抓紧读完。

这种事情很多。网址保存成书签,就扔在那里了,再也不去看它了。
我最近看到一篇老外的文章,他给这种现象起了一个全新的名字,让人觉得很贴切。老外的概念化能力真是强。
他提出,人们买书却不读,是因为没有意识到每样东西都需要两次支付。

第一次是货币支付,你付出货币,得到自己想要的东西,比如一本书,一个 App,一辆自行车,一颗卷心菜等等。
但是,你还必须支付第二次,才能真正消费这个东西。这次你付出的是你的时间和努力,来获得它的收益。
第二次支付可能比第一次支付贵得多。假设一本书的第一次支付是20元,第二次支付可能就是10小时的阅读时间。只有支付第二次,你才算真正消费了这本书。如果没有第二次支付,第一次支付就意义不大了,跟把钱扔进垃圾箱差不多。
生活中,到处都是两次支付的例子。购买 App 后,你必须学习如何使用,并且经常使用,才能得到它的价值。购买自行车后,你必须忍受痛苦的初学者阶段,然后才能上街骑行。购买蔬菜后,必须切碎、蒸熟并咀嚼,然后才能为你提供营养。
我们经常犯的一个错误,就是只完成了第一次支付,没有第二次支付,比如未使用的会员资格,未读的书籍,未玩的游戏,未编织的毛线。由于没有第二次支付,所以你并没有真正使用,第一次支付的钱实际上扔进了垃圾桶。
这种行为方式的深层次原因,就是现代社会太强调消费,过于看重第一次支付的经济价值,而忽视第二次支付的实际结果。人们受到消费主义的影响,以为支付了商品价格,就完成了一次消费。
合理的消费方式应该是,只有当你确定会有第二次支付,才进行第一次支付。这样就可以避免许许多多的浪费。
新的一年,大家购买商品时,可以先问问自己,你会不会第二次支付,即会不会为它付出时间和努力?只有确信自己会,再掏钱购买它。
有一种商品,天然支持先进行第二次支付,再进行第一次支付,那就是软件。
软件不同于实体商品,边际成本接近零,又是长期消费,完全可以先让用户免费用(试用版或者试用期),等他用习惯了,再向他收费。
很多软件就是这样做的,这大概就是为什么,软件的不理性消费行为,要比实体商品少得多的原因。
第 332 期:西蒙·威利森的年终总结,梁文锋的访谈
英国程序员西蒙·威利森(Simon Willison)最近两年非常出名,他的个人网站有很多文章,介绍 AI 的最新进展。

本周,他发表了很长一篇的2024年大模型回顾(非官方的中译),非常精彩。

他提到,AI 的发展速度快得难以想象。
一年前的2023年底,排名第一的 AI 模型是 OpenAI 公司的 GPT-4,没有其他模型能超过它。

一年过去了,大家猜猜,GPT-4 现在排名多少?

答案是第69位(上图),已经有18家公司的大模型超过了它。其中的一些模型,甚至可以在笔记本电脑运行。
短短一年,榜首模型就被大量竞争者轻松超过,家用硬件就能达到它的运行效果。AI 的进化速度就是这么惊人。
西蒙·威利森特别提到了来自中国的大模型 DeepSeek V3。

DeepSeek V3 是2024年12月25日发布的,来自杭州的量化基金公司幻方量化。一经发布,它就引起了国际范围的轰动。
它在多个参数上,击败了 OpenAI 公司最新的 o1 模型。目前,它在大模型排行榜上排名第7,要知道前十名里面,只有它是开源模型,而且是最少限制的 MIT 许可证,其他都是大公司的专有模型。

而且,它的运行效率很高,训练成本估计只有 Meta 公司的 Llama 3.1 405B 模型的11分之一,而后者的效果还不如它。这就是说,DeepSeek 找到了高效使用硬件、提高模型效果的方法。
西蒙·威利斯说:“DeepSeek V3 的训练成本不足600万美元,是一个极好的迹象,表明 AI 模型的训练成本可以而且应该会继续下降。”
西方媒体就非常好奇,DeepSeek 是怎么做到的?
幻方量化创始人梁文锋,跟其他 AI 模型的研究者不同,没有海外经历,毕业于浙江大学电子工程系人工智能方向。

西方媒体对他充满了好奇,专门将他以前的访谈译成了英文。
我觉得,原始的中文访谈( Part 1,Part 2)很值得一读,我分享他说的几段话,展示了中国顶级研究者的视野和抱负。
(1)我们要做的不是生成式 AI,而是通用人工智能 AGI。前者只是后者的必经之路,AGI 会在我们有生之年实现。
(2)任何 AI 公司(短期内)都没有碾压对手的技术优势,因为有 OpenAI 指路,又都基于公开论文和代码,大厂和创业公司都会做出自己的大语言模型。
(3)在颠覆性的技术面前,闭源形成的护城河是短暂的。即使 OpenAI 闭源,也无法阻止被别人赶超。我们把价值沉淀在团队上,我们的同事在这个过程中得到成长,积累很多know-how,形成可以创新的组织和文化,就是我们的护城河。
(4)我们不会闭源。我们认为先有一个强大的技术生态更重要。
(5)当前阶段是技术创新的爆发期,而不是应用的爆发期。大模型应用门槛会越来越低,创业公司在未来20年任何时候下场,也都有机会。
(6)过去很多年,很多的中国公司习惯了别人做技术创新,拿过来做应用变现,自己等着摩尔定律从天而降,躺在家里18个月就会出来更好的硬件和软件。我们的出发点,就不是趁机赚一笔,而是走到技术的前沿,去推动整个生态发展。中国也要逐步成为贡献者,而不是一直搭便车。
(7)大部分中国公司习惯 follow,而不是创新。中国创新缺的不是资本,而是缺乏信心以及不知道怎么组织高密度的人才。我们没有海外回来的人,都是本土的。前50名顶尖人才可能不在中国,但也许我们能自己打造这样的人。
(8)我们每个人对于卡和人的调动是不设上限的。如果有想法,每个人随时可以调用训练集群的卡无需审批。同时因为不存在层级和跨部门,也可以灵活调用所有人,只要对方也有兴趣。
(9)我们选人的标准一直都是热爱和好奇心,所以很多人会有一些奇特的经历,很有意思。很多人对做研究的渴望,远超对钱的在意。
(10)我们在做最难的事。对顶级人才吸引最大的,肯定是去解决世界上最难的问题。其实,顶尖人才在中国是被低估的。因为整个社会层面的硬核创新太少了,使得他们没有机会被识别出来。我们在做最难的事,对他们就是有吸引力的。
(11)中国产业结构的调整,会更依赖硬核技术的创新。很多人发现过去赚快钱很可能来自时代运气,现在赚不到了,就会更愿意俯身去做真正的创新。
(12)我是八十年代在广东一个五线城市长大的。我的父亲是小学老师,九十年代,广东赚钱机会很多,当时有不少家长觉得读书没用。但现在回去看,观念都变了。因为钱不好赚了,连开出租车的机会可能都没了。一代人的时间就变了。以后硬核创新会越来越多,因为整个社会群体需要被事实教育。当这个社会让硬核创新的人功成名就,群体性想法就会改变。我们只是还需要一堆事实和一个过程。