第190章 捅破天花板的数学家!
上午九点整,第一场报告准时开始。
主讲人是斯坦福的一位副教授,讲结构化预测里的推断问题,内容扎实,推导漂亮,放在任何一个正常的年份,都够底下的人认认真真记一上午笔记。
可惜今年不正常,今天尤其不正常。
老黄等大佬都看着他,但一个个都是心不在焉的样子。
后面坐着的人更是如此,有人笔记本上的确写满了字,但凑近看全是对下午的预测,列了六七条,每条后面还标了自行估算的概率。
左边隔两个座位,两个谷歌的工程师在共享文档上敲字,交流对漆昊新技术的看法。
再往后几排,有人干脆在刷会议官网,仿佛多刷几次就能刷出漆昊要讲的内容。
台上的副教授显然也察觉到了气氛不对,讲到一半,他翻页的手停了停,对着满场心不在焉的脸,自嘲了一句:“我知道各位在等什么,这样,我尽量在中午之前讲完,绝不占用大家的时间。”
全场哄笑,响起了这场报告开始以来最热烈的一次掌声。
副教授:……
真是谢谢你们了,虽然这个掌声让我更难过了。
第二场主讲人见此情况,自然也很有自知之明,讲完自己的东西就麻溜下台了。
中午十二点,午餐时间。
会议中心外面三条街全是餐厅,从牛排馆到华国餐厅应有尽有。
往常这种规模的会议,中午会场准得空一半,学者们对午餐社交的热情,从来不亚于对学术的热情。
但今天,两千多人,几乎没人离场。
大厅侧面的简餐台前排起长队,所有人拿了三明治和咖啡就往回走,端着纸盘子站在会场各处,边吃边聊,眼睛却都跟装了雷达似的,时不时往主会场入口和后台通道看。
这场面就像机场接机一样,两千多个人,全在等同一个人出现。
老黄端着盘子,跟马斯克、哈萨比斯站成了一小圈。
“今天有人见过漆昊吗?”
三人对视一圈,集体摇头。
“我十一点半绕着会场走了一圈。”
马斯克说:“后台、贵宾室、停车场,都看了,没有。”
老黄咬了口三明治,忽然乐了:“你们说这叫什么事?我们仨,一个造火箭的,一个搞人工智能的,一个卖显卡的,大中午的站在这儿啃三明治,就为了蹲一个华国的年轻人,传出去谁信?”
马斯克答得飞快:“不过十年以后回头看,今天这顿三明治,可能是我们仨这辈子性价比最高的一顿午餐了。”
哈萨比斯冷静说道:“等漆昊新技术出来了才知道情况。”
下午一点五十分。
主会场内座无虚席,过道里还站满了人,据说会议中心的消防负责人来交涉过一次,被杨力昆连哄带求地按了回去。
一点五十五分,人声开始变低,在没有任何广播提醒的情况下,整个会场就像被人拧小了音量旋钮一样,自动变小声了。
一点五十九分,两千多人,鸦雀无声。
田院士坐在其间,暗暗惊讶。
他以往参加的学术会议,等级森严,圈层分明。
院士、大佬、普通学者、行业新人,界限清晰,气场各不相同。
但此刻,在这个新兴的领域里面,圈层好像消失了。
不管是身家千亿的行业巨头,还是深耕半生的学界大佬,或者是初出茅庐的青年学者,所有人的心态都一模一样。
期待、忐忑甚至还有一点敬畏。
没有任何人摆资历,端架子。
在漆昊即将登场的这一刻,所有头衔,荣誉,资历全都一文不值。
两点整。
会场顶灯毫无征兆地暗了下去,两千多人的呼吸声齐齐一滞。
黑暗里,所有的灯光向前方汇聚,打在那块巨大的屏幕上。
屏幕,亮了。
黑暗中,屏幕亮起的第一秒,上面没有标题,没有名字,没有任何客套话。
只有一个界面。
一个朴素到简陋的训练监控界面。
左边是一条正在实时下降的损失曲线,右边是一块滚动刷新的日志区,字符一行行往上跳,底部一排状态栏显示着集群负载、吞吐量、当前轮次。
任何一个在深度学习领域的人,都对这个界面熟悉得不能再熟悉。
全世界每一个深度学习实验室,每天都有无数块屏幕上挂着一模一样的东西。
所以开始全场没什么反应。
直到前排有人读出了状态栏左上角的一个参数:“网络深度……100层?”
“我是不是眼花了?”
一瞬间,整个会场响起了一片压抑不住的吸气声。
“多少?!”
“100层?他打错了吧?是不是10层,不对,10层也太少了!”
“肯定是显示bug,100个神经元还差不多!”
坐在中间区域的一个伯克利博士生站了起来,眼睛盯着屏幕,手里的笔记本啪嗒一声掉在地上都没察觉。
他导师坐在旁边,一把没拉住他,只好跟着看向屏幕,然后自己也缓缓地站了起来。
因为此时,屏幕上那条损失曲线,在降。
它不是所有人熟悉的那种深层网络训练时惨不忍睹的波动,它就是在匀速的往下降。
“这不可能啊。”辛顿的声音从第一排传来。
老爷子这句话说得不响,但此刻,这就是全场两千多颗大脑的共同想法。
要知道,2012年年初,全世界深度学习的最前沿在哪?
在二十层出头的地方卡着,动弹不得。
QInet八层,已经是横扫深度学习的存在,此后各家实验室疯狂加码,十五层,十九层,二十二层,靠着漆昊最新的吉洪诺夫-漆理论,他们最多堆到了二十五层,越往上堆,训练越困难,梯度传到底层就衰减成了一堆没用的数字噪声。
更诡异的是,就算用尽各种手段把深网络勉强训出来,它的表现居然还不如浅层。
而现在,屏幕上那个数字是100。
他们做梦都不可能训到的数字!
“这应该是演示动画。”
一个声音响了起来。
说话的是谷歌那排里的一位资深研究员,说:“这一定是预先录制的演示动画,这说明不了任何问题!”
这话让大家都放松了下来。
对啊,是演示动画的!
好多人如梦初醒地点头,紧绷的神经松了下来,只要不是真实的,世界观就还能保住。
“我们想看真的。”
那位研究员环视四周,得到了大片附和的目光,底气更足了:“实机、实数据、实时训练,深度学习圈不看PPT,漆,给我们看点真东西!”
“对!看真的!”
“上真机!”
附和声此起彼伏,会场里的气氛从震惊变成了躁动,这躁动里一半是质疑,另一半是期待。
就在这时,舞台侧面的阴影里,传来了脚步声。
漆昊走了出来!
漆昊上台后,说了今天的第一句话:“抱歉,让各位失望了,刚才大家所看到的,不是模拟,也不是动画。”
他抬手指向大屏幕:“你们现在看到的,是我实验室集群上正在进行的一次训练任务的实时监控画面,延迟大约1.2秒,这个网络是一个月前开始训练的,它目前已经有100层了。”
会场安静了一下,瞬间热闹了起来。
“实时的?!”
“一个月?一百多层的网络训了一个月就收敛成这样?!”
“不可能绝对不可能,我上个月训一个二十六层的网络,光让它别崩就调了四个星期!”
刚才那位谷歌的研究员还站在原地,脸上的笃定一点点消失。
他做了最后的挣扎:“你怎么证明这是实时?监控画面也可以造假。”
漆昊看着这个大聪明,他毕竟是佩戴过红领巾的男人,所以肯定会助人为乐,帮助在场的人来理解他的新技术。
于是他说:“问得很好,我正要展示这个。”
“我们就用李飞飞教授的Imagenet数据集来测试,李教授,我需要用你最新的竞赛数据集,一百二十八万张真实原图,一千类分类任务,这样全程公开透明,现场就可出结果。”
这事之前漆昊就跟李飞飞提过,所以这时她站起来说:“没问题。”
“Imagenet数据集标注严谨,测试闭环,不存在任何人为操作空间,如果能在这套数据集上实时跑出有效精度,足以证明模型真实有效,我很期待接下来的结果。”
有数据集创始人亲自站台背书,现场质疑的声浪一下弱了大半。
有研究员这时提到:“漆,能否现场清空原有训练权重,随机初始化参数,从零开始训练,不加载预训练模型,不调用后台缓存数据?”
这个要求非常苛刻,堪称学术界最严苛的验证标准。
从零随机初始化训练,意味着没有任何前期优势,所有参数、权重全部从头迭代,任何作弊、预演的可能都会被完全杜绝,是最无可辩驳的实力证明。
全场目光再度聚焦在漆昊身上,所有人都在等他的答复。
不少人心里已然笃定,就算模型真的能稳定收敛,从零训练一百层超深网络,耗时、算力、难度都是天文数字,绝不可能现场完成。
可漆昊只是轻轻点头:“这些条件都不算难,可以全部满足。”
说完,他迈步走到操作台旁,手指在键盘上,敲击了起来。
屏幕画面瞬间切换,原本的长期训练监控界面消失,现在出现了一片干净的命令行窗口。
【权重初始化完毕!】
【加载Imagenet完整数据集……】
【数据集校验通过:1281167张训练集、50000张验证集、1000分类任务】
【清空历史梯度缓存,开启全新训练任务】
一条条绿色日志飞速刷屏,展现在两千多人眼前。
全场所有人都屏住了呼吸,盯着在屏幕。
辛顿清楚从零训练深层网络的难度,哪怕是二十五层网络,随机初始化后极易直接崩损,梯度瞬间归零,根本无法迭代更新。
更别说整整一百层的超深结构,在当下的学术认知里,这根本是不可能完成的任务。
后排一名MIT教授语气笃定:“一百层网络从零训练,开局直接梯度消失,连第一轮迭代都撑不过去,数学上根本不成立,漆昊对自己太自信了。”
旁边几名学界大佬纷纷附和。
可就在众人议论纷纷之时,屏幕上的日志突然跳出全新的内容,让全场的人闭了嘴。
【第1轮迭代完成】
【训练损失:6.812,验证损失:6.901】
【梯度传递完整,无消失,无爆炸,参数更新正常】
没有崩溃,没有报错,没有梯度归零!
整整一百层的超深网络,随机初始化开局,第一轮迭代稳稳跑完,梯度完整穿透百层结构,全程稳定无异常!
“怎么可能?!”
“二十五层以上就梯度断层,一百层居然能完整传梯度?!”
辛顿缓缓站起身,他失态地盯着屏幕上平稳跳动的损失数值,说:“梯度完整保留,一百层网络,反向传播无衰减,这根本不符合现有推导逻辑。”
现有所有深度学习理论、梯度计算公式、正则化体系,全部指向同一个结论:深层必衰减,超深必崩盘。
可漆昊的模型好像已经推翻了这套逻辑!
此时屏幕上的迭代还在飞速进行,速度平稳得离谱。
【第10轮迭代完成】
【训练损失:4.217,验证损失:4.302】
【Top-5准确率:28.7%,稳步攀升】
损失持续稳定下降,准确率匀速上涨,没有丝毫波动,完美避开了所有深层网络的训练通病。
刚才提出质疑的谷歌资深研究员,此刻难以置信地看着屏幕:“不对……公式不是这样的,梯度衰减系数不可能凭空消失,这不符合逻辑……”
屏幕上的迭代依旧在飞速推进,数据实时刷新,每一秒都在刷新全场的认知。
【第55轮迭代完成】
【训练损失:2.103,验证损失:2.187】
【Top-5准确率:85.3%】
这个准确率,已经稳稳超越了2011年ImageNet竞赛的冠军模型,也就是漆昊本人去年的模型!
所以漆昊现在就已经超越他去年的模型?!
马斯克和老黄对视了一眼:“老黄,我没有看错吧?”
“我敢肯定没有,因为我戴着眼镜看,也是一样的结果。”
“离谱,太离谱了。”
他们后面,一名微软研究院的资深研究员苦笑:“一百层网络从零训练就有这样的效果?”
“我们团队打磨半年的模型,还不如人家五十五轮迭代的原生效果!”
“难以想象,它继续迭代后正确率有多高!”
屏幕上的训练依旧在继续,曲线依旧平稳下降,没有丝毫要出问题的样子。
【第100轮迭代完成】
【Top-5准确率:89.2%】
最终数据定格,刷新了ImageNet数据集的全球最高纪录!
漆昊看着这结果,十分满意。
他现在就是秦始皇触电,赢麻了!
漆昊暂停训练,面向全场两千多位全球顶尖学者、行业巨头,从容说:“实时训练、公开数据集、从零迭代。”
“一百层残差网络,稳定收敛,有效拟合,实测准确率89.2%。”
“刚才各位的疑问,现在可以解答了。”
短暂的静默过后,全场爆发出雷鸣般的掌声!
漆昊的话,宣告了旧时代落幕,新时代降临!
会场上无数学者只觉得身上热血翻涌。
他们入行以来,一直被前辈告知层数有上限,梯度有枷锁,领域有天花板,只能在固有框架内小修小补,内卷跟风。
可漆昊用一场实时实测告诉所有人。
所谓的行业天花板,只是前人的认知局限!
而捅破天花板的人,是个数学家!