第175章 他更像是吉洪诺夫的学生!(求月票)
“哼,他们在这篇论文的公式里,为了解决权重矩阵不稳定的问题,引入了L2正则化,然后呢?他们在参考文献里写了什么?他们写的是Hoerl & Kennard 1970提出的 L2岭回归!”
“该死的,1970年?!吉洪诺夫导师在1963年的《苏联科学院汇报》上发表那篇奠定正则化基础的论文时,这两个美国佬还在泥地里玩泥巴呢!”
“在数学上,岭回归和吉洪诺夫正则化在特定条件下是完全等价的,这一点任何一个合格的大学生都该知道,但他们宁愿去引用一个1970年的文献,也不愿意提到1963年吉洪诺夫的名字。”
“怎么,承认现代深度学习的数学基石有一部分来自我们,会让他们的股票下跌吗?”
尤里叹了口气。
“雅戈拉,我们没办法去和他们对抗,斯坦福这篇论文一出,那些科技媒体已经开始疯狂吹捧了,说什么深度学习的黎明。资本已经涌进去了。”
“黎明?我看是瞎子摸黑!”
雅戈拉冷哼一声:“吉洪诺夫正则化可不是那么好用的,在高维非线性空间里,盲目套用线性的惩罚项,会导致边界发生严重问题,他们这篇论文在五十二层就停下了,说明他们自己也发现了这个问题,只是在刻意隐瞒。”
虽然心里不舒服,但雅戈拉毕竟是一位顶尖的数学家。
他不会一直抱怨,在学术界,最有力的反击永远是数学公式和可重复的实验。
“帮我把伊万和德米特里给我叫进来!”雅戈拉转头对尤里说道。
不一会儿,两个穿着套头卫衣的莫大研究生走进了办公室。
“教授,您找我们?”
“你们两个,今天不用去跑那个该死的数据清洗脚本了。”
雅戈拉指着屏幕上的斯坦福论文:“把这篇论文打印出来,把他们的核心代码和数学推导给我复现一遍,特别注意他们提到的边界收敛证明,用吉洪诺夫算子去检验它。”
伊万和德米特里对视了一眼,一下兴奋了起来。
拆美国同行的台?
他们可太喜欢了!
人嘛,搞科研可能没有那么积极,但如果是干坏事,那就嘿嘿。
一周后,美国,加利福尼亚州。
帕罗奥图,斯坦福大学深度学习研究中心。
清晨的阳光透过高大明亮的落地玻璃窗,洒在了一间实验室内。
“恭喜你,克里斯多夫教授,论文挂上去才一周,我们的下载量和引用申请就已经创下了今年实验室的新高。”
副教授布兰登手里拿着一个平板电脑,满脸兴奋:“谷歌AI部门的几个老朋友已经在推特上转发了我们的工作,称这是今年最令人兴奋的理论突破之一。”
“硅谷的几个投资人都打来电话,询问我们有没有基于这项技术成立新公司的计划。”
克里斯多夫听着这些,满意极了,他笑着说:“这很正常,布兰登。”
“那些工业界的巨头们手里的算力太多,脑子太少,他们只知道用成百上千个GPU去强行堆砌参数,遇到退化问题就束手无策。”
“而我们就是他们的救命稻草。”
“您说得对,不过,我们为什么不等同行评审结束,直接发刊,而是急着挂在 arxiv上呢?”一个博士生有些不解地问。
克里斯多夫看了他一眼,说:“孩子,这就是学术上的技巧。”
布兰登在旁边笑着解释道,“现在的机器学习领域迭代太快了,如果我们老老实实等六个月的审稿期,指不定哪天有团队就会误打误撞做出类似的东西,然后抢在我们前面发布。”
“只要我们的预印本挂上arxiv,全世界就必须承认这个成果属于我们。”
“更重要的是,这篇论文能帮我们拖延竞争对手至少三个月的时间。”
“谷歌在看到这篇论文后,第一反应绝对是暂停他们现有的部分实验,调集人手来复现我们的论文,等他们花了几百万美元的算力,终于搞清楚我们的边界条件和局限性时,我们早就把第二阶段,也就是基于这个理论的改进架构给做出来了,专利也早就申请完毕了。”
“简单一点来讲,这么做之后,我们将永远在深度领域占有重要的位置。”
博士生恍然大悟。
他原本以为搞科研自己做自己的就行了,没想到,这里面有如此多的门道。
难怪说,找到一个好的导师,可以少走五年弯路,如今看来,他跟对人了。
就在他们讨论着今晚去哪家高档米其林餐厅庆祝时,一个戴着黑框眼镜的博士生神色匆忙地推开门走了进来。
“教授,arxiv页面下面,刚刚冒出了几条关于论文的comment。”
克里斯多夫喝了一口咖啡,没当回事:“哦?这不是很正常吗?我们的论文这么有话题度,那些被戳中痛点或者想蹭热度的同行,当然会迫不及待地跳出来。”
“让我想想,是不是又有一些大学的研究员,在下面留言说让我们引用他们的论文?”
实验室里爆发出一阵哄笑。
在预印本平台上,这种comment简直不要太多,由于arxiv的的留言机制是公开的,很多渴望引用量的二三流学者,会想方设法在爆款论文下面留言,试图把自己那些无人问津的陈年旧作和热点强行绑定。
“确实有一条是这样的,希腊的一个副教授,希望我们能把他的图神经网络论文加进参考文献。”
“但还有几条比较棘手,比如莫斯科国立大学那边,有一位叫雅戈拉的教授,在arxiv的讨论区发了一篇很长的comment。”
“雅戈拉?”
克里斯多夫挑了挑眉:“那个守着苏联时代数学遗产不放的老头子?他说了什么?”
“他提了一些问题。”
“他指出,我们的模型超过五十二层,扭曲的边界会破坏梯度下降的收敛唯一性,训练误差会断崖式反弹,权重矩阵出现系统性伪秩退化,模型完全失效,我们的收敛证明,仅在浅层有限区间成立,刻意隐瞒了深层失效的拓扑缺陷。”
克里斯多夫冷哼了一声。
刻意隐瞒又如何?
他们完全有时间去修改这个问题。
不过问题是,这老家伙的话,一定会引起同行的注意。
布兰登像是知道克里斯多夫在担心什么,他安慰说:“教授,不用担心,现在大部分comment都是认可我们的,雅戈拉的comment不用放在心上。”
“毕竟,雅戈拉名气现在可没有您的大,影响不了我们的论文发表计划。”
克里斯多夫听到后,心里这才放心下来。
“还有别的吗?”
“教授,大部分评论确实都在夸奖我们的工作,或者提出一些不痛不痒的格式问题,但有一条comment,非常特别。”
“特别?”
布兰登教授有些好笑地凑过来:“能有多特别?难道有人在里面写了一首十四行诗来赞美我们的局部流形正则化吗?”
“不,教授,这个comment没有任何废话,只有一份五页的数学推导。”
“它的作者是Qi Hao(漆昊)。”
“你说谁?!”
“漆昊,就是发明了QInet技术,还在数学领域取得了重大成果的那位。”
在当下,机器学习领域没有人不会知道漆昊的名字。
这个年轻人在计算机工程上表现的像个妖孽,如果不是他,机器学习这个领域早就快凉了,现在哪有那么多高校实验室和企业进场押注?
漆昊不是去搞纯数研究了吗?
为什么还要看他们的论文?
“快!把他的comment调出来!”克里斯多夫听到这个名字,身体紧张的跟1993年俄联邦的财政预算一样。
他意识到了情况不妙,立刻命令道。
博士生连忙在键盘上敲击,将那篇comment投影到了实验室的大屏幕上。
原本有些声音的实验室在这一瞬间安静了下来,所有人都看向了投影。
开篇第一段,漆昊就说了:“我很欣慰能看到斯坦福团队在 L2正则化与流形稳定化方面所做的尝试,这无疑是一次不错的工程探索,然而,你们在论文第四章试图用一个各向同性的局部约束来证明 52层网络收敛性的做法,在数学逻辑上是不成立的。
“不成立?!”布兰登咬了咬牙,急切地看了下去。
“在非齐次噪声和高维梯度的双重作用下,你们所设计的流形会不可避免发生问题。”
“实际上,要解决这一缺陷并不困难。”
接下来的四页,全是数学推导。
克里斯多夫立即组织人开始验证。
此时,不光是克里斯多夫课题组在验证漆昊的推导,其他课题组在看到漆昊的comment后也加入了进来。
与此同时,莫大。
“教授您快看!大家都在讨论那篇论文下的comment!”伊万把笔记本电脑放在了雅戈拉面前。
雅戈拉凑近屏幕一看:“这是漆昊写的?”
伊万点头,说:“现在大家都在传漆昊的comment,听说不少实验室已经开始验证漆昊的论证了。”
“您还记得漆昊吗?”
雅戈拉当然记得漆昊了。
那个凭一己之力把这个领域从要进入寒冬的悲观预期里拽回来的年轻人,那个搞出QInet,又转头在纯数领域里搅风搅雨的华国天才。
整个机器学习圈子,谁会忘记这个名字?
伊万激动得脸都红了:“教授,他跟咱们说的是一个问题,他也发现了!”
雅戈拉没有搭理伊万,他严肃地看起了漆昊的推导,越看,脸上的表情越复杂。
他和学生忙活了一整个星期,靠着吉洪诺夫正则化那套老办法,才勉强证明了斯坦福的证明是有漏洞的。
注意,是有漏洞,他能指出漏洞在哪,却给不出一个解决方案。
因为吉洪诺夫那套框架,在这种高维非线性的场景下,有点力不从心了。
而漆昊呢?
这个年轻人光明正大引用了老师的理论,但跳过了找漏洞这个环节,他直接把问题重新参数化,引入了一个雅戈拉从没见过的动态约束算子,然后推导出了一个在任意层数下都收敛的充分条件!
雅戈拉让伊万拿来纸笔,他快速验证了起来。
他验算了一个下午,一遍又一遍,每验一遍都想骂人,每次骂完又想接着看。
这倒不是因为算子本身有多复杂,恰恰相反,他就是因为看明白了漆昊的推导才想骂人。
那种天赋之间的差距,让他坐立难安。
雅戈拉这辈子见过聪明人,见过勤奋的人,见过又聪明又勤奋还运气奇好的人,但这种感觉,他记得只在第一次读吉洪诺夫老师的手稿时才有。
这个漆昊,他到底是如何想到那个算子的?
技术步骤问题雅戈拉可以反推,他花几个月,肯定能把那条路从头走一遍。
雅戈拉想知道的是,那个重新参数化的初始切入角度,是怎么来的?
这问题绝对不是一句漆昊很努力就能回答的。
这就像是雅戈拉能弄明白如何解决问题,但这个年轻人,好像生来就会看见其它解决方法一样。
到了晚上,雅戈拉看着验证出来的结果发出了一声叹息:“看来我们从一开始,就被吉洪诺夫老师的框架框死了。”
“漆昊是对的。”
雅戈拉一辈子都扎根苏联经典数学体系,毕生所学所研所用,全部建立在吉洪诺夫正则化的基石之上。
他始终坚信,老师1963年的成果,是整个正则化领域的源头,可直到今天,他才认清一个的事实,经典永远是经典,但经典终究有时代的边界。
漆昊没有局限于吉洪诺夫老师的理论,而是在原有基础上,做了优化。
雅戈拉不得不承认,漆昊比他更像是吉洪诺夫的学生。
而他就像是个冒牌货。
“去把咱们这一周的草稿都拿来。”
伊万愣了一下:“教授您要……”
“我要把它们和这个算子对着看。”
“我想知道,我离这步,差了多少。”
伊万走后,雅戈拉再去看漆昊的comment,发现他遗漏了末尾的一句话。
“上述优化后的吉洪诺夫理论依然无法解决深度网络化问题,所以需要引入新的技术,完整理论和实验验证,后续将在新论文中公开。”
雅戈拉愣在了原地。