“硬刚”特斯拉！中国顶尖AI大牛TOP 2 正在车圈All in端到端

facai369 2024-10-10 科技 799 次浏览 0个评论

端到端，当前智能驾驶行业最火热的词汇；特斯拉，智能驾驶领域的标杆企业。不想当将军的士兵不是好士兵，同样的，总有一些企业，是想要超越第一，成为第一，小鹏、蔚来等企业都在做着这样尝试。而有一家企业在端到端技术上不不弱于特斯拉，甚至几度领先。

2022年，在全行业都没有关注端到端之时，这家公司就提出了行业首个感知决策一体的端到端智驾方案。在FSD V12版本也就是特斯拉的端到端方案面世之前，这家公司端到端方案已经斩获CVPR最佳论文。

这家公司就是商汤绝影，它背后站着一位世界级的AI大牛。

被引用次数超过12万次、H因子高达151、学科H因子139、出版著作150+……

在最新的计算机科学家排名中，这样的学术成绩，是中国第二。

这位AI大牛就是商汤科技联合创始人、首席科学家、商汤绝影事业群总裁王晓刚。如今，王晓刚带着他的团队在智驾领域All in端到端，UniAD端到端智驾方案明年即将量产落地，正面“硬刚”即将入华的特斯拉FSD。

中国TOP 2，怎么评出来的

知名学术平台Research.com刚刚公布了计算机科学全球顶尖科学家名单，其中商汤的王晓刚博士排名中国第2，世界第37。

Research.com的榜单中，从2022年开始王晓刚就一直是中国计算机科学TOP 3的“leader”学者。总被引用次数125264次，从2016年之后算，被引用次数也达到了92560次。

因为是细分的计算机科学排名，所以Research.com使用了较为准确的D-index，及学科内H因子作为依据，细化到被调查学科的论文和引用值，王晓刚博士的这一数据为139。

作为对比，深度神经网络之父Geoffrey Hinton的D-index为166。

王晓刚博士被引用次数前三的论文，分别是Pyramid scene parsing network（15490次引用）、Deep learning face attributes in the wild（9381次引用）、Residual attention network for image classification（4386次引用）。

尤其是2017年他和团队提出的PSPNet，深刻影响了后续图像语义分割的发展。其核心思想是利用金字塔池化（Pyramid Pooling Module）模块，通过使用不同尺度的池化核对输入特征图进行池化操作，有效地获取多尺度的上下文信息。所以网络能够更全面地理解图像中的语义信息，从而提高语义分割的准确性和鲁棒性。

类似的成果还有很多，从内容上看，王晓刚的学术成果覆盖模式识别、机器学习、特征提取和计算机视觉，涉及卷积神经网络、深度学习、人脸识别系统、人脸和判别模型，均属于人工智能范畴。

模式识别、大语言模型、计算机视觉技术等交叉领域的探索，正是目前自动驾驶领域最热门、最被看好的方向之一——端到端自动驾驶。

所以，在商汤科技成长为平台型AI公司之后，王晓刚也顺理成章带领团队向难度更大、落地场景更复杂、规模潜力更大的汽车工业发起冲击。

不过在介绍王晓刚目前的工作之前，先简单说一下他的经历。

谁是王晓刚

王晓刚是中国科技大学少年班出身，2001年毕业。2004年又获得香港中文大学信息工程硕士学位。2009年获得麻省理工学院人工智能实验室计算机博士学位，同年加入香港中文大学电子工程系，2020年起担任教授。

学术方面，王晓刚在顶级的国际期刊和会议发表超过300篇论文，其论文在Google Scholar上的引用超过120000次，h-index = 151。

他还是国际顶级计算机视觉会议CVPR 2017, ICCV 2011, ICCV 2015, ICCV 2017, ECCV 2014, ECCV 2016, ACCV 2014和ACCV 2015的领域主席。

产业层面，2014年同样出身中科大、MIT，任教港中文的世界级AI科学家汤晓鸥，带领王晓刚、徐立、杨帆等人创办了商汤科技。

2016年起王晓刚任商汤研究院院长，整体负责商汤科技的研发工作，建立起包括计算机视觉、自然语言理解、语音识别、混合现实、人工智能内容生成、智能影像、通用人工智能、决策智能、智能芯片、人工智能传感器和人工智能大装置等众多领域在内的研发体系。

近几年间，商汤研究院在全球计算机视觉顶级期刊和会议上（如CVPR、ICCV、ECCV等）共发表600余篇关于深度学习和计算机视觉的研究论文，在世界所有科研机构和公司排名第一，在各类国际人工智能比赛中获得超过70项冠军。

2022年，商汤将成立智能汽车事业群，命名为“绝影“公开亮相，王晓刚为总裁。绝影目前已经和30多家国内外车企携手合作，产品覆盖超100款车型，累计交付260万辆智能汽车。

与其他AI公司押注智舱或智驾的单一业务模式不同，绝影依靠商汤在计算机视觉、大算力转装置、大模型基础架构方面的先行优势，智能驾驶、智慧车舱、车路协同各个技术路线上不断拿出量产上车成果。

而今年被点燃的“端到端”浪潮，王晓刚和绝影团队不但all in，其方案UniAD还“血统纯正”、上车在即，据传明年即将入华的特斯拉FSD势必将会遇到这个强劲的对手。

王晓刚如何All in端到端

在2023年8月马斯克直播试驾特斯拉的端到端智驾方案FSD V12之前，商汤绝影的端到端方案UniAD就已经荣获当年国际计算机视觉与模式识别会议（CVPR）最佳论文，引领端到端智驾的风潮。当地时间10月10日，特斯拉将举办“Robotaxi Day”，其端到端方案的最新进展值得期待。而作为端到端智驾的引领者，从去年CVPR 2023最佳论文到现在整整一年时间，商汤绝影做了这么几件事。

首先是一段式端到端自动驾驶大模型的产品化、工程化不断推进，已经从几千行代码，UniAD完成了向符合汽车工业标准规范的量产产品的演变。

对于一般的自动驾驶公司来说，这一步可能就是目标和终点，也是最难、最紧迫的挑战。能全力交付端到端的产品，就能活到下一轮出牌，至于功能、体验，都可以后期OTA。

但商汤绝影不止步于交付一个单一的自动驾驶模型，更进一步，提出了两个新的技术和应用：

自动驾驶大模型DriveAGI，和车载AI Agent，几个月前北京车展期间就曾提及，刚刚结束的WAIC人工智能大会上，又被王晓刚教授着重强调。

同出一源，都是商汤原生多模态大模型，同时又都以UniAD端到端大模型为基础，和自动驾驶、智能座舱的功能、体验深度关联。

比如UniAD，在无高精地图，甚至是针对某种类型目标0样本学习的前提下，也能仅依靠视觉感知实际道路情况，准确地完成包括大角度转向、避让占道车辆及施工区域、绕行跑步行人等一系列高难度操作，做到“像人一样开车”：

而DriveAGI在路上遇到救护车还可以自动避让；遇到潮汐车道或公交车道时，它能根据限行规则自动规避：

除此之外，它也可以切换不同的驾驶风格，当需要赶时间时，你可以告诉DriveAGI开得更快一些；如果是想要放松一下，你还可以让它开得平稳一些。

对于智驾，多模态大模型相当于一个“点读机”，图像、视频数据哪里不会点哪里，不理解的目标场景，都能给出准确的解释。

商汤绝影对于端到端的描述和布道，已经和业内主流思路有了底层的区别：从应对自动驾驶挑战，上升到了AGI在车端应用。这其实和特斯拉的思路不谋而合，在即将到来的Robotaxi Day，无论是无人驾驶出租车还是类人机器人，都是具身智能的场景落地，都离不开AGI的底层技术支持。从这个角度来说，商汤绝影和特斯拉都在向着AGI的未来进发。

王晓刚认为现在谈AGI上车，时机刚好，甚至还有点紧迫，因为AGI应该是端到端的必要条件和前提。

所谓端到端，就是驾驶全流程的AI化，传感器信息输入，直接输出决策数据信号。直接的好处，就是可以让AI模型直接学习成熟的驾驶行为，理论上具备和人一样的驾驶能力。