特斯拉为什么全力押注Transformer?

说到纯视觉的自动驾驶方案,大家第一个想到的就是Tesla吧。的确,早在2021年,Tesla就已经实现了纯视觉的BEV检测方案,而且效果非常好。

d4dccd0fa71339d21cfc723bc4c50ba0.png

细心的同学可能发现了,这套BEV方案中将相机空间的图像转换到BEV空间的核心组件就是Transformer。

Transformer来源于自然语言处理领域,首先被应用于机器翻译。后来,大家发现它在计算机视觉领域效果也很不错,而且在各大排行榜上碾压CNN网络。

68c05c5aaec0d998659967b5b15ab75e.png

目标检测领域中,视觉Transformer不仅可以实现2D检测、3D检测,还可以实现多模态检测,BEV视角下的检测,性能也非常出色。

ccd2e9cc5841f2bfff09c3630867ad73.png

因此,掌握Transformer相关知识和工程基础成为了企业招聘算法工程师的一个技能要求点,也是简历上的一个很大的加分项。

然而,想要掌握基于Transformer的目标检测算法,有以下3个难点

  • 理解Transformer背后的理论基础,比如自注意力机制(self-attention), 位置编码(positional embedding),目标查询(object query)等等,网上的资料比较杂乱,不够系统,难以通过自学做到深入理解并融会贯通。e3682ad81c1f097119524c0489c86bd3.png

  • 掌握基于Transformer的目标检测算法的思路和创新点,一些Transformer论文涉及的新概念比较多,话术没有那么通俗易懂,读完论文仍然不理解算法的细节部分。

246868e916e8e70e1f182da1e402491c.png
2
  • Transformer代码不易看懂,因为作用机制与CNN有不少差别,所以完全理解代码并实践应用需要花费很大功夫。

c2c0e45955c3f466c4d4b87697b109fc.png
3

那么如何学习基于Tansformer的目标检测算法呢?

3D视觉工坊联合讲师「语嫣」,为大家精心准备了课程「目标检测中的视觉Transformer」,主要帮助各位同学解决以上这些难点。

不仅为大家详细讲解视觉Transformer的基础知识,各种经典的基于Transformer的目标检测算法,还配有代码解读和实践课程,让大家真正活学活用,理解和掌握这些知识理论。

实践部分

dd65b2817ec6f1e9136bbe1b84bff29a.png 0550314c2e3f14d54aadb3b684c3e018.png 50280d48c392fcbd47a7e39b1013543c.jpeg 14574cd4e03284505f8e0e56002d2606.jpeg 109c1da397c4190ffb1f3b19e8f6b95a.jpeg 80aa11113d22bb0332fbd88bef1fef77.jpeg 7963577138bd4f97c2c429917f2b8bf7.png 924b0722a4da5eb655e035343f8cd367.png 337dfdaf97537d35cf40bf24e4e1c150.png

6b3a68c9537fca995e0a43308b2df2dd.png

f85eb2b6dc88da05d0247af1cc2b2370.jpeg e25b167e9dc2959ccd7219d5ad6b05dc.jpeg 5044b62babbaa52671dc9673beadcdb1.jpeg

开课时间

2023年7月28日晚八点(周五),每周更新一章节。

课程答疑

本课程答疑主要在本课程对应的鹅圈子中答疑,学员学习过程中,有任何问题,可以随时在鹅圈子中提问。

27c44dca3982b692c79710a5caf90368.png
▲长按购买课程, 前50名,享早鸟价,立减30元
f5321f706709dd8043eb00af608a7bae.jpeg
▲长按添加小助理微信:cv3d007,咨询更多

猜你喜欢

转载自blog.csdn.net/Yong_Qi2015/article/details/132929008