深度学习_人脸检测_基于多任务卷积神经网络（MTCNN）

其他 2020-01-16 16:30:47 阅读次数: 0

首先上论文地址：
Joint Face Detection and Alignment using Multi-task Cascaded Convolutional Networks

一.MTCNN工作流程图

首先我们看一下MTCNN的工作流程图：

在这里插入图片描述

二.MTCNN的模型结构

MTCNN模型有三个子网络。

分别是P-Net，R-Net，O-Net。

Proposal Network（P-Net）：该网络结构主要获得了人脸区域的候选窗口和边界框的回归向量。并用该边界框做回归，对候选窗口进行校准，然后通过非极大值抑制（NMS）来合并高度重合的候选框。
Refine network（R-Net）：该网络结构还是通过边界框回归和NMS来去掉那些false-positive区域。只是由于该网络结构和P-Net网络结构有差异，多了一个全连接层，所以会取得更好的抑制false-positive的作用。
Output Network（O-Net）：该层比R-Net层又多了一层卷积层，所以处理的结果会更加精细。作用和R-Net层作用一样。但是该层对人脸区域进行了更多的监督，同时还会输出5个地标（landmark）。

下面我们来看看详细的网络结构：

在这里插入图片描述
建立模型的一些考虑：

把5 * 5卷积换成3 * 3卷积，能减少计算量，并增加深度。
非线性激活函数使用PReLU。

更加详细的网络结构

分别为det1，det2，det3。

det1.prototxt结构：

在这里插入图片描述

det2.prototxt结构：

在这里插入图片描述

det3.prototxt结构：

在这里插入图片描述

为了检测不同大小的人脸，开始需要构建图像金字塔，先经过P-Net模型，输出人脸类别和边界框（边界框的预测为了对特征图映射到原图的框平移和缩放得到更准确的框），将识别为人脸的框映射到原图框位置可以获取patch，之后每一个patch通过resize的方式输入到R-Net，识别为人脸的框并且预测更加准确的人脸框，最后R-Net识别为人脸的每一个patch通过resize的方式输入到O-Net，跟R-Net类似，关键点是为了在训练集有限情况下使模型更鲁棒。

注意：构建图像金字塔的缩放比例要保留，为了将边界框映射到最开会原图上。

三.MTCNN的主要公式

MTCNN特征描述子主要包含3个部分，人脸/非人脸分类器，边界框回归，地标定位。

人脸分类

在这里插入图片描述

上式为人脸分类的交叉熵损失函数，其中pi为是人脸的概率，y_i^det 为ground-truth标签。

边界框回归

在这里插入图片描述

上式为通过欧式距离计算的回归损失，使得这个过程成为回归问题。其中，带尖儿的y为通过网络预测得到，不带尖儿的y为实际的ground-truth坐标。其中，y为一个（左上角x，左上角y，长，宽）组成的四元组。

地标定位

在这里插入图片描述

和边界回归一样这也是一个回归问题，还是计算网络预测的地标位置和实际真是地标位置的欧式距离，并最小化该距离。其中，带尖儿的y为通过网路预测得到，不带尖儿的y为实际的ground-truth地标坐标。由于一共5个点（左右眼睛，嘴巴，左右嘴角），每个点有x和y2个坐标，所以y属于十元组。

多个输入源的训练

在这里插入图片描述

整个的训练学习过程就是最小化上面的这个函数，其中N为训练样本的数量，a_j 表示任务的重要性，b_j 为样本标签，L_j 为上面的损失函数。

Online Hard sample mining（OHEM）

这个概念是什么意思呢？
答：寻找出比较刚的样本，好好炼它！！！

有别于传统的硬样本挖掘，我们进行在线硬样本挖掘，与训练过程相适应。

在小批量样本训练过程中，为了取得更好的效果，我们从所有样本中对正向传播计算出的损失进行排序，并选择损失最高的前70%样本作为硬样本，然后我们只计算反向传播中这些硬样本的梯度，这样一来保证传递的都是有效的数字。有点类似latent SVM，只是作者在实现上更加体现了深度学习的end-to-end。

四.训练

论文中使用的数据集

FDDB
WIDER
AFLW

数据集的标注有4类

Positive face数据（正样本）
Negative face数据（负样本）
Part face数据（部分人脸样本）
landmark face数据（地标）

训练样本的比例负样本：正样本：Part样本：地标 = 3:1:1:2

交并比IoU（Intersection-over-Union）比例

在训练过程中，y尖儿和y的交并比比例为：

0-0.3:负样本
0.4-0.65:部分人脸样本
0.65-1:正样本

各个数据集如何使用

网络做人脸分类的时候，使用Positives和Negatives的图片来做，容易使模型收敛。
网络做人脸bbox的偏移量回归的时候，使用Positives和Parts的数据，比较好的使得bbox回归。
网络在进行人脸landmark回归的时候，只使用landmark face数据集。

训练效果

在线硬样本挖掘的有效性：
在这里插入图片描述

joint detection and alignment的有效性：

在这里插入图片描述

人脸检测的效果与其他算法进行对比：

在这里插入图片描述

运行的时间效率：

在这里插入图片描述

发布了94 篇原创文章 · 获赞 37 · 访问量 3430

私信关注

猜你喜欢

转载自blog.csdn.net/Rocky6688/article/details/103694133

深度学习_人脸检测_基于多任务卷积神经网络（MTCNN）

MTCNN-将多任务级联卷积神经网络用于人脸检测和对齐

MTCNN：将多任务级联卷积神经网络用于人脸检测和校准

MTCNN（Multi-task convolutional neural networks）将多任务级联卷积神经网络用于人脸检测和对齐

基于MTCNN卷积神经网络的人脸识别

深度学习_人脸检测_级联卷积神经网络

MTCNN（人脸检测）-将多任务级联卷积网络用于脸部检测和对齐

使用多任务级联卷积网络进行人脸检测和对齐（MTCNN翻译）

基于卷积神经网络CNN模型的人脸检测

深度学习之人脸检测网络MTCNN

深度学习（十五）基于级联卷积神经网络的人脸特征点定位

Keras深度学习应用1——基于卷积神经网络(CNN)的人脸识别（上）

Keras深度学习应用1——基于卷积神经网络(CNN)的人脸识别（下）

【深度学习】基于卷积神经网络（tensorflow）的人脸识别项目（一）

【深度学习】基于卷积神经网络（tensorflow）的人脸识别项目（四）

基于CNN卷积神经网络的TensorFlow+Keras深度学习搭建人脸模型

【深度学习】基于卷积神经网络（tensorflow）的人脸识别项目（三）

【深度学习】基于卷积神经网络（tensorflow）的人脸识别项目（二）

基于CNN卷积神经网络的TensorFlow+Keras深度学习的人脸识别

[深度学习入门案例2]基于卷积神经网络与Keras构建人脸识别模型

使用dlib基于CNN(卷积神经网络)的人脸检测器来检测人脸

基于多任务级联卷积网络的人脸联合检测与对准

基于深度学习的图像分类任务实现（二）卷积神经网络分类器&基于Residual Bolck的卷积神经网络分类器

【转载】共享相关任务表征，一文读懂深度神经网络多任务学习

【深度学习】基于卷积神经网络的天气识别训练

深度学习——基于卷积神经网络的宝石分类

深度神经网络的多任务学习概览(An Overview of Multi-task Learning in Deep Neural Networks)

深度神经网络多任务学习(Multi-Task Learning in Deep Neural Networks)

实时人脸检测：基于卷积神经网络CNN和OpenCV的摄像头应用

基于深度学习，机器学习，卷积神经网络，OpenCV的交通标志识别交通标志检测

今日推荐

周排行

django中south支持多数据库

2、实时同步项目

http协议状态码解析

codeup 又一版 A+B(C++)

js三座大山之外的其他知识点

正向代理VS反向代理总结

规范的测试流程（转自51testing）

3、python-连接sql server

转~Jenkins pipeline：pipeline 使用之语法详解

cookie与sessio系列（一）：基本知识入门

每日归档

更多

2024-06-11(0)

2024-06-10(0)

2024-06-09(0)

2024-06-08(0)

2024-06-07(0)

2024-06-06(0)

2024-06-05(0)

2024-06-04(10)

2024-06-03(52)

2024-06-02(4)