只训练最后一小层
见微使用固定的表情视觉网络,把一张面部图像转换成 256 维特征。个人训练保留这个网络,只学习特征与七种标签之间的对应关系。计算量较小,因此训练也可以留在浏览器本机完成。
这不是从零训练一个新的视觉模型。它适合检验固定特征是否已经足够区分你的表达方式,也保留了随时恢复原分类器的可能。
当前个人训练会在类别均衡的基础上,将厌恶的学习损失权重提高到其他类别的 1.75 倍。它仍然需要你标注的真实样本,不能靠增加权重保证更准。
训练数据与验证数据,要分开采
页面先要求每类至少 10 条训练样本,再在训练结束后,每类另采至少 5 条验证样本。后面的样本只用于比较,不参与训练。项目也拒绝重复或近乎完全相同的特征跨越这条边界。
仅仅把同一段视频的相邻帧随机分成两组,仍可能得到过于乐观的结果。更有意义的做法是隔一段时间再拍,改变光线、轻微姿态和拍摄环境。
看整体,也看每一类
见微同时展示准确率、宏平均 F1 和各类别召回率,并单列开心、生气、厌恶的精确率与 F1、主要混淆类别。宏平均 F1 让每类占相同权重,帮助发现某些类别被整体表现掩盖的问题。
| 启用条件 | 项目采用的门槛 |
|---|---|
| 宏平均 F1 | 至少提高 2 个百分点 |
| 准确率 | 不降低 |
| 各类召回率 | 下降不超过 20 个百分点 |
| 开心、生气、厌恶 | 精确率和召回率均不下降 |
| 已采集歪头样本 | 子集准确率不下降;没有样本则标明未验证 |
这些是本项目的初始选择条件,不是通用标准,也不是统计显著性证明。样本较少时,一个样本就可能显著影响结果。
当前页面会降低中性分数、适度提高厌恶分数。基础模型与个人分类器的验证均应用同一规则,避免比较两套不同的决策偏好。分数加权会影响误报与漏报,不等于模型已经重新学习。
验证通过后,由人决定启用
训练完成不会自动替换原始模型。只有验证达标,页面才允许用户启用个人分类器。启用后,结果混合了原分类器 30% 和个人分类器 70% 的分数;用户可以随时停用。
如果导入一份保存的分类器,还需要在本机另采样本重新验证。模型在之前的一组样本上表现好,不代表换一天、换光线或换一个人后仍然合适。
给结论留出边界
用于选择模型的验证集,不是最终独立测试集。若想对外声称精度提高,还需要一组没有参与模型选择的测试数据,以及更有代表性的使用场景。
这里判断的是可见表情样式。分类分数不是人的真实内心感受,也不等于准确率。保留“不确定”的结果,是这个实验的一部分。