动量的好处与困扰,darknet与自己(摸到pytorch尾灯!)

动量的好处与困扰,darknet与自己(摸到pytorch尾灯!)

训练cifar10,用darknet架构,上了79,用自己的,也上了79,但darknet优势明显:快了13秒一轮

虽然自己的架构领先了0.2分,代价非常大

上面两个版本都使用卷积层权重和bias的动量参与!就这一句话:

scal_cpu << <(w_size + 255) / 256, 256 >> > (w_size, 0.98, _grad_weight, 1);

darknet版本从13秒一轮,上升到70秒一轮

自己的版本从14.5秒一轮,上升到83秒一轮!

如果干掉这句话,两个版本都能稳定在78.5分!而且速度嗖嗖的!看一看两个架构,差别也很小!

看看lr的更新,也保持一致:

下一步,问题自然而来!解决这个慢的问题!先放下!慢慢来!