比较每一个候选模型,导出其中任意一个
手动在随机森林、XGBoost 和多种神经网络搜索策略之间做选择,意味着需要分别训练 每一种并逐一比较结果。Data Sensors 的模型竞赛功能会在同一测量数据上同时训练所有模型,按保留验证集精度 对其排名,并让您将排行榜中的任意一项——不仅仅是获胜者——导出为 C、C++、Python 或 MATLAB 代码。
同时训练多种模型类型,而非逐一进行
任意组合随机森林、XGBoost 和神经网络候选模型,每一种都拥有自己的搜索策略——随机搜索、网格搜索、 贝叶斯(高斯过程)优化,或随机森林/XGBoost 代理搜索——它们会针对相同的输入/输出通道同时进行训练。 自动调优并不局限于神经网络:随机森林和 XGBoost 候选模型同样可以各自自动调优其超参数,因此一次公平 且经过调优的比较,并不意味着需要手动搜索三种不同的超参数空间。无需为每个候选模型重新打开训练 对话框,也无需记住上次尝试过哪种配置,或另外维护一份结果表格。
按保留验证集精度排名,而非凭猜测
每个候选模型都会在其从未训练过的数据上进行评分,因此排行榜反映的是每个模型真正的泛化能力,而不仅仅 是它对训练集的记忆程度。排行榜会并排显示每一项的验证 RMSE 和 R²,以及训练时间和拟合诊断,让您一目 了然地看出某个候选模型是欠拟合、过拟合,还是真正具有竞争力。
按验证 RMSE 排名的排行榜
面向更大数据集的真正未触碰测试集
排行榜自身的排名由于被用来选出获胜者,天然带有一点乐观偏差。对于足够大的数据集,Data Sensors 会在 任何排名开始之前自动划分出一个真正的保留测试集——在训练或模型选择过程中从不被触碰——从而为您计划实际 部署的模型提供第二组更可信的精度数据。
与验证精度并列显示的测试集精度
导出获胜者——或任意其他一项
排名第一的模型并不总是正确的选择——也许精度略低的随机森林在您的目标硬件上运行更快,或者更小的神经 网络更符合您的闪存预算。排行榜上的每一项,而不仅仅是获胜者,都可以 导出为 C、C++、Python 或 MATLAB 代码,支持全精度或 int8 量化,并在 保存前提供实时的大小与精度预览。有关直接训练单个模型而无需运行完整 竞赛,请参阅虚拟传感器训练。