数据工程组负责人脸色紧绷,敲了敲自己面前的数据链路图:“苏晚,你不能把锅甩给数据链路。我们组已经把分布式存储集群扩容了三倍,实时ETL流程优化了五版,缓存层用了三级冷热分离,该做的容错、限流、数据清洗全都拉满了。长尾数据本身就是行业共性难题,用户行为碎片化、非结构化,不可能做到100%覆盖,你让我们数据组凭空变出高质量标注数据,不现实。”
算法组的工程师也有意见:“但不能卡在这里啊!这个模型是公司今年核心战略项目,砸了上千万研发成本,甲方那边已经催了三次,要是上线不达标,不仅项目黄了,公司在大数据建模领域的口碑直接砸了。我觉得可以牺牲一部分非核心特征,优先保障核心场景准确率,先过甲方验收,后续再迭代优化。”
苏晚立刻反驳,语气坚定:“不行。云枢模型的核心竞争力就是全场景覆盖,砍掉长尾特征,和市面上的通用大数据模型有什么区别?甲方要的就是我们能处理别人处理不了的碎片化数据,妥协降标,就算暂时上线,后期还是会被打回来,到时候返工成本更高。”
会议室里众说纷纭,这些拿着三倍加班工资的工程师知道大老板最反感废话,早开完早下班,所以开诚布公,谁也不扯套话。总体来看,讨论内容相对硬核,直指问题症结,只是坐在会议桌主位的老板就好似摆着的花瓶一样,主要起到一个赏心悦目的作用。
别人说话的时候,苏晚偷瞄了好几眼一直沉默翻看测试报告的许延曦,心想人家虽然可能根本看不懂,但真的好帅。
这时,许延曦突然开口:“我插一句,我这边梳理了近一周所有训练崩溃的时间节点,发现一个规律——每次崩溃,都刚好是离线数据和实时数据切换的节点,而且硬件负载其实没到峰值,是调度算法出现死锁,特征队列拥堵,不是单纯的性能不够。”
“我昨晚让运维组试了临时手动调度分流,把高优先级特征和长尾特征分开队列处理,延迟瞬间降了15%,只是这套临时方