Gmail中部署的新矢量算法将大幅度提高垃圾和钓鱼邮件的识别率
Google最近在 Google Colab 上开源了一个名为 RETVec 的新型多语言文本矢量化器,这个矢量化器已经部署在 Gmail 上,用来提升垃圾邮件和钓鱼邮件的识别率,同时降低误报率。Google称 RETVec 经过训练能够抵御字符级操作,包括插入、删除、拼写错误、同形文字、LEET 替换等,这个模型是在新型字符编码器之上进行训练的,该编码器可以有效针对所有 UTF-8 字符和单词进行编码。
根据Google自己的统计,将 RETVec 应用到 Gmail 后,垃圾邮件检测率比基准提高 38%、误报率降低 19.4%、张量处理单元 (TPU) 使用率降低了 83%。
Google工程师表示由于其紧凑的表示形式,使用 RETVec 训练的模型表现出更快的推理速度,较小的模型可以降低计算成本并减少延迟,这对于大规模系统和设备上的模型至关重要。
投稿:@ZaiHuaBot
频道:@TestFlightCN
Telegram 评论区
0 条回复,可以前往 Telegram 继续讨论。