特征工程:让数据“开口说话”
模型的起点是特征,即把用户、广告和上下文环境转化为可计算的数字。用户特征包括历史点击行为、设备类型、地理位置;广告特征涵盖创意文案、图片风格、品牌知名度;上下文特征则涉及当前网页内容、时间、天气等。但原始数据往往稀疏且高维——比如“用户ID”可能有上亿个取值。工程师会采用哈希技巧、嵌入(Embedding)和交叉特征来压缩维度。例如,将“男性用户”与“运动鞋广告”组合成“男性+运动鞋”的交叉特征,能捕捉到单一特征无法表达的深层关联。这一步骤决定了模型性能的上限,后续的算法只是逼近这个上限。
神经网络架构:从逻辑回归到深度模型
早期Google使用逻辑回归,简单可解释,但无法捕捉非线性关系。如今主流的深度模型(如Wide & Deep)分为两部分:Wide部分(线性模型)负责记忆高频、具体的规则,比如“用户点击过同类广告”;Deep部分(多层神经网络)负责泛化,通过嵌入层将稀疏特征映射为稠密向量,再经过多层全连接层自动学习特征间的复杂交互。一个关键创新是“注意力机制”——模型能动态判断当前场景下哪些特征更重要。例如,深夜搜索“披萨”时,位置特征权重会高于品牌特征。训练时使用带标签的历史点击数据,通过梯度下降优化损失函数(如交叉熵),让预测概率逼近真实点击行为。
实时竞价中的冷启动难题
在实时竞价(RTB)中,每次广告请求必须在50-100毫秒内完成预估。新广告或新用户没有历史数据,这就是“冷启动”困境。Google的解法之一是“分层贝叶斯模型”:将新广告的特征与相似老广告的统计信息进行加权融合。例如,一个新上架的蓝色跑鞋广告,可以借用“运动鞋”类目的平均点击率作为先验,再根据展示后的实时反馈逐步调整。另一个策略是“探索与利用”:在展示初期,模型会故意给新广告一定随机性(探索),以收集数据,同时用汤普森采样等算法平衡短期收益与长期信息增益。此外,模型还利用“元学习”(Meta-Learning)——在大量历史广告上预训练一个“学会如何学习”的模型,使新广告只需几次曝光就能快速适应。
总结:科学框架的平衡艺术
CTR预估的本质,是在有限数据和毫秒级延迟下,对高维稀疏信息进行概率推断。它没有完美的答案,只有不断逼近的近似。特征工程决定了信息的上限,神经网络负责挖掘隐含模式,而冷启动策略则是在不确定性中寻找优解。理解这套框架,不仅能看懂Google的广告系统,更能洞察所有推荐系统、搜索排序背后的通用逻辑——用数据预测人的行为,同时尊重数据的局限。下一次点击广告时,你或许会意识到,那不仅是商业行为,更是一场精妙的概率计算。
