Qian, Cheng

中国营销中的央视平台投放:ROI分析、文化心理与洞察

引言 在中国营销领域,品牌如豆包、微信红包、抖音、支付宝和vivo等热衷于在央视春晚、央视网及央视新媒体等国家级平台投放巨额广告。尽管有观点认为“大家都不看春晚和电视了”,但数据表明这些平台仍具巨大影响力。本文基于调研数据和案例,分析其有效性、ROI论证、文化心理根源,并提炼关键洞察。 央视平台的有效性和影响力 央视春晚等平台已转型为全媒体事件,覆盖电视和新媒体渠道。2026年春晚境内...

让 GPT 帮你从零梳理需求,最后产出一份高质量 Context Prompt 的实践笔记

你可能也遇到过这种场景:脑子里已经有了一个相当清晰的产品/技术想法——比如「给内部平台写一个高性能的 Userscript,全屏重做一套更好用的任务控制台,支持持久化设置、复用现有 UI 风格、还要尽量不卡顿」——但真正开始动手时,却发现一件更难的事: 不是“怎么写代码”,而是“怎么把这件事讲清楚,让另一个 GPT 或 Agent 能接得住”。 你知道自己想要什么:要挂在哪个页面、要怎么...

Transformer 前向流程与自注意力机制简述

在大语言模型(LLM)和各类基于 Transformer 的架构中,前向传播的数据流与自注意力(Self-Attention)的计算顺序是理解模型行为的基础。本文简要梳理从输入到输出的整体流程,以及自注意力中 Query、Key、Value 的交互方式,便于在阅读源码或做推理优化时建立清晰心智模型。 从输入到输出的整体流程 在推理阶段,文本经过分词、嵌入与多层 Transformer 块...

深度学习中的矩阵运算与线性代数基础

在深度学习的实践中,矩阵运算和线性代数是不可或缺的数学基础。本文回顾一些核心概念,并探讨它们在神经网络中的应用。 损失函数与优化 在监督学习中,我们通常需要定义一个损失函数来衡量模型预测与真实值之间的差距。对于回归任务,常用的均方误差(MSE)损失函数定义为: [\text{MSE} = \frac{1}{n} \sum_{i=1}^{n} (y_i - \hat{y}_i)^2] ...

训练大模型时,优化器状态到底在吃多少显存

最近在做 LLM 训练相关的工作,反复被一个问题困住:明明模型参数只有 7B,为什么光是训练就要 100 多 GB 显存?排查下来,一半的”黑洞”藏在优化器状态里。这篇文章就是我梳理这块知识的记录,从 Adam 的基本原理出发,一路聊到分布式训练下的优化手段。 从 Adam 的两个动量说起 Adam 之所以好用,核心在于它对每个参数维护了两套独立的历史统计量——也就是常说的一阶动量 ...

不同硬件和推理引擎模型输出的精度差异

不同硬件(如NVIDIA GPU, 华为Ascend NPU)和不同推理框架(如PyTorch, vLLM, MindIE)上,对同一模型相同输入进行推理得到不同结果: 浮点数计算的非确定性 现代处理器为追求极致性能,广泛采用并行计算与融合运算(FMA),导致浮点运算顺序不固定 由于浮点数运算不满足严格的结合律 (a+b)+c ≠ a+(b+c),不同的计算顺序会导致微小的...