← 全部经历

AI 产品实习生 · WPS 表格 AI 产品组 · 2026.01 – 2026.05

WPS 表格
AI 公式能力升级

用户不会写公式,问题往往不在生成质量,而在「表达之前」——他们不知道怎么把需求说成一句 Query。我主 own 的项目就是把这一步拿掉。

公式创作链路 · 写公式前 · 写公式中 · 底层测评 · 数据验证 · 流程沉淀

01

业务地图

公式被纳入 O1,不是因为它复杂,而是因为它同时具备高频、高门槛和强结果闭环——这三件事同时成立的功能很少。

主线从表格组目标出发:表格日活年度目标 130w → 260w。用户每天在算、查、配、汇总,却常常不会写、不会表达、不会填参数。我们把它拆成一条链路来看,而不是当成一个「AI 生成公式」的单点功能。

公式创作链路 · 分段与归属

阶段要解决什么对应功能
写公式前降低表达门槛AI 公式推荐
写公式中降低参数成本函数参数推荐
写公式后评估、修正与复用
底层测评体系与样张支撑上述三段
验证埋点取数与流程沉淀支撑上述三段

核心指标:表格 DAU 与 AI 有效行为 · 公式能力采纳与留存复用 · 服务表格 DAU 增长

02

AI 公式推荐

主 OWN写公式前段

AI 写公式面板日均约 13 万用户打开,其中 71.3% 从未发送过一条 Query。

问题不在生成质量,在表达之前。

如果用户连第一句话都说不出来,优化模型的输出准确率是没有意义的。方案因此改变了输入形态:不再等用户描述需求,而是基于表格结构、激活单元格与表头,直接推荐 1–3 条完整公式,并附带解释、编译校验与异常态。用户要做的从「描述」降级为「挑选」。

AI 写公式漏斗 · 两周数据

展示11,378,203
点击1,460,283
发起请求428,182
结果应用114,267
展示 → 点击12.83%
点击 → 发起请求29.32%
成功 → 应用75.47%

关键背景

日均打开 UV约 130,000
打开后未发送 Query71.3%
发送 Query 后采纳率75.3%
潜在可服务用户约 34,000 / 日

结果

AI 公式推荐正确率41.28% → 62.09%
03

函数参数推荐

写公式中段

用户已经知道要用哪个函数,却卡在参数选择、区域填写与跨表引用上。

这一段的核心判断是低干扰:入口放在函数参数弹窗内,不打断写公式的主流程。上线后的数据把判断劈成了两半——点击后采纳率 43.2% 说明推荐质量站得住,但入口点击率只有 0.86%,说明用户在那个位置根本没有形成心智。

不打断主流程的代价,是没人注意到它。

这是我在这段实习里学到最贵的一课:低干扰和可发现性是一对权衡,不是可以同时最大化的两个目标。如果重做,我会先验证入口的可发现性,再谈干扰控制。

上线后数据

曝光 UV227,202
点击 UV1,955
采纳 UV845
入口点击率0.86%
点击后采纳率43.2%
曝光后采纳率0.37%

函数分布 · 示例

VLOOKUPPV 78.97%
IFPV 8.23%
SUMIFPV 4.15%
COUNTIFPV 2.16%
其他PV 6.49%

结果

参数推荐正确率28.02% → 67.02%
04

测评体系与样张

底层能力

AI 公式不能只看生成的文本对不对,要在真实表格、真实 Query 里验证。

人工编造的题目会系统性地偏离真实分布——编题的人会不自觉地写出规范的需求描述,而线上 28.7% 的 Query 短于 10 个字。所以样张必须反向来做:先从 121,760 条线上 Query 分析函数分布与表达类型,再去找能承载这些 Query 的真实文件。

测试集从线上分布反推,不从人的想象出发。

样张建设逻辑

  1. 从线上真实 Query 分布出发,反向寻找真实文件与表结构,而非人工编造题目
  2. 文件来源优先级:WPS 既有用户样本 → ExcelHome → WPS 模板 → 人工构造
  3. Query 编写规范分五类:极简 / 业务意图 / 带引用 / 口语错别字 / 指定函数
  4. 每条样张沉淀「真实文件 + 用户 Query + 激活单元格 + 预期公式」四要素

Query 样本分布 · n = 121,760

总 Query121,760
需要函数占比84.9%
用户明确指定函数3.8%
Query < 10 字28.7%
Query 10–30 字52.4%
Query > 30 字19.0%

评测维度

评测分档正确 / 微调可用 / 不可用
Case 优先级P0 / P1 高 / P1 低
错误类型条件、区域、引用、语法、表头识别、跨表
05

埋点取数与流程沉淀

数据验证流程层

功能上线不等于行为改变。要判断有没有真的改变,得先把行为链路变成可追踪的事件。

我把用户行为链路拆成六个埋点事件,覆盖从曝光到失败原因的全路径,使「有没有用」这个问题变成可回答的。同时把重复劳动沉淀成 Skill 与自动化流程,让后续同类项目不必从零开始。

重复三次以上的判断,应该变成流程而不是经验。

埋点链路 · 核心事件

  • 曝光
  • 结果展示
  • 推荐点击
  • 结果使用 / 取消选择
  • 异常状态 / 失败原因
  • 请求耗时

效率沉淀

参数测评2–3h → 25min
AI 自动评价5–6h → 1h

沉淀方法论

PRD Skill背景 → 场景 → 状态 → 指标
埋点 Skill从行为路径定义事件
取数 Skill口径 → SQL → 分析 → 结论
自动化测评覆盖 → 运行 → 评价 → 输出