一到三个词的 N 元组
文本被切成连续的词组。这是把自由文本变成可测量的东西的那一步。
丢掉人称代词
人们会写「帮我学会了」这样的短语:在提取器里排得很前,搜的人是零。
丢掉品牌
应用的名字几乎出现在它的每条评论里,带不来任何新短语。
按国家折叠
按商店的规则而不是全局规则,免得一个短语裂成两行。
决定质量的是筛选
提取 N 元组是机械活,谁都能做。把一份有用的清单和一堆噪音分开的,是之后扔掉了什么。
改变结果最多的是人称代词筛选。评论用第一人称写,提取器于是很乐意返回一堆证言式短语:句子没错,出现频繁,背后没有搜索意图。
接着掉的是品牌重复和虚词。活下来的是一份很短的词汇表,几乎不在任何人的元数据里。
提取之后发生什么
什么都不会直接进元数据。每个通过筛选的短语都会被测量:在你打算用它的那个国家测热度和难度。
很多会被证明是底噪,而这也是信息:人们这么说,但不这么搜。通过测量的进入词库,和其余的一起争位置。
你的评论和对手的评论
你自己的评论描述的是你已经在做的事,这些词通常已经在你的字段里。它们主要的用处是让你发现人们怎么称呼一个你用别的名字叫的功能。
对手的更值钱,最严厉的那些更是如此:它们描述的是你的产品可以填上的缺口,用的正是会被拿来搜索这个缺口的词。
它不做什么
我们不会声称测量了测不到的东西。这个界面的边界:
- 我们不把评论压成一个情感分:输出的是短语,不是分数。
- 单条评论不是信号;重要的是跨越多个应用、多个月份的重复。
- 提取出来的短语不会自己写进元数据:先测量。
常见问题
- 需要多少条评论?
- 看分类,但低于几百条结果只是轶事。所以也要读对手的。
- 为什么丢掉带人称代词的短语?
- 因为它们描述的是体验,不是搜索。没有人会在商店的搜索框里打「帮我学会了」。