给 AI 研究人员提个醒,做高度兴趣内容推荐,可能一开始方式就错了!

发布于

soyoumi: 先从我看到 OpenBiliClaw 这个民间的 GitHub 项目说起,这个项目是用 AI 给用户专门做内容推荐。当我看到这个项目的时候,简直欣喜若狂,因为终于有人搞出来高度推荐兴趣内容的东西。当然,我也知道,做这种事情绝对不止一个公司或科研机构。人类面对海量互联网数据,必然需要一种高度推荐兴趣内容的技术变革,未来这是必然的,肯定会有很多公司或科研机构来推动这种科技变革。

我现在转念一想,虽然这种事情在进步,但目前的发展,做这种事情的方式,可能一开始就错了!

### 为什么方式错了?

语言模型通常会用思维逻辑加上特征分析,用户给出的喜好内容作为数据参考,依此来提高推荐效果。思维逻辑和特征分析确实能够找到一些喜欢的因素,但其概率仍然很小。真正戳中用户喜好的因素其实是少之又少。要理解这一点,需要明白人类的喜好是相当复杂的。我们看到的、听到的,包括内心的感受,任何一个画面、行为、微笑等,都可能成为喜欢或不喜欢的因素。人类的喜好是许多复杂因素交织在一起的,用语言来表达喜欢是一种比较低级的方式,因为很多复杂的交织因素,很难用语言表达出来,但人却能很快地分辨出喜欢和不喜欢的内容。这种判断依赖于感知,而不是逻辑。

由此可见,用户提供的喜好内容,根本无法反馈出更多真实的数据。例如,AI 发现我喜欢 TIM 荒岛生存挑战,又发现我喜欢荒岛游戏,它可能会推测我喜欢荒野求生和相关的求生装备,这样的推理从正常逻辑上看没错,但实际上我真正的喜好并非是荒岛生存本身,因为那是环境残酷、生活糟糕的结果。我喜欢的荒岛游戏,只是想找到一个内容丰富、制作精良的佳作,除此之外在这方面我其实并不再喜欢其他东西。但是 AI 却会不停地给我推荐荒野生存之类的内容,要不就一直推荐此类,要不就是断开推荐。

我举这个例子是想说明人类的喜好是复杂的,很多时候 AI 的方式陷入了对于真实数据的脱离。我知道,有人会说让 AI 避雷,不再推荐此类内容不就可以了。实际上我提的仅是其中之一,人类的喜好极其复杂。我并不是完全否定不喜欢荒野生存内容,这里非常复杂。要让 AI 更好地适应这种复杂性,那绝对不是一件简单的事情,因为人类的语言表达本身就是一项困难的任务。

### 我有一个想法

这个想法是因素团序列 + 专用语言模型(人类喜好的兴趣内容的专用模型)。我前面提到的因素,你应该知道我所说的是什么。因素团就是很多复杂因素的集合,而因素团序列的意思是:某些交织在一起的复杂因素,可以称为序列。这是更加精准的复杂喜好的特征描述,需要研究和列举出一些因素团序列,这些都是来自人类的真实数据。专用语言模型是基于人类真实数据和复杂喜好研发的专门模型,它有适用人类复杂喜好的逻辑思维。例如,对于我刚才提到的荒岛内容的喜好,它有一些逻辑思维适用于这种复杂喜好的情形。

因此,研究人员在用 AI 推荐高度喜欢的内容时,第一步的方式可能就错了,而改进的做法则是需要从这些层面去研究,普通的爱好者是无法做到的。

这些可以提醒那些研究人员。而对于 OpenBiliClaw 的使用者,可以通过一些方法提高推荐的精准度,建议的关键在于兴趣探针。除了确定喜欢、不喜欢和避雷之外,建议一定要多聊聊,通过交流来传达精准的喜好描述。例如,刚才提到的荒野生存内容,AI 仅仅认为我喜欢这类内容,而根本不知道我真正的喜好原因。复杂因素团人类是非常难用言语表达的,但通过表达力和感知表述训练,仍然能够做到一定的精准描述。

---

原文链接:[点击查看](https://www.v2ex.com/t/1227980)

评论

暂无评论。