我做了一个中文论坛聚合页,欢迎来看看

发布于

qzhai: 昨天在「除了 V2 你们还去哪里逛啊」 [v2ex.com/t/1233776](http://v2ex.com/t/1233776) 里贴了个链接,没想到不少人喜欢,索性今天在这里简单介绍一下。

因为文采不好以下有 80% ai 润色。。。
---

起因很土。每天 V2EX、NodeSeek、[linux.do](http://linux.do) 和小众软件挨个开一遍,一半时间在看重复的,另一半在翻水贴。就想把这些站的帖子拉到一页,让 AI 先过一遍,把明显没营养的滤掉。

所以 [这个链接](https://n.mumingfang.com/intel),我导航站里的一页,只有标题和摘要,点了跳原站。

## 做了些什么

拉了 23 个源的最新帖,加 8 个站的当日热榜。三台机器分工,一台国内的抓国内站(有些直接挡机房 IP,海外抓不动),一台海外的过 Cloudflare 顺便跑 AI 判定,站上只管渲染。

不是非要三台服务器,是正好有两台闲置的……一台海外的,一台国内的(年前为了玩龙虾买的)。

判定就是把标题批量喂给模型,让它输出 tier(0 拦掉,1 到 3 是力度)、type(优惠 / 小道消息 / 资讯)和版面分类。48 小时窗口,每天能稳定吐出 1.0k 条。

## 踩过的坑

热榜和最新流不能共用一套判定。最新流判的是「值不值得看」,加热榜的时候图省事直接复用了,结果职场和种草两个分类全空。论坛真热帖大量就是闲聊晒单,[linux.do](http://linux.do) 日榜榜首《(燃尽了)那个,奏乐,起舞~》直接被判成水贴。现在热榜只判合规不判价值,热度是用户拿回复投出来的,不用 AI 再投一次。

跨站热度不能比绝对数。同一时刻 [linux.do](http://linux.do) 榜首 5823 浏览,NodeLoc 榜首 304,差 19 倍。名次也不能用百分位,50 条榜单的第 30 名和 10 条榜单的第 6 名都算 0.4,含金量差远了,长榜单的大站会把版面吃光。后来改成按绝对名次半衰才正常。

## 关于 ai 过滤

prompt 里得把话说死,不然模型偷懒。比如「判成优惠 tier 只能给 1 或 2」,不写它就全扔垫底档;「带据传、曝光、涨价、裁员这类词的讨论帖算爆料不算水贴」,不写爆料贴全被当闲聊清掉。另外让它拦截的时候顺便输出一个原因词,调 prompt 的时候特别有用。

Discourse 的 latest.json 要取 created_at 不是 bumped_at,V2EX 取 created 不是 last_touched,不然一条新回复就能把三个月前的老帖顶进「最新」。

GLM-4.5 和 4.7 是思考模型,不传 thinking disabled 会返回空内容或者超时,我排查半天以为是限流。

## 成本

判定结果按帖子缓存,热榜重复率极高,首轮判 150 条,第二轮只剩 7 条,整轮 27 秒跑完。模型主要吃 GLM 的免费额度包,兜底才走付费,一个月下来个位数。机器是本来就闲着的两台。

抓取节奏是白天 15 分钟一轮,晚上 30 分钟,深夜 4 小时,热榜 30 分钟。上次回复我说 5 分钟,是记岔了。RSS 还没做,记下了。

有推荐的源欢迎说,尤其是有真实热度排序的中文榜单。


再贴一次 [这个链接](https://n.mumingfang.com/intel)

---

原文链接:[点击查看](https://www.v2ex.com/t/1234021)

评论(2)

感觉这个页面的配色有点刺眼啊,可以考虑换个温和一点的。

· 0 个赞

挺不错的,能聚合这些信息,挺实用的。

· 0 个赞

0.045030s