会伴指数:排名方法论 (CP-I)
会伴指数是我们给收录的每一个会议算的 0–100 分。这一页公开全部算法:每一个因子、每一个权重、每一张映射表。这里没有任何不公开的部分 —— 我们要的正是你能自己复算出任何一个分数,并在我们算错时告诉我们。
算法版本 1.1 · 已评分会议 5,646 个 · 查看完整榜单
我们为什么要自己做一个指数
CCF、ICORE、QUALIS 是研究者真正会引用的三份榜单,我们把三份都原样转载。但它们加起来只覆盖我们收录会议的约五分之一:大约每五条里有四条,三列评级全是空的。而那些恰恰是最需要有人帮着判断的会议 —— CVPR 是什么水平不用谁来告诉你。这个指数存在的意义,就是对剩下那 80% 说一句站得住的话。
这个分数不是什么
- 它不是同行评议的判断。我们不读论文,也不做研究者问卷。
- 它不与 CCF / ICORE / QUALIS 竞争。凡是这些榜单评过的会议,它们给的等级就是这个分数里权重最大的那一项输入。
- 它不衡量这个会议现在是否在征稿。那是榜单页上一个独立的筛选开关,刻意没有算进分数里。
- 没有人能花钱改分数,本站任何一张榜单上的位置都无法购买。
五个因子
| 因子 | 权重 | 衡量什么 |
|---|---|---|
| 学术认可 | 35% | 该会议在 CCF / ICORE / QUALIS 中的最高等级。我们只是转载这三份榜单,不去替它们做判断;三份都未收录的会议按中性基准计分,不会被扣分。 |
| 投稿选择性 | 20% | 有投稿数与录用数记录的最近几届的平均录用率。 |
| 会议传承 | 20% | 这个会议有据可查地办过多少届:取届次序号,以及我们持有记录的年份跨度。 |
| 社区关注 | 10% | 在会伴上关注该会议、或在过去 24 个月里打开过它页面的去重研究者人数。这一项衡量的是我们自己的社区(以读中文的计算机方向研究者为主),所以权重被刻意压低。 |
| 资料公开度 | 15% | 公开资料齐不齐:官网、征稿全文、录用率、最佳论文记录、历届信息,以及最新一届是否够新。这一项衡量的是资料完备程度、不是学术水平。它是认领通过的主办方唯一能直接提升的因子,而其中分值最高的三项 —— 录用率、历届信息、最佳论文 —— 恰恰只有主办方拿得出。 |
数据缺失按中性基准计分,绝不按 0 计
绝大多数会议至少缺一个因子。某个因子未知时,我们按 50 分(中性基准)计入 —— 既不加分也不扣分 —— 同时调低与分数并列公布的置信度。
另外两种做法是被我们刻意否掉的。缺失按 0 分计,会把所有非计算机学科的会议一律判死 —— CCF 与 ICORE 只收计算机,QUALIS 是巴西体系,「不在里面」对一个材料学会议毫无信息量。而「只按已有的因子重新归一化」,会让一个除了办得久之外什么记录都没有的会议,与一个真的被人评估过的会议得到同样高的分。
这也是为什么多数会议的分数落在 40–50 之间。那是中性基准透出来的结果,不是不及格 —— 它的含义是「我们对这个会议还知道得不多」。看分数时请一并看置信度。
精确映射表
学术认可
我们取该会议在三份榜单中的最高等级。取平均会让「被更多榜单收录」反而吃亏 —— 一个 CCF-A 同时被 ICORE 评为 B 的会议,会低于只进了 CCF 的那个 —— 这显然不对。
| CCF | A → 100 · B → 82 · C → 66 |
|---|---|
| ICORE | A* → 100 · A → 88 · B → 72 · C → 58 |
| QUALIS | A1 → 100 · A2 → 92 · B1 → 78 · B2 → 68 · B3 → 60 · B4 → 54 · B5 → 48 |
投稿选择性
我们取有记录的最近几届(至多 5 届)的录用率均值,且只统计投稿数不少于 20 的届次。录用率不高于 12% 得 100 分;不低于 70% 得 30 分。
地板分刻意不是 0。录用率缺失时按中性的 50 分计,如果「公布了一个很高的录用率」得 0 分,那么把数字藏起来就比诚实公布更划算。把地板定在现在这个位置、再加上录用率数据本身也计入资料公开度,公布一个不好看的录用率在总分上大致是不亏不赚的。
会议传承
一条在第 40 届达到 100 分的对数曲线:第 1 届与第 5 届之间的差别,远大于第 36 届与第 40 届之间的差别。届次数取三者中的最大值:库内记录的届次序号、我们持有快照的历届数,以及我们持有任何记录的年份跨度。
社区关注
两个都按人去重的计数:关注该会议的注册用户,以及过去 24 个月里打开过它页面的注册用户。两条曲线都是对数的,分别在 300 位关注者与 400 位读者处饱和。
这是会伴社区内部的关注度,人群偏向计算机方向、偏向读中文的研究者。它不是全球热度 —— 这正是它在总分里被压到 15% 的原因。我们没有用会议页面上那个浏览量计数器:那个数字从未重置过,也不排除爬虫。
资料公开度
我们持有的每一项公开资料各计若干分。这一项衡量的是资料完备程度、不是学术水平 —— 而且它是主办方唯一能直接改善的因子:认领这个会议,把缺的补上即可。
- 有官网地址 — 10
- 有征稿全文 — 15
- 有历年录用率 — 30
- 有最佳论文记录 — 15
- 有历届信息 — 20
- 最新一届在过去 24 个月内 — 10
如何提升一个会议的得分
每一项输入都是你可以自己补上的。认领通过的主办方在会议页面上几分钟就能全部填完,分数每晚重算一次。下面的数字是当前算法版本下的确切增量 —— 它们与评分代码取的是同一份常量,不是手写上去的。
| 补什么 | 能涨多少 | 为什么会涨 |
|---|---|---|
| 历年录用率 | 最多 14.5 分 | 这是最有效的一项,因为它一次做两件事:本身值资料公开度里的 30 分,同时把「投稿选择性」从未知(按中性基准计分)变成有实测值。录用率低的会议涨得多;录用率高的会议照样涨,绝不会掉分。具体说:录用率 20% 值 12.6 分,40% 值 7.7 分,哪怕 80% 也还有 0.5 分。 |
| 历届信息 | 3.0 分,往往还不止 | 本身值资料公开度里的 20 分。它往往还会同时抬高「会议传承」那一维:我们按持有记录的年份跨度算届次,补上更早的几届,能证明的历史比单看届次序号更长。它同时也是「会议系列」页的数据来源。 |
| 最佳论文记录 | 2.3 分 | 获奖论文是「这个会议究竟发表什么水平的工作」最直接的公开证据;它们还会收进本站的最佳论文聚合页,研究者与搜索引擎都能在那里找到。 |
| 完整征稿全文 | 2.3 分 | 要有成篇的征稿正文,不能只放一个链接。绝大多数会议本来就有,所以它的分值低于上面几项。 |
四项全部补齐,通常能把一个会议抬高 10 到 20 分,并把置信度从 0.45 左右提到 0.85 以上 —— 置信度和分数一样重要,因为人和 AI 助手真正会引用的是高置信度的那个分数。
怎么做:打开会议页面,以主办方身份认领,录用率、历届信息与最佳论文的录入入口就会出现在那一页上。还没做的项目也会列在主办方看板的待办清单里。认领会议
我们刻意没有采用的东西
- 会议页面上那个浏览量计数器。它从 2013 年起累计每一次访问、从未重置、也不排除爬虫,所以它衡量的是这个页面被抓取了多少次,而不是有多少研究者在意这个会议。
- 这个会议看起来是不是停办了。我们大约一半的条目在过去两年里没有新一届记录,但那多半反映的是我们自己的数据陈旧,不是会议停办。拿我们的维护欠账去扣会议的分是不公平的;而且那会把两个不同的问题 ——「这个会议口碑如何」与「现在还能不能投」—— 揉成一个数,结果两个都答不了。
- 引用次数与文献计量指标。我们没有这类数据,而援引一份自己无法核实的别家数字,会让这个分数变得不可证伪。
已知的局限
- 跨学科比较两个会议通常没有意义。请看每个会议页面上的领域内名次 —— 那是在带同一个研究领域标签的会议之间比。
- 录用率的覆盖面很薄。不到十分之一的会议有可用的投稿数与录用数记录,所以多数条目的选择性因子回落到中性基准。
- 社区关注这一项偏向在本站收录时间更长的会议,也偏向我们用户所在的那些方向。
- 研究领域标签是按会议全称自动打的,因此有少数会议会出现在错误的领域榜里。告诉我们,我们会更正标签。
分数不对怎么办
每一个分数都是会议页面上那些看得见的数据的函数,所以分数不对就意味着输入数据错了或缺了。最快的办法是以主办方身份认领这个会议,自己把缺的录用率、历届信息和征稿全文补上;分数每天重算一次。如果是别的问题,请发邮件到 [email protected],告诉我们是哪个会议、哪个因子。
稳定性
一个会议的分数只在它的输入数据变化时才变。名次是对整个收录集合一次性算完后落库的,所以会议页面上显示的名次与它在榜单里的位置永远不会对不上。我们每次改动权重或映射表,都会把上面那个算法版本号往上跳一位,并全量重算。