会伴指数:排名方法论 (CP-I)

会伴指数是我们给收录的每一个会议算的 0–100 分。这一页公开全部算法:每一个因子、每一个权重、每一张映射表。这里没有任何不公开的部分 —— 我们要的正是你能自己复算出任何一个分数,并在我们算错时告诉我们。

算法版本 1.1 · 已评分会议 5,646 个 · 查看完整榜单

我们为什么要自己做一个指数

CCF、ICORE、QUALIS 是研究者真正会引用的三份榜单,我们把三份都原样转载。但它们加起来只覆盖我们收录会议的约五分之一:大约每五条里有四条,三列评级全是空的。而那些恰恰是最需要有人帮着判断的会议 —— CVPR 是什么水平不用谁来告诉你。这个指数存在的意义,就是对剩下那 80% 说一句站得住的话。

这个分数不是什么

  • 它不是同行评议的判断。我们不读论文,也不做研究者问卷。
  • 它不与 CCF / ICORE / QUALIS 竞争。凡是这些榜单评过的会议,它们给的等级就是这个分数里权重最大的那一项输入。
  • 它不衡量这个会议现在是否在征稿。那是榜单页上一个独立的筛选开关,刻意没有算进分数里。
  • 没有人能花钱改分数,本站任何一张榜单上的位置都无法购买。

五个因子

因子 权重 衡量什么
学术认可 35% 该会议在 CCF / ICORE / QUALIS 中的最高等级。我们只是转载这三份榜单,不去替它们做判断;三份都未收录的会议按中性基准计分,不会被扣分。
投稿选择性 20% 有投稿数与录用数记录的最近几届的平均录用率。
会议传承 20% 这个会议有据可查地办过多少届:取届次序号,以及我们持有记录的年份跨度。
社区关注 10% 在会伴上关注该会议、或在过去 24 个月里打开过它页面的去重研究者人数。这一项衡量的是我们自己的社区(以读中文的计算机方向研究者为主),所以权重被刻意压低。
资料公开度 15% 公开资料齐不齐:官网、征稿全文、录用率、最佳论文记录、历届信息,以及最新一届是否够新。这一项衡量的是资料完备程度、不是学术水平。它是认领通过的主办方唯一能直接提升的因子,而其中分值最高的三项 —— 录用率、历届信息、最佳论文 —— 恰恰只有主办方拿得出。

数据缺失按中性基准计分,绝不按 0 计

绝大多数会议至少缺一个因子。某个因子未知时,我们按 50 分(中性基准)计入 —— 既不加分也不扣分 —— 同时调低与分数并列公布的置信度。

另外两种做法是被我们刻意否掉的。缺失按 0 分计,会把所有非计算机学科的会议一律判死 —— CCF 与 ICORE 只收计算机,QUALIS 是巴西体系,「不在里面」对一个材料学会议毫无信息量。而「只按已有的因子重新归一化」,会让一个除了办得久之外什么记录都没有的会议,与一个真的被人评估过的会议得到同样高的分。

这也是为什么多数会议的分数落在 40–50 之间。那是中性基准透出来的结果,不是不及格 —— 它的含义是「我们对这个会议还知道得不多」。看分数时请一并看置信度。

精确映射表

学术认可

我们取该会议在三份榜单中的最高等级。取平均会让「被更多榜单收录」反而吃亏 —— 一个 CCF-A 同时被 ICORE 评为 B 的会议,会低于只进了 CCF 的那个 —— 这显然不对。

CCF A → 100 · B → 82 · C → 66
ICORE A* → 100 · A → 88 · B → 72 · C → 58
QUALIS A1 → 100 · A2 → 92 · B1 → 78 · B2 → 68 · B3 → 60 · B4 → 54 · B5 → 48

投稿选择性

我们取有记录的最近几届(至多 5 届)的录用率均值,且只统计投稿数不少于 20 的届次。录用率不高于 12% 得 100 分;不低于 70% 得 30 分。

地板分刻意不是 0。录用率缺失时按中性的 50 分计,如果「公布了一个很高的录用率」得 0 分,那么把数字藏起来就比诚实公布更划算。把地板定在现在这个位置、再加上录用率数据本身也计入资料公开度,公布一个不好看的录用率在总分上大致是不亏不赚的。

会议传承

一条在第 40 届达到 100 分的对数曲线:第 1 届与第 5 届之间的差别,远大于第 36 届与第 40 届之间的差别。届次数取三者中的最大值:库内记录的届次序号、我们持有快照的历届数,以及我们持有任何记录的年份跨度。

社区关注

两个都按人去重的计数:关注该会议的注册用户,以及过去 24 个月里打开过它页面的注册用户。两条曲线都是对数的,分别在 300 位关注者与 400 位读者处饱和。

这是会伴社区内部的关注度,人群偏向计算机方向、偏向读中文的研究者。它不是全球热度 —— 这正是它在总分里被压到 15% 的原因。我们没有用会议页面上那个浏览量计数器:那个数字从未重置过,也不排除爬虫。

资料公开度

我们持有的每一项公开资料各计若干分。这一项衡量的是资料完备程度、不是学术水平 —— 而且它是主办方唯一能直接改善的因子:认领这个会议,把缺的补上即可。

  • 有官网地址 — 10
  • 有征稿全文 — 15
  • 有历年录用率 — 30
  • 有最佳论文记录 — 15
  • 有历届信息 — 20
  • 最新一届在过去 24 个月内 — 10

如何提升一个会议的得分

每一项输入都是你可以自己补上的。认领通过的主办方在会议页面上几分钟就能全部填完,分数每晚重算一次。下面的数字是当前算法版本下的确切增量 —— 它们与评分代码取的是同一份常量,不是手写上去的。

补什么 能涨多少 为什么会涨
历年录用率 最多 14.5 分 这是最有效的一项,因为它一次做两件事:本身值资料公开度里的 30 分,同时把「投稿选择性」从未知(按中性基准计分)变成有实测值。录用率低的会议涨得多;录用率高的会议照样涨,绝不会掉分。具体说:录用率 20% 值 12.6 分,40% 值 7.7 分,哪怕 80% 也还有 0.5 分。
历届信息 3.0 分,往往还不止 本身值资料公开度里的 20 分。它往往还会同时抬高「会议传承」那一维:我们按持有记录的年份跨度算届次,补上更早的几届,能证明的历史比单看届次序号更长。它同时也是「会议系列」页的数据来源。
最佳论文记录 2.3 分 获奖论文是「这个会议究竟发表什么水平的工作」最直接的公开证据;它们还会收进本站的最佳论文聚合页,研究者与搜索引擎都能在那里找到。
完整征稿全文 2.3 分 要有成篇的征稿正文,不能只放一个链接。绝大多数会议本来就有,所以它的分值低于上面几项。

四项全部补齐,通常能把一个会议抬高 10 到 20 分,并把置信度从 0.45 左右提到 0.85 以上 —— 置信度和分数一样重要,因为人和 AI 助手真正会引用的是高置信度的那个分数。

怎么做:打开会议页面,以主办方身份认领,录用率、历届信息与最佳论文的录入入口就会出现在那一页上。还没做的项目也会列在主办方看板的待办清单里。认领会议

不会让分数变高的做法: 给我们付钱、在我们这里投广告,或者直接来要。名次没有任何商业通道;填写站不住的数据同样没用 —— 录用率与历届信息就公示在会议页面上、紧挨着分数,任何人都能拿它们对照你自己的官网核实。

我们刻意没有采用的东西

  • 会议页面上那个浏览量计数器。它从 2013 年起累计每一次访问、从未重置、也不排除爬虫,所以它衡量的是这个页面被抓取了多少次,而不是有多少研究者在意这个会议。
  • 这个会议看起来是不是停办了。我们大约一半的条目在过去两年里没有新一届记录,但那多半反映的是我们自己的数据陈旧,不是会议停办。拿我们的维护欠账去扣会议的分是不公平的;而且那会把两个不同的问题 ——「这个会议口碑如何」与「现在还能不能投」—— 揉成一个数,结果两个都答不了。
  • 引用次数与文献计量指标。我们没有这类数据,而援引一份自己无法核实的别家数字,会让这个分数变得不可证伪。

已知的局限

  • 跨学科比较两个会议通常没有意义。请看每个会议页面上的领域内名次 —— 那是在带同一个研究领域标签的会议之间比。
  • 录用率的覆盖面很薄。不到十分之一的会议有可用的投稿数与录用数记录,所以多数条目的选择性因子回落到中性基准。
  • 社区关注这一项偏向在本站收录时间更长的会议,也偏向我们用户所在的那些方向。
  • 研究领域标签是按会议全称自动打的,因此有少数会议会出现在错误的领域榜里。告诉我们,我们会更正标签。

分数不对怎么办

每一个分数都是会议页面上那些看得见的数据的函数,所以分数不对就意味着输入数据错了或缺了。最快的办法是以主办方身份认领这个会议,自己把缺的录用率、历届信息和征稿全文补上;分数每天重算一次。如果是别的问题,请发邮件到 [email protected],告诉我们是哪个会议、哪个因子。

稳定性

一个会议的分数只在它的输入数据变化时才变。名次是对整个收录集合一次性算完后落库的,所以会议页面上显示的名次与它在榜单里的位置永远不会对不上。我们每次改动权重或映射表,都会把上面那个算法版本号往上跳一位,并全量重算。