跳转至

PRD:Paper Graph Time(权威论文源版本)

版本信息

  • 产品名称:Paper Graph Time
  • 版本定位:权威论文源版本(Primary + Secondary 权威书目源)
  • 文档日期:2026-01-24

交付形态(纯 Web + 静态页面)

  • 形态:纯 Web 静态站点,无数据库、无后端 API。
  • 数据:所有图谱与榜单以版本化 JSON 静态文件发布(可追溯、可复核、可缓存)。
  • 更新:离线采集与构建管线生成新版本数据包,站点按版本发布。

产品形态与交付物(结论)

这个产品的形态是“研究导航器”,入口是权威论文流,骨架是可解释的图谱,燃料是时间序列信号,交付物是三件事:本周热点清单、可复用的研究路径、方法迁移的扩散回放。Web 端每个页面都围绕“少点开、快定位、可追溯、可导出”设计。

一句话产品构想

把论文从“线性阅读”变成“图上探索”,用户用时间窗口锁定增量,用图边证据锁定关系,用路径导出沉淀团队知识。

产品目标(写死三条,可用数据复核)

  1. 用户 3 分钟看到过去 7 天热点主题与关键论文,证据形态是 cluster 新增论文数、时间加权中心性、引用与复用边增量。
  2. 用户 10 分钟沿着方法脉络走出一条 5-12 篇论文的可复用路径,证据形态是可解释边链路,边来自引用、同评测集、同方法关键词、同代码实现。
  3. 用户能回放方法从任务 A 扩散到任务 B 的时间顺序,证据形态是边的首次出现时间序列与关键节点的增长曲线。

目标用户与核心闭环

  • 用户分三类:研究员要找方向,工程团队要找可落地的技术线,开源模型厂商要找方法迁移与竞品动向。
  • 闭环只做四步:选时间窗 → 选主题或方法节点 → 沿边走出路径 → 导出清单并订阅后续增量。
  • 产品成功的可复核指标:Time to Value < 3 分钟;单次会话形成收藏或导出比例 > 20%;同一主题 7 日回访率 > 30%。

数据源范围(限定为权威论文源与权威书目源)

Primary 权威论文源(直接进图)

  1. arXiv:覆盖 AI 预印本主干,提供 API、OAI-PMH 与 bulk metadata,适合日更增量抓取。
  2. OpenReview:覆盖 ICLR 与大量顶会工作流,提供 API v2,支持按 venue 拉取 submission、decision、revision 结构。
  3. ACL Anthology:覆盖 NLP 正式出版与会议论文,元数据在官方 GitHub,提供 Python 包入口。
  4. PMLR:覆盖 ICML proceedings 与大量 workshop,公开按 volume 组织的论文目录与 PDF。
  5. CVF Open Access:覆盖 CVPR、ICCV、WACV 等计算机视觉会议的开放版本。
  6. NeurIPS proceedings:官方论文列表与开放页面可直接摄取,适合做顶会年度回放。

Secondary 权威书目与引用源(补全与去重)

  1. OpenAlex:提供 works 与实体图谱 API,适合补 DOI、机构、引用与跨源归一,需要 API key。
  2. Crossref REST API:提供 DOI 元数据、license、ORCID、ROR 等字段,适合校验出版信息与补缺失 DOI。
  3. Semantic Scholar API:提供 paper、author、venue、citations 等查询与图数据,适合补 citation graph 与作者画像,注意 S2 自有 ID 体系。

受限源处理原则

  • IEEE Xplore 有官方 API,能拿到大量会议与期刊元数据与摘要,开放全文依赖其开放接口与授权。
  • ACM Digital Library 以订阅认证为主,默认不抓全文,仅用 Crossref 与 OpenAlex 补元数据。

核心数据模型(保证每条边可解释)

节点类型(固定四类,可选 Dataset)

  • Paper
  • Method
  • Task
  • Model
  • Dataset(可选)

边类型(固定六类)

  • CITES
  • EXTENDS
  • EVALUATED_ON
  • USES_DATASET
  • APPLIES_METHOD_TO_TASK
  • IMPLEMENTS_CODE

证据字段

  • 每条边必须带 evidence 字段。
  • evidence.type 取值限定为:citationshared_datasetshared_metricsemantic_similaritysame_venue_revision
  • evidence.payload 存原始可回指字段,例如 DOI、arXiv id、OpenReview forum id、ACL anthology id、CVF url。

数据与图谱的可信度机制

  • 任何推荐都必须能回指证据形态,否则只展示不排序。
  • 边的证据类型固定在可审计集合:citation(来自 DOI 引用链)、shared_dataset(同一数据集标注)、semantic_similarity(向量近邻并展示相似段落)、same_venue_revision(OpenReview 版本关系)。
  • 每个节点的“权威字段”有优先级:出版信息走 DOI 元数据,预印本走 arXiv,评审版本走 OpenReview。
  • 跨源冲突在页面里显示来源与时间戳,用户可点开原站核对。

核心能力拆成 6 个模块

  1. 摄取与归一模块(离线):把权威源变成统一结构,解决去重与版本合并。
  2. 抽取模块(离线):把 Paper 转成 Method、Task、Model、Dataset 等实体,并把证据落盘。
  3. 图谱模块(静态):提供邻居查询、路径搜索、子图聚合和社区发现(基于 JSON 文件加载与前端计算)。
  4. 时间模块(静态):把新增量与扩散做成序列,支持回放与对比。
  5. 排序模块(离线):只做两类分数,重要性与增速,分数可解释可复算。
  6. 工作台模块(前端本地):收藏、注释、导出、订阅(localStorage 或文件导出)。

采集与归一策略(解决重复与冲突)

  • 唯一主键优先级:DOI > arXiv id > OpenReview forum id > venue-local id。
  • 同一论文跨源冲突用“权威优先”规则:出版信息以 Crossref 为准,预印本以 arXiv 为准,评审与版本以 OpenReview 为准。
  • 增量更新周期按源能力设定:arXiv OAI nightly 更新,OpenReview 按 venue 拉取每日变更,PMLR、CVF、NeurIPS 按新增 volume 或年度页每日巡检。

排序与趋势信号(全部可复核)

热点榜单 score 由三项构成

  • 新增量:过去 7 天 cluster 新增论文数与新增边数。
  • 结构性:时间加权 PageRank 与桥接度,桥接度定义为跨 cluster 的边占比。
  • 扩散性:方法节点到任务节点的新增覆盖率,覆盖率定义为新增任务数除以历史任务数。

趋势回放输出两条曲线

cluster_growth[t] = 每日新增论文数与新增边数
bridge_flow[t] = 从方法 cluster 指向任务 cluster 的边首次出现时间序列

Web 页面功能全景

1)首页 Today Radar

  • 目标:打开就给答案,默认过去 7 天,可切换过去 30 天。
  • 模块一:热点榜单(按主题 cluster 展示新增论文数、新增边数、关键论文 3 篇、增长曲线 1 条)。
  • 模块二:方法迁移雷达(按 Method 展示最近扩散到哪些 Task,按首次出现时间排序)。
  • 模块三:订阅流(只显示增量与变化点,例如新数据集或新评测指标)。
  • 主操作:点进主题、点进方法、保存到工作台、导出阅读清单。
  • 边界条件:首页 P95 加载 < 2 秒,榜单每项可点开证据来源。

2)Explore 图谱探索页

  • 顶部固定三控件:时间滑块、搜索框、过滤器。
  • 过滤器仅保留决策维度:venue、任务、方法族、是否有代码、是否有评测集、是否有复现实验。
  • 默认展示“以查询为中心的 2 跳邻域”子图,避免全图噪声。
  • 交互:点击节点打开右侧抽屉(关键字段、时间曲线、Top 邻居、推荐路径 3 条)。
  • Path 模式:选起点终点,系统给 3 条路径并显示每条边的证据类型与来源。

3)Topic 主题页(Cluster Detail)

  • 上半区:主题定义与边界(关键词、代表任务、代表方法、代表数据集,支持私有标签)。
  • 中间:时间序列(过去 90 天新增曲线、引用曲线、桥接度曲线)。
  • 下半区:关键论文列表(默认按时间加权中心性排序,强制展示 evidence 入口、引用入出、代码链接、评测集)。
  • 主操作:从该主题生成路径,选择 Method 或 Task 作为轨迹方向并导出。

4)Paper 论文详情页(Paper Card)

  • 信息密度高但不乱,只放能影响判断的字段。
  • 固定区:一句话贡献、方法要点 3 条、实验设置摘要、结论与局限。
  • 证据区:引用入出边、复用边、数据集与指标边、OpenReview 版本链。
  • 复现区:代码仓库、许可证、依赖环境提示;无代码则显示同类实现替代列表。
  • 主操作:加入工作台、标注一句话、设置为路径里程碑节点。

5)Path Builder 路径构建页

  • 输入:起点集合(主题/方法/模型/任务)。
  • 输出:1-3 条路径,每条 5-12 篇论文,长度可调。
  • 可视化:链路图 + 时间轴,显示先后顺序与拐点。
  • 导出:Markdown、CSV、BibTeX、Zotero(可选)。
  • 订阅:支持订阅节点或边类型,例如“某方法扩散到新任务”。

6)Trends 趋势回放页

  • 支持对比两个时间窗(例如 2025-12 vs 2026-01)。
  • 支持对比两个主题或方法族,输出维度固定为新增量、桥接度、关键论文更替、迁移目标任务。
  • 任何趋势结论旁边提供“查看证据”,直达边首次出现时间与来源。

7)Subscriptions 订阅与提醒

  • 订阅对象:主题、方法、模型厂商相关实体。
  • 触发类型:新关键论文、新评测基准、方法迁移到新任务、主题增速超过阈值。
  • 默认阈值:过去 7 天新增量超过过去 28 天均值的 2 倍(用户可改)。
  • 通知渠道:静态站点以 RSS 文件与本地 Inbox(localStorage)实现;邮件由用户自行转发 RSS 或使用第三方订阅工具。

8)Workspace 工作台

  • 对象:收藏论文、主题、路径、注释、导出版本。
  • 协作:评论与权限,至少有个人空间与团队空间。
  • 看板:把路径挂到“研究计划”,便于周会复盘。
  • 可复核数据:路径创建者、来源节点、导出记录、订阅状态。

9)Compare 对比页

  • 对比对象:Method 对 Method,Task 对 Task,Model 对 Model。
  • 对比维度:样本量、评测集覆盖、指标提升幅度分布、复现难度信号、扩散速度、依赖假设。
  • 复现难度信号:训练 token 规模披露、代码可运行率、环境依赖复杂度、复现实验 issue 数量。

10)Data Quality 数据质量与审计页

  • 展示各源覆盖率、字段缺失率、去重冲突数、更新延迟。
  • 展示每条边的证据分布与抽样校验。
  • 提供回滚与重算入口,保证可逆性。

关键交互细节

  • 全站搜索支持两种模式:语义搜索与精确搜索(精确用于 DOI、arXiv id、OpenReview id)。
  • 图谱页面节点 hover 预览,点击才加载详情,避免交互迟滞。
  • 任意榜单提供“为什么在这里”,解释由新增量、结构性、扩散性三项组成,并给出曲线入口。

性能与成本边界

  • 首屏 LCP < 2s(4G/中档笔记本),交互可用 < 3s。
  • 单页 JSON 载荷建议 < 1MB;全量数据包分层拆分(榜单/主题/论文/时间序列)。
  • 默认只存元数据与原站链接;全文向量化仅对开放全文源或用户上传 PDF。
  • 无数据库,无后端运行成本;所有计算尽量离线完成。

MVP 里程碑(具体日期)

  • 2026-02-07:打通 arXiv + OpenReview 两源采集,完成 Paper 节点与 CITES 边,输出热点榜单 v0。
  • 2026-02-21:接入 ACL Anthology + PMLR,完成 Method 和 Task 抽取,支持路径回放 v0。
  • 2026-03-07:接入 CVF + NeurIPS proceedings,完成全量去重归一,支持订阅与导出 v1。
  • 2026-03-21:接入 OpenAlex + Crossref 补全 DOI 与引用,接入 Semantic Scholar 补 citation graph,完成趋势回放 v1.1。

风险与约束(写入工程边界)

  • 合规风险来自 API terms 与 rate limit,所有源都必须保留来源字段与致谢文本,采集侧强制节流与失败重试策略。
  • 版权风险集中在全文与 PDF,默认只存元数据与指向原站的链接,全文向量化走“用户自带 PDF”或“开放全文源”两条路。