端到端论文生成系统 Spark-to-Paper:假结论检出率 92%,自动跑实验、画图、直出论文初稿¶
Ch09.102 端到端论文生成系统 Spark-to-Paper:假结论检出率 92%,自动跑实验、画图、直出论文初稿¶
📊 Level ⭐⭐ | 8.5KB |
entities/端到端论文生成系统假结论检出率92自动跑实验画图直出论文初稿.md
端到端论文生成系统 Spark-to-Paper:假结论检出率 92%,自动跑实验、画图、直出论文初稿¶
Spark-to-Paper 是一套端到端研究论文生成系统,以 13 个可组合技能形式运行在现有编程助手(Claude Code / Codex)内部,无需单独部署智能体平台或外部编排服务。从一句研究想法出发,自动完成文献检索、实验设计、实验执行、论文写作、证据驱动结论修订、可编辑论文图生成,直至输出可直接编译的完整 LaTeX 项目。
核心数据:8 个受控课题上引文有效率 99.5%,图形可编辑率 96.4%;对 36 条人为注入假结论,检出率从单遍 14% 提升至 92%,对抗式评审精确率 74%。平均每篇论文 11.9M token、成本 8.1 美元、耗时 3.2 小时。论文 arXiv 2608.11924,已被 Hugging Face Papers 标记为当日第一。
要解决的痛点¶
工具碎片化:文献阅读、假设提出、代码编写、实验试错、参数调优散落多平台,各环节产物难衔接,即使使用编程助手也缺少把"从想法到论文"完整串起来的端到端流程。
科研幻觉:大模型固有幻觉在复杂长链条科研任务中放大——引用查不到、数字没出处、实验结果与结论相悖时"假装无事发生",破坏可复现性与严谨性。
设计:复用编程助手能力,而非再造平台¶
直接复用编程助手已有的读文件、代码执行、信息搜索与工具调用能力,把科研过程拆成 13 个可组合技能。每个技能只规定任务目标、约束条件、可用工具与交付标准,执行由编程助手根据项目状态自主完成;一条轻量级流水线指定任务顺序。全部技能共享同一项目目录,通过文件化产物协作,前一步输出即后一步输入。任何一步出问题都可从对应产物继续修改,而非整篇重生成。
流程:短想法 → 结构化研究提案 → 规划/引文/写作/修订/评审/画图/组装 → 完整 LaTeX 项目(手稿+参考文献+图表+模板配置),可直接编译。组装按目标会议/期刊模板处理章节顺序、引用格式与文档结构,编译后确定性检查确保无未解析引用与 LaTeX 错误。
实验环节自动完成:规划阶段预先确定数据集、基线、指标、消融与结果表格结构(数值留空),形成流程内轻量级预注册;写作完成后从论文主张反推缺失证据,在代码与数据可用时自动运行最小实验集,记录日志/指标/表格/图,用实测结果回填正文、重绘结果图,联动修订摘要/引言/结果/结论。
核心技术¶
基于技能的模块化流水线¶
13 技能由输入路由与八阶段组织。输入判断起点并选择结果完整性模式:无实测结果 → 提案模式(数字必须留空);有实测数据 → 数据感知模式(定量结论须有结果支撑)。模型负责需要理解与判断的决策,可核验操作由确定性程序完成,各司其职。
预注册式实验设计与证据驱动修订¶
实验规划与实验报告严格分离:观测前固定数据集/基线/指标/消融/表格结构;实验阶段按需执行最小证据集,昂贵计算或外部数据获取须由具体主张与资源可用性背书。实验后依据实测证据复审手稿,把论点分类为支持/部分支持/未支持/被反驳/需进一步确认,相应保留/弱化/删除/移入局限性/触发补充实验。阴性、无效或不显著结果予以保留而非省略,摘要/引言/结果/结论联动更新,确保全文与最终证据一致。
完整性检查、长程自省与失败边界¶
确定性 Gate:蓝图结构、引用一致性、记法统一、图文件齐备、LaTeX 编译成功、提案模式下"未观测结果必须留白"等,全部程序判断非模型判断。
两级模型自省:自我审查(每次编辑后局部检查论点漂移与一致性)+ 对抗式评审(从理论正确性/实验设计/系统有效性多轮独立审查,每条意见须引用具体段落,从"问题是否真实/是否已别处回答/是否超范围"三维核验,无法反驳才进修订,持续到一轮内无新问题)。
自我反驳循环:实验—批评—修订循环上限 7 轮;超过仍无法支撑核心目标则终止轨迹并生成失败报告(记录原始想法/试过方法/实测结果/证据不足原因),从新想法重来。失败轨迹保留为研究产出,但不包装成成功论文。
可编辑图生成(双路径)¶
实验结果图读取实测输出、由绘图程序生成原生矢量 PDF,数值与实验结果严格绑定;方法图/解释性图先由图像模型生成视觉草图,再以草图作视觉规范由 Coding Agent 以 HTML 重建文字/形状/连线/布局,渲染对比迭代校准后导出矢量 PDF,重建不可靠时回退栅格图。生成式模型负责视觉设计,实验结果图完全由数据决定,最终产物保持可编辑。
评测结果¶
受控 8 课题对比:引文有效率 99.5% vs 人类预印本 97.8%、AI Scientist 93%、AI Scientist-v2 91%、Agent Laboratory 96%、单遍基线 81%。图形可编辑率 96.4% vs 人类 58%、AI Scientist 与 Agent Laboratory 为 0%。
防幻觉消融:对固定注入 36 条假结论,单遍 14% → 加门禁 69% → 叠加自我审查 81% → 完整堆栈 92%;对抗式评审精确率 74%。
效率权衡:完整系统 11.9M token / 8.1 美元 / 3.2 小时 vs 单遍基线 0.11M token / 0.66 美元 / 16 分钟(但引文有效率仅 81%)。以更多推理与检查成本,换取更可靠引用、可追溯实验结果与可编辑论文产物。
开源:GitHub Spark-To-Paper-Skills/spark-to-paper-skills,项目网站 spark-to-paper-skills.github.io,论文 arXiv 2608.11924,HF Papers 2608.11924。
与 Agent 评估基准 及科研自动化智能体家族互补:本实体展示了把科研流程拆成可组合技能、以确定性 Gate + 对抗式评审对抗幻觉的完整工程范式,是 Agent Harness Engineering 在科研写作场景的实例。
→ 原文存档