大数跨境

机器学习-arXIv人工精选-2026年8月21-24日最新论文21篇

机器学习-arXIv人工精选-2026年8月21-24日最新论文21篇 AI新文
2026-08-27
1

由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。

道夫尔同调在句子相似度研究中的探索

原标题:Exploring Dowker Homology for Sentence Similarity

作者:Marius Huber; Juri Opitz

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:道弗_homology是一种拓扑工具,可用于分析生活在同一空间中的两个点云的相对位置。我们研究道弗克同调是否通过将构成一对句子的标记的嵌入视为变压器模型潜在空间中的点云对来捕获句子相似性信息,使用了经过和未经过句子相似性微调的模型。我们发现道夫克同调能够捕获句子相似性信息(通过将道夫克同调特征回归到真实相似性得分来衡量),并且可以用于相似性数据和模型的可视化检查。为了使Dowker同调易于应用,我们从中推导出单个数值摘要,期望它们能够直接捕捉句子相似性。这些效果不错,但并未超越基于 established pooling 方法的标准句间相似度衡量方法。


原文链接



φ的灵敏度限制

原标题:Sensitivity Limits forφ -OTDR

作者:Juan M. Marin; Roman Ermakov; Huwei Wang; Francesco Da Ros; Darko Zibar

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:我们通过使用卡尔曼滤波估计相位展示了φ-OTDR新的灵敏度下限。数值分析表明,与使用常规相位估计相比,最小可检测信噪比(SNR)降低了约35dB


原文链接



来自奇特征有限域的正交空间中的压缩感知矩阵

原标题:Compressed sensing matrices from orthogonal spaces over finite fields of odd characteristic

作者:Kanittakorn Moonchaisook; Poom Kumam; Songpon Sriwongsa

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:在本文中,我们从奇特征有限域上的正交空间的子空间构造确定性矩阵,并研究它们在压缩感知中的适用性。该结构基于三种子空间之间的入射关系,产生具有可显式计算维度和一致性的矩阵族。利用基于相干性的估计值,我们建立了满足给定稀疏度水平的受限等距性质的充分条件。我们还提供了与DeVore确定性构造的数值比较,以说明测量次数、相干性和稀疏恢复保证之间的权衡。


原文链接



人工智能披露在计算机科学研究中的期望与实践

原标题:Expectations and Practices around AI Disclosure in CS Research

作者:Arati Mohapatra; Danish Pruthi

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:随着生成式人工智能工具在研究工作流程中的使用日益增多,在其影响、适当性和负责任使用的持续辩论的推动下,政策制定者已在多个出版场合实施了披露人工智能使用的政策。然而,当前的人工智能披露政策和实践是否符合其目的?在这项工作中,我们首先调查了顶级计算机科学会议的披露政策,并发现尽管这些政策普遍存在,它们仍然高度不明确。其次,通过对计算机科学研究人员(N=109)的调查,我们描述了在不同的研究任务和人类参与程度上披露的必要性。我们了解到研究人员发现对于涉及研究设计的任务披露最为必要,并且在人类参与度低的任务中也是如此。我们还编纂了研究人员对AI披露声明中应传达的信息的期望。最后,通过对EMNLP2025和ICLR2026的13867份披露声明进行分析,我们揭示了这些期望与实践中的人工智能披露之间存在巨大差距——一个典型的例子是写作辅助工具,它被认为不那么必要但经常被披露。我们提出针对作者和政策制定者的建议,旨在使人工智能披露政策和实践与期望相一致。


原文链接



爱德华兹展开在有限码长下的分解及通过q-变形的精确吸收

原标题:Breakdown of Edgeworth Expansion in Finite-Blocklength Regime and Exact Absorption viaq -Deformation

作者:Hiroki Suyari

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:本文研究了有限块长(FBL)区域中Edgeworth展开的结构分解,在该区域中,传统的渐近逼近会在深尾部区域产生不物理的负概率。我们提出了一种变形框架(aq-deformed),通过用信息密度空间的几何变形替代加性多项式摄动来解决这种不一致性。受非线性动力学线性化的启发,我们证明动态调整q-对数参数可以精确吸收三阶偏斜度,同时保持全局非负性。我们建立了一个通用渐近匹配,证明该框架包含了高阶渐近尺度。数值结果证实所提出的方法达到了Cornish-Fisher界限的当前最佳精度而不具有负概率的风险。该框架为评估超可靠通信(如6G和URLLC)的操作限制提供了强大而计算稳定的基石。


原文链接



超越稳定-探索困境:用于LLM策略优化的环境正则化

原标题:Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

作者:Xianlei Zhou; Xiangdi Meng; Yu He; Tianyu Qi; Shuyan Guan; Xianli Zhang; Jian Zhang; Xin Li; Qika Lin; Jun Liu

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:策略优化(PO)对于大型语言模型面临着稳定性和探索之间的权衡,目前通过行动侧的策略-KL正则化器进行调节这使实践者陷入两难境地:保持Policy-KL限制了响应行为并消耗了行动侧探索预算,而放弃它则会使优化过程缺乏显式的漂移控制。我们主张一种替代方案,通过将正则化转移到输入侧来打破这种困境。随着训练的进行,当前策略所诱导的训练查询分布与其预强化学习参考分布未受控制地偏离。具体来说,环境正则化策略优化(ERPO)引入了一个查询KL(QKL)项来限制这种查询分布偏移,并且还引入了一个基于数据集静态参考的每个查询权重,该权重使每次查询更新偏向于在参考下典型的查询。QKL梯度仅通过查询似然流过;策略梯度估计器使用的响应评分函数不出现在QKL项中,因此QKL对响应分布不施加直接梯度压力---探索得以保持。ERPO 可以集成到 GRPO/PPO/REINFORCE 风格的管道中,而无需额外的前向传递。在六个数学推理基准上,ERPO 替代了标准的 Policy-KL 正则化器,同时实现了对查询分布漂移的有效控制,在高温解码和长周期训练下表现出更强的准确性和更加稳定的性能。我们的源代码可在 https://github.com/alibaba/ERPO 获取


原文链接



人工智能辅助对人类技能发展的影响:通过逻辑谜题学习的研究

原标题:How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles

作者:Shang Wu; Catarina G Belem; Shuyuan Fu; Mark Steyvers; Padhraic Smyth

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:虽然人工智能辅助可以在短期内提高人类任务表现,但长期来看也可能阻碍技能的发展。我们在一个受控的逻辑谜题实验中研究了这种张力,该实验涉及按需AI辅助,参与者在AI可用之前、期间和之后完成任务。通过实验性地改变AI请求成本,我们发现较低的成本会促使更多的AI使用。我们还发现,在AI访问阶段请求AI帮助的参与者在帮助被移除后任务表现更差,并且他们随后未受助的表现从之前的AI辅助表现预测时被高估了。我们使用贝叶斯潜在能力模型来区分初始能力、AI后的能力以及参与者特定的技能变化,同时估计在访问AI阶段独立推理如何与技能发展相关。结果表明,更大的独立解决问题的努力与潜在能力的更大提升相关,这与这样的解释一致:当人工智能辅助取代独立推理时,技能发展较弱。


原文链接



基于稳定性感知的图集合特征选择算法SAGE用于解释性产后抑郁症风险预测

原标题:SAGE: Stability-Aware Graph-Based Ensemble Feature Selection for Explainable Postpartum Depression Risk Prediction

作者:Md. Rokon Islam Emon; Syed Shariar Alam Shuvo; Shahriar Siddique Ayon; Abdullah Al Mamun; Ahnaf Atef Choudhury

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:产后抑郁症(PPD)对母婴健康构成重大负担,尤其是在低收入和中等收入国家,其发病率超过19%。尽管在PPD预测的机器学习方面取得了进展,当前的方法仍然受到缺乏临床实用性的不透明全局解释的限制,在患者层面不稳定的功能选择以及类别不平衡下的泛化能力较差。我们提出了一种基于稳定性感知的图集成特征选择系统SAGE,该系统结合了局部可解释的人工智能以及遗传优化的人工神经网络(GA-ANN)。利用一组766名产后妇女的主要队列,SAGE结合信息论相关性、基于PCA的结构和图交互,并通过自助法稳定性加权来识别稳健且非冗余的预测因子。基于遗传算法优化并利用GAN增强过采样的GA-ANN架构,在仅使用16个特征的情况下,达到了87.96%的准确率,86.32%的F1分数和0.88的AUC,优于基线和其他特征选择方法。心理和社会经济因素如EPDS评分、PHQ-9评分、对母性的感受以及受虐待史是主要预测因素,而人口统计学因素影响较小。基于LIME的解释使得能够从图中选择的特征获得实例级别的洞察,从而实现个性化的风险评估。该研究结果使SAGE成为一种可扩展的、可解释的、用于在医疗资源有限的情况下早期识别PPD的临床工具。


原文链接



诊断迭代对齐与生成:用于数据高效数学偏好蒸馏的DIAG

原标题:DIAG: Diagnostic Iterative Alignment and Generation for Data-Efficient Mathematical Preference Distillation

作者:Guhan Chen; Songtao Tian; Bohan Li; Hejin Wang; YeXin Xie; Zixiong Yu

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:迭代偏好优化对于使大型语言模型在数学推理任务上对齐至关重要,然而其效率常常因信号稀缺而受阻:随着模型的改进,静态问题集越来越不匹配于模型不断发展的能力,导致生成的任务要么太简单要么太难,因此缺乏信息量,从而导致有效偏好对的稀缺。我们提出DIAG,一个诊断迭代对齐和生成框架,它自适应地重塑实践分布以增加信息监督并在学生当前能力边界附近集中训练。DIAG 包含两个阶段:(1) 诊断有效的偏好对产出,校准探索与利用之间的权衡,并通过经验贝叶斯收缩估计器分配主题配额,从而优先考虑高产概念;以及 (2) 生成有针对性的练习,在此过程中教师从学生的失败痕迹中综合变体。我们进一步提供了一个理论视角,解释DIAG作为一种教师介导的对实践分布向学生能力边界KL正则化重新加权的近似方法,在这种方法中有效偏好对产出被最大化。实验表明,DIAG 在迭代过程中提高了产量,并在等效的训练预算下提供了更强的推理性能,证明它可以提炼出更有信息量的偏好监督以用于数学推理。


原文链接



非阿基米德泛函分析的形式化 1:球完备空间

原标题:Formalization of non-Archimedean functional analysis 1: spherically complete spaces

作者:Yijun Yuan

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:在本文中,我们使用Lean定理证明器(v4.31.0),基于Mathlib,提出了球完备空间的公理化表述,这是一个非阿基米德泛函分析中的基本概念。本工作包括球完备空间的等价定义,它们的基本性质,实例及非实例,例如p-进复数域Cp。作为应用,我们形式化了Birkhoff-James正交性(Hahn-Banach延拓定理和非阿基米德Banach空间的球完备性的概念)的概念。代码的网址: https://github.com/YijunYuan/SphericalCompleteness/tree/paper


原文链接



未来的查询:LLM能否作为隐式医学世界模型

原标题:Future Querying: Can LLMs Serve as Implicit Medical World Models?

作者:Siri Willems; James Butterworth; Lore Goetschalckx; Peter Vrancx; Philippe Modard; Elke Giets; Ludovic Denoyer

期刊:arXiv每日人工精选

出版时间:2026/08/24

摘要:传统的临床预测模型依赖于特定任务的数据管道和经过整理的结构化数据,这些方法扩展性差且未能充分利用非结构化的文本。为了解决这个问题,我们引入了未来查询这一范式,通过评估大型语言模型(LLMs)是否能够回答有关患者未来的带时间索引的临床问题来探查这些模型能否充当隐含的医学世界模型。我们的框架通过无端点感知训练在非结构化临床文档上运行,使单一模型能够在不进行手动特征工程或特定任务重新训练的情况下回答患者轨迹上的各种临床问题。我们证明了小型的、局部微调的开放权重模型可以匹配或接近更大的专有系统,使该框架适合于隐私保护的本地部署。在新的合成医疗报告数据集和MIMIC-IV数据集的真实重症监护病房记录上进行评估,我们的结果提供了令人鼓舞的证据表明LLMs能够捕捉临床动态的某些方面。


原文链接



可解释人工智能中的选择问题解决方法

原标题:Addressing the Selection Problem in Explainable AI

作者:Claire Vlases; Katelyn Morrison

期刊:arXiv每日人工精选

出版时间:2026/08/23

摘要:可解释人工智能(XAI)研究已经产生了一系列的解释技术,然而用户研究表明现有的解释在实践中并不有效。我们主张,鉴于传统XAI的孤岛性质,用户难以选择合适的XAI技术。从哲学的角度看待XAI,我们提出了我们所说的选取问题的形式化描述:XAI界面系统性地未能弥合用户自然语言的不确定性与解决该不确定性的解释技术之间的差距。遵循逻辑前提-结论格式,我们表明传统界面要求用户将其不确定性转化为技术选择,这是一个需要满足的具有挑战性的先决条件。我们还提出了一种结构化解决方案:一个多代理LLM编排工具,该工具将用户的查询转换为适当的XAI解释技术。我们提供了一个实例来展示如何实现这一结构性解决方案以解决选择问题。


原文链接



你需要更好的注意力先验

原标题:You Need Better Attention Priors

作者:Elon Litman; Gabe Guo

期刊:arXiv每日人工精选

出版时间:2026/08/22

摘要:我们将注意力机制通过熵最优传输的视角进行泛化,揭示了标准注意力对应于一个由隐式均匀先验正则化的传输问题。我们引入了带有可训练先验的广义最优传输注意力(GOAT),这是一种新的注意力机制,它用一个可学习的连续先验替换了这个朴素假设。此先验保持与优化内核(如FlashAttention)的完全兼容性。GOAT 还提供了基于 EOT 的注意力消耗点的解释,并为此实现了解决方案,避免了标准注意力机制中的代表性权衡。最后,通过吸收空间信息到核心注意力计算中,GOAT 学习了一个可外推的先验,结合了学习位置嵌入的灵活性和固定编码的长度泛化能力。


原文链接



基于能量谱依赖样本复杂度的稀疏主成分分析

原标题:Sparse Principal Component Analysis with Energy Profile Dependent Sample Complexity

作者:Mengchu Xu; Jian Wang; Yonina C. Eldar

期刊:arXiv每日人工精选

出版时间:2026/08/22

摘要:我们在高维样本有限的场景下研究稀疏主成分分析,旨在恢复一个仅在少数坐标上具有支持的主要成分。尽管取得了很大的进展,大多数方法和分析都针对平坦峰值的情况,当峰值能量在支撑上分布不均时,几乎没有提供什么指导。受此启发,我们提出谱能量追求(SEP),一种有效的迭代方案,该方案反复筛选和重新选择坐标,其样本复杂度适应于能量分布。我们围绕一种结构函数(p)构建框架,该函数量化了尖峰能量在其topp条目上如何累积。据我们所知,SEP 是第一个具有样本复杂性保证的多项式时间SPCA方法,该保证由完整的能量谱决定:它在m≳max1≤p≤kps2(p)logn个样本的情况下成功,对于平坦尖峰恢复了经典的k2logn速率,并且对于足够集中的谱改进到了klogn。作为轻量级的后处理步骤,单次截断的幂迭代被证明能使最终估计器达到一致的统计误差界。使用平面轮廓和偏移正则化衰减轮廓的实证模拟验证了SEP能够适应轮廓结构而无需特定轮廓调整,并且优于现有算法。


原文链接



SPARC:单次通行尺度扩展用于运动预测的符合贝叶斯最后层

原标题:SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers

作者:Sakif Hossain; Julian Teusch; Jörg P. Müller

期刊:arXiv每日人工精选

出版时间:2026/08/21

摘要:人体运动预测的准确性越来越高且快速,但可靠部署需要结构化、校准且高效的不确定性估计。基于贝叶斯和集合的不确定性估计通常需要重复的随机推理[15, 26],而符合校准本身不提供认识论信号或保持轨迹协方差结构[14, 50]。我们介绍了SPARC(Single-Pass Adaptive Risk Calibration),一种用于运动预测的贝叶斯-校准不确定性层。确定性的MLP骨干网络预测未来的均值,而共轭贝叶斯最后一层将时域特征杠杆转化为解析的视距级知识尺度κt(x)。这个尺度在不改变其相关结构的情况下膨胀了图-时间高斯协方差,并且分割共形校准在可交换性下产生了具有有限样本有效性的95%边缘预测管关键接口是结构化因子分解κt(x)Σstr,t(x),它在不使用蒙特卡洛采样的情况下将特征空间中的知识不确定性注入轨迹密度中。在九个数据集-协议块和确定性、多模态以及校准基准上,SPARC 在 NLL 和结合了 MPJPE+NLL 的标准上排名第一,同时保持了具有竞争力的点准确性和高效的校准管。通过κ分离高误差情况对窗口进行排序,使得该尺度可用作轻量级风险监控器。


原文链接



基于雅可比引导的噪声注入用于大规模语言模型量化鲁棒性(Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models)

原标题:Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models

作者:Deepanshu Pandey; Arnav Chavan; Nahush Lele; Sankalp Dayal; Deepak Gupta

期刊:arXiv每日人工精选

出版时间:2026/08/21

摘要:大规模语言模型(LLMs)的量化常常受到自注意力机制对离散化误差敏感性的阻碍。我们将softmax运算符识别为量化稳定性的瓶颈,原因是它对外部值敏感以及雅可比矩阵依赖于状态。我们从理论上建立抑制雅可比矩阵的范数有助于限制量化引起的性能下降。基于此,我们提出雅可比引导噪声注入,一种将零均值高斯噪声注入预注意力对数几率中的训练策略,方差直接来源于雅可比弗罗贝尼乌斯范数。与以往依赖启发式方法或直接惩罚雅可比矩阵的方法不同,我们的方法提供了一种基于局部注意力敏感度识别最优噪声方差的方式。我们在最先进的LLM架构上评估了该方法,结果表明其比流行的数量化方法(PTQ)具有更强的鲁棒性。实证分析表明,所提出的方法在低比特量化设置下,在ImageNet-1K上对SigLIP的Top-1精度相对增益高达+37%,并且在WikiText上的语言模型困惑度相对改善最多达40%,证明了该方法的有效性。


原文链接



神经影像分析中的SPD矩阵学习:视角、方法和挑战

原标题:SPD Matrix Learning for Neuroimaging Analysis: Perspectives, Methods, and Challenges

作者:Ce Ju; Reinmar Kobler; Antoine Collas; Motoaki Kawanabe; Cuntai Guan; Bertrand Thirion

期刊:arXiv每日人工精选

出版时间:2026/08/21

摘要:神经影像学通过捕捉大脑组织的不同方面提供了表征脑活动、结构和连接性的关键工具。在这些不同的模态中,当通过适当的估计或正则化过程将测量建模为对称正定(SPD)值表示时,一个统一的视角出现了。装备了黎曼几何,SPD 流形为这些表示提供了进行原则性统计推断和机器学习的非欧几里得框架。本文在SPD矩阵学习的框架内组织了这些分析方法和学习方法,该框架将经典几何统计学与现代机器学习联系起来,跨越神经影像学和神经生理学应用。我们系统地回顾了从模态特定表示到几何浅层和深层学习范式的演进过程,并强调SPD矩阵学习如何在保持底层结构约束的同时扩展到神经成像和脑机接口领域的现代人工智能应用。


原文链接



基于回归的因果效应估计(在选择偏差和混杂因素存在的情况下)

原标题:Regression-Based Estimation of Causal Effects in the Presence of Selection Bias and Confounding

作者:Marlies Hafer; Alexander Marx

期刊:arXiv每日人工精选

出版时间:2026/08/21

摘要:我们考虑估计目标变量Y的期望因果效应E[Y|do(X)]的问题,其中处理变量X通过干预设定,重点关注连续随机变量。在没有选择偏差或混杂因素的情况下,E[Y|do(X)]=E[Y|X],可以使用标准回归方法进行估计。然而,当由选择偏差引起的系统性缺失或者混杂因素扭曲了数据时,回归分析就会失效。不受选择过程影响的代理变量可以在某些约束条件下用于纠正选择偏差,从而可靠地恢复E[Y|X],进而恢复E[Y|do(X)]当数据还受到混杂因素的影响时,从选择偏差的数据中恢复因果效应更具挑战性,并需要访问代理变量来校正混杂因素以及选择机制。假设能够从外部无偏的观测数据中获得此类代理变量,我们推导出确保因果效应可识别性和可恢复性的理论条件。我们进一步引入了一种线性两步回归估计量(TSR),该方法可以通过添加非线性基函数进行扩展,能够利用代理变量来校正选择偏差,同时考虑混杂因素的影响。我们表明,在不存在混杂因素的情况下,TSR 与其他先前的估计量一致,但实现了更低的方差。广泛的模拟研究验证了TSR在包括选择偏差以及通过代理变量造成的混杂情况下的正确性。


原文链接



线性时间序列数据中的差异图发现用于根原因分析

原标题:Root cause analysis via difference graph discovery from linear time-series data

作者:Anouk Ruer; Timothée Loranchet; Daria Bystrova; Charles K. Assaad

期刊:arXiv每日人工精选

出版时间:2026/08/21

摘要:根本原因分析旨在识别复杂动力系统中异常现象的责任机制。在这篇文章中,我们通过差异图发现的视角研究线性时间序列中的根本原因分析。我们关注违背预期的根本原因,对应于在正常状态和异常状态之间因果系数发生变化的变量。我们使用线性离散时间动态结构因果模型来形式化这个问题,并将几种最初用于发现两个群体之间差异图的方法改编到时间序列环境中,在这种环境中,两个群体被正常状态和异常状态所取代。我们首先在模拟数据上评估所提出的方法,然后通过来自IT监控和重症监护监测的真实世界数据集展示其实际相关性。我们的结果表明差异图发现如何有助于定位负责异常行为的因果机制。


原文链接



基于数据感知卸载和预测预计算的高效MoE推理(DAOP)

原标题:DAOP: Data-Aware Offloading and Predictive Pre-Calculation for Efficient MoE Inference

作者:Yujie Zhang; Shivam Aggarwal; Tulika Mitra

期刊:arXiv每日人工精选

出版时间:2026/08/21

摘要:混合专家(MoE)模型虽然对于各种机器学习任务非常有效,但在内存受限的设备上部署面临重大挑战。虽然GPU提供了快速推理,但其内存相比CPU有限,这意味着并非所有专家可以同时存储在GPU上,因此需要频繁地从CPU内存进行昂贵的数据传输,这常常抵消了GPU的速度优势。为了应对这一问题,我们提出了DAOP,一种设备上的MoE推理引擎来优化并行GPU-CPU执行。DAOP 根据每序列激活模式在CPU和GPU之间动态分配专家,并选择性地在CPU上预计算预测的专家以最小化传输延迟。这种方法能够在各种专家缓存比率下实现高效的资源利用,并通过一种新颖的优雅降级机制保持模型准确性。综合多个数据集的评估显示,DAOP在保持精度的同时,比传统专家缓存和预取方法高出最多8.20倍,并比卸载技术高出1.35倍。


原文链接



关注树:科学批评中未声明限制提取的层次多智能体辩论

原标题:Tree-of-Concerns: Hierarchical Multi-Agent Debate for Unstated-Limitation Extraction in Scientific Critique

作者:Sahil Mishra; Niranjan Rajeev; Tanmoy Chakraborty

期刊:arXiv每日人工精选

出版时间:2026/08/21

摘要:随着科学文献的增长以及论文越来越多地对局限性进行欠报导,多代理LLM提供了一种有希望的方法来系统地揭露这些隐藏的失败模式。这里,我们介绍了Concerns树,一个多代理框架,部署了专门的怀疑者角色,每个角色通过特定类别的分析视角运行,作为平行辩论树来提取科学论文中未明确指出的限制。每个角色都进行结构化、基于证据的论证,而Panel Review机制从五个角度重新评估所有幸存的主张,以纠正类别漂移和严重性误判。通过在ToC-Bench上的实验,我们展示了包含414篇研究论文的基准测试,这些论文共有1,905个未声明的限制条件,这些限制条件来源于审稿人报告的弱点和后续引用批评,结果表明ToC相对于最强基线提高了79%的精确度和11%的覆盖率,揭示了具体且基于证据的关注点,支持审稿人在系统评估中使用。


原文链接



【声明】内容源于网络
0
0
AI新文
AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
内容 257
粉丝 0
AI新文 AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
总阅读4.4k
粉丝0
内容257