AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 7 日 10:0009:38
Matryoshka哈希表示实现紧凑语义检索
↗ 查看原文 · arxiv.org新方法MHR分两阶段训练,先学习长二进制码,再冻结模型添加残差适配器,使短前缀可直接搜索。在MS MARCO和BEIR基…
- 9 月 7 日 09:0008:36
菲尔兹奖得主参与大模型,4B手机Qwen与云端GLM刷爆ARC-AGI 3
↗ 查看原文 · qbitai.com菲尔兹奖得主加入大模型研发,4B参数的手机端Qwen模型与云端GLM模型在ARC-AGI 3基准上表现突出,但指出两模型…
- 9 月 7 日 07:0006:32
- 06:03
- 9 月 7 日 06:0005:13
- 9 月 7 日 01:0000:21
- 9 月 6 日 20:0019:41
- 9 月 6 日 06:0005:26
- 9 月 5 日 23:0022:42
- 9 月 5 日 21:0020:02
- 9 月 5 日 17:0016:05
- 9 月 5 日 15:0014:41
- 9 月 5 日 12:0011:15
- 9 月 5 日 06:0005:32
- 05:08
- 9 月 4 日 14:0014:00
Agent 自我进化综述:覆盖 2023-2025 年方法
↗ 查看原文 · dev.to一篇系统综述,梳理 2023 至 2025 年间 Agent 自我进化方法,涵盖模型、上下文、工具和架构层的进化内容、时…
- 9 月 4 日 10:0009:07
- 09:04
- 9 月 4 日 09:0008:57
ScienceDiscovery用树搜索加速科学发现
↗ 查看原文 · qbitai.comScienceDiscovery实现树搜索驱动的RSI,无需训练模型或调参,可在小时级写出通用积分器,低成本发现物理科学…
- 9 月 3 日 20:0019:18
OpenAI 开源 Lean 4 素数间隙形式化证明
↗ 查看原文 · github.comOpenAI 发布 PrimeGaps186 仓库,包含素数间隙不超过 186 的 Lean 4 形式化证明和 Pyth…
- 9 月 3 日 17:0016:37
GRPO 隐藏虚假优势,SIGNBALANCE 提出修正
↗ 查看原文 · arxiv.org研究发现 GRPO 在奖励小候选集等场景会错误奖励猜测行为,提出新方法 SIGNBALANCE 通过全局缩放和类别重平衡…
- 16:10
- 9 月 3 日 15:0014:55
- 14:44
RATL 提出残差检索新范式,提升多变量时间序列预测
↗ 查看原文 · arxiv.orgRATL 是一种即插即用的残差检索与反馈修正方法,通过冻结基础预测器并检索历史残差来改进预测。实验表明,该方法在多数设置…
- 14:36
论文提出价值保持架构,保障智能体系统人类价值观
↗ 查看原文 · arxiv.org该论文探讨多智能体系统中架构设计如何影响隐私、公平和安全等价值观,并提出三种模式:联邦拓扑保护隐私、分布式架构促进多元…
- 14:02
- 9 月 3 日 13:0012:59
DNative-Twin:用数字孪生记录与重放AI决策
↗ 查看原文 · arxiv.orgDNative-Twin框架将AI代理的决策记录为类型化轨迹,并可在隔离环境中重放决策机制。实验表明,加入重放合约和验证…
- 12:23
SimSkill:终身学习AI代理自主掌握交通模拟
↗ 查看原文 · arxiv.orgSimSkill是一个基于SUMO交通模拟器的自进化代理,通过自主探索构建可复用技能库。在多个基准测试中,它将验证完成率…
- 12:20
Rent-a-RAG:嵌入空间水印审计第三方RAG复用
↗ 查看原文 · arxiv.orgDirBucket框架通过语义保持的改写嵌入水印,使数据提供商能在黑盒条件下审计其文档是否被第三方RAG系统未经授权复用…
- 9 月 3 日 12:0012:00
主动服务代理:统一决策框架、方法与评估综述
↗ 查看原文 · arxiv.org这篇综述定义了主动服务代理问题,将其形式化为受授权和风险约束的部分可观测序列决策过程,并梳理了现有方法、评估指标及部署挑…
- 11:50
《Attention Is All You Need》在 Crossref 有五个假孪生
↗ 查看原文 · dev.to查询 Crossref 发现,2017 年 Vaswani 等人的论文《Attention Is All You Nee…
- 9 月 3 日 05:0005:00
- 9 月 2 日 17:0016:11
CodePoisonRAG:针对代码生成的知识投毒攻击
↗ 查看原文 · arxiv.org研究提出CodePoisonRAG框架,通过构造与任务匹配的恶意代码片段,在无需修改底层模型的情况下,使检索增强代码生成…
- 9 月 2 日 12:0011:54
- 11:07
- 9 月 2 日 11:0010:06
- 9 月 2 日 10:0009:37
- 9 月 2 日 09:0008:21
PaperCompiler:将论文忠实编译为代码仓库
↗ 查看原文 · arxiv.org新工具PaperCompiler通过生成显式的仓库级实现规范,提升了论文到代码的转换保真度。在基准测试上,其参考保真度相…
- 9 月 2 日 07:0006:54
- 06:20
蚂蚁OmniTable获VLDB最佳论文,大模型数据清洗效率提升5.6倍
↗ 查看原文 · qbitai.com蚂蚁集团推出统一宽表系统OmniTable,论文获VLDB 2026工业赛道最佳论文。该系统处理35PB语料,效率提升5…
- 9 月 2 日 06:0005:33
- 05:25
- 9 月 2 日 05:0005:00
- 9 月 2 日 02:0001:49
LexIssue:中文民事诉讼法律争议点识别基准发布
↗ 查看原文 · arxiv.org研究团队推出LexIssue基准,包含430个真实中文民事案件和1303个专家标注争议点,并构建法律知识库以增强检索,实…
- 01:43
案例研究:LLM编码代理实现系统时的缺陷与评估
↗ 查看原文 · arxiv.org研究记录了一个LLM代理实现多组件数据系统时引入的五类缺陷,并通过HotpotQA基准测试发现,过滤检索在预算为3时达到…
- 9 月 1 日 22:0021:39
BenchMIRT:审计LLM基准测试的新方法
↗ 查看原文 · huggingface.coHugging Face 和 Ai2 推出 BenchMIRT,一种在单个提示级别审计 LLM 基准测试的方法,通过分析…
- 21:11
认知女巫抵抗:AI代理数量不等于证据多样性
↗ 查看原文 · arxiv.org研究提出认知女巫问题,指出多代理报告中重复证据可能被误认为独立验证。实验显示,增加报告数量会降低推断校准度,而增加证据根…
- 9 月 1 日 21:0020:47
BCO方法通过显式世界模型提升智能体优化性能
↗ 查看原文 · arxiv.orgBelief-Calibrated Optimization将智能体对环境响应的隐式信念写成持久文档,并随新候选评估持续…
- 9 月 1 日 18:0017:59
- 17:57