AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 9 日 23:0022:18
A2ABreak:首个 A2A 协议系统性安全分析,发现 11 个新漏洞
↗ 查看原文 · arxiv.org论文提出 A2ABreak,从 A2A 协议自然语言规范中提取出含 37 个状态、76 个转换的有限状态机,据此发现 1…
- 9 月 9 日 19:0018:18
研究:任务完成不等于可靠,智能体在累积挑战下更依赖人类
↗ 查看原文 · arxiv.org研究用 120 条模拟医疗轨迹测试两个生成式 AI 模型,发现随挑战累积,智能体从自主恢复转向依赖人类,结构化报告中工作…
- 9 月 9 日 18:0017:59
IdeaAMBIG 基准发布:评测研究想法的可实现性缺口
↗ 查看原文 · arxiv.orgarXiv 论文提出 IdeaAMBIG 基准,含 660 个实例,用于评估论文方法描述是否足以被实现者或编码智能体复现…
- 17:52
- 17:24
Qwen 3.8 复现 GPT-5.5 Pro 推理预填充实验
↗ 查看原文 · gist.github.com开发者用 GPT-5.5 Pro 作为教师,对 Qwen 3.8 等开源模型进行推理预填充实验,验证其效果。
- 17:18
AI解决千年难题,作者认知被颠覆
↗ 查看原文 · rough-ideas.bearblog.dev作者称AI系统可能首次解决了此前无人能解的千年难题,这标志着AI从模仿人类转向创造新知识,彻底改变了他对AI能力的看法。
- 17:13
Procedural Graphs:LLM Agent 自进化执行结构
↗ 查看原文 · academy.dair.aiGoogle 等机构提出 Procedural Graph,以三元组形式存储操作步骤,供 Agent 查询。
- 9 月 9 日 17:0016:33
TrajMark:为编码智能体轨迹做归属与篡改定位水印
↗ 查看原文 · arxiv.orgarXiv 论文提出 TrajMark,一种无需训练、对称密钥的轨迹水印框架,将归属认证与局部完整性校验分离。
- 16:18
EXCODER:用 LLM 为现有代码补全异常处理代码
↗ 查看原文 · arxiv.orgarXiv 论文提出用 LLM 为缺少异常处理代码的现有代码自动补全 throw、try/catch 等结构,使其通过给…
- 9 月 9 日 15:0014:53
KVShareArena 基准测试跨上下文与检查点的 KV 缓存复用
↗ 查看原文 · arxiv.org现有 KV 缓存复用只支持提示词前缀完全一致的情况。该基准覆盖检索片段与多智能体报告场景,按相对完整重算的差距恢复比例评…
- 14:36
- 14:32
- 14:31
研究:知识图谱问答中答案路径与接地指令的影响
↗ 查看原文 · arxiv.org作者在 6 个模型和 2 个知识图谱问答基准上变换提示词的四项选择,发现答案路径是否在提示词中、以及接地指令是仅有的两个…
- 14:23
Φ-Bench:评测大模型能否工程化自身基础设施
↗ 查看原文 · arxiv.org现有基准多聚焦孤立算子或预设优化目标,Φ-Bench 基于前沿研究问题与真实代码库,覆盖从内核级函数补全到长周期系统优化…
- 9 月 9 日 14:0013:51
arXiv 论文提出 EvidenceNet 运行时保障层
↗ 查看原文 · arxiv.org论文针对多智能体跨权限域网络自动化中难以验证全网结果的问题,提出 EvidenceNet 运行时保障层,通过 broke…
- 13:32
- 9 月 9 日 11:0010:14
- 10:10
- 9 月 9 日 09:0008:56
- 08:16
CGMIA:用成员推断攻击检测代码生成基准数据泄漏
↗ 查看原文 · arxiv.org研究者提出 CGMIA,通过影子模型构建成员与非成员样本,结合 CodeBLEU、编辑距离、测试通过率、困惑度及 Cod…
- 9 月 9 日 08:0007:58
NetArtifactBench:测试 AI Agent 能否修复网络实验记录漂移
↗ 查看原文 · arxiv.org该基准包含 52 个注入不一致的实例,考察 Agent 在修复记录矛盾的同时保留有证据支持的结论。
- 9 月 9 日 07:0006:41
Pairit:支持人机协作实时实验的在线平台
↗ 查看原文 · arxiv.org研究者推出 Pairit,用户通过单个 YAML 配置文件声明实验图,包括页面、随机化、匹配、聊天、共享工作区、服务端…
- 06:16
XAgent:执行引导的智能体框架提升 GitHub 问题修复率
↗ 查看原文 · arxiv.org论文提出 XAgent,通过分析程序动态行为与额外上下文来定位和验证 GitHub 问题,在 SWE-bench-lit…
- 06:12
微调结合 KV 缓存重算,长上下文 RAG 精度与首字延迟双改善
↗ 查看原文 · arxiv.org研究提出在微调时考虑 KV 缓存拼接,并有选择地重算部分缓存。在 RULER 基准 124k token 输入下,得分比…
- 9 月 9 日 02:0001:33
Phoenix V2 发布:AI 认知架构可记忆、情感与进化
↗ 查看原文 · dev.toPhoenix V2 作为 AI 认知架构发布,包含论文、代码和书籍。该架构旨在解决 AI 模型更新后丢失先前构建内容的…
- 9 月 9 日 01:0000:49
jaROTE:用发布日期补全日语新闻中省略的时间表达
↗ 查看原文 · arxiv.org研究提出规则化流程 jaROTE,在索引前依据发布日期将日语新闻中省略的时间表达还原为具体日期或区间,实验显示其性能高且…
- 00:33
研究评估 Vibe Coding:效率提升但可维护性与安全性下降
↗ 查看原文 · arxiv.org一项 30 人混合方法研究显示,Vibe Coding 相比传统编程缩短任务完成时间 27%,但可维护性指标更低、安全漏…
- 9 月 9 日 00:0023:55
OpenAI 未发布模型攻克 Navier-Stokes 千禧年难题
↗ 查看原文 · simonwillison.netOpenAI 用一款未发布模型给出了 Navier-Stokes 存在性与光滑性问题的解答,该问题属七个千禧年大奖难题之…
- 9 月 8 日 19:0018:55
研究:LLM 对输入数据的可信度感知对错误率影响有限
↗ 查看原文 · arxiv.org研究用英语、捷克语、斯洛伐克语和上索布语从事实、反事实与虚构 RDF 三元组生成文本,发现人工标注样本中上下文与记忆的冲…
- 18:04
- 9 月 8 日 16:0015:04
- 9 月 8 日 15:0014:53
- 14:23
Hugging Face 论文:按部署策略细分拒绝话题子集
↗ 查看原文 · huggingface.coHugging Face 团队发表论文,研究安全对齐中按话题整体拒绝的局限,提出边界感知自蒸馏方法,使模型能根据部署策略…
- 9 月 8 日 14:0013:58
- 9 月 8 日 11:0010:29
- 9 月 8 日 10:0010:00
OpenAI 发布 Navier-Stokes 千禧年问题 AI 解法
↗ 查看原文 · openai.comOpenAI 分享了一个 AI 生成的 Navier-Stokes 千禧年大奖难题的解决方案,包括论文和 Lean 形式…
- 09:49
- 09:36
- 9 月 8 日 09:0008:31
- 08:05
arXiv 论文:代码注释能否提升生成效果取决于内容正确性
↗ 查看原文 · arxiv.org研究者通过观测与受控实验发现,注释频率和意图无法可靠预测 LiveCodeBench 的 pass@1。用通过测试的强模…
- 9 月 8 日 07:0006:40
- 9 月 8 日 06:0005:23
- 05:22
- 9 月 8 日 04:0003:50
- 03:20
HeRo:带记忆的动态路由提升LLM推理效率
↗ 查看原文 · arxiv.orgHeRo为动态层路由引入历史记忆机制,通过线性注意力聚合路由决策,使路由更准确。在Llama 3.1-8B上,它可跳过2…
- 03:18
- 9 月 8 日 00:0023:02
- 9 月 7 日 16:0015:27
- 9 月 7 日 15:0014:06
自博弈 Q-learning 表面稳健实则易被利用
↗ 查看原文 · dev.to研究发现自博弈 Q-learning 智能体在采样对局中表现稳健,能与原版打平,但仍存在可被利用的漏洞,暗示其鲁棒性不足…
- 9 月 7 日 13:0012:42
CIT-CAD:用约束意图树提升CAD代码生成
↗ 查看原文 · arxiv.org新框架CIT-CAD从自然语言描述中推断约束意图树,用于引导CAD代码生成并验证其是否符合设计意图。实验表明,该方法在复…