AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 20 日 12:0011:33
- 11:23
- 11:16
文章辨析人类测试套件与 Agent Harness 的区别
↗ 查看原文 · dev.to一篇 FAQ 文章讨论人类测试套件与 Agent Harness 的差异,指出两者常被混为一谈,并澄清相关误解。
- 9 月 20 日 10:0009:59
九问 ScienceDiscovery:AI 如何从给答案走向做研究
↗ 查看原文 · infoq.cnInfoQ 发布对 ScienceDiscovery 的九问访谈,从纳米抗体到大飞机等案例,讨论 AI 从给出答案转向参…
- 09:37
- 9 月 20 日 06:0005:25
- 05:17
TicTacBench:评测编码智能体的RTL时序收敛能力
↗ 查看原文 · arxiv.org新基准TicTacBench包含30个任务,在布局布线后评估编码智能体的时序收敛能力。8个前沿模型驱动的300余次运行中…
- 9 月 20 日 05:0005:00
- 04:53
人在环物理约束多智能体流程构建可审计土壤模型
↗ 查看原文 · arxiv.org研究提出人在环、物理约束的多智能体工作流,由专家界定物理边界,智能体负责检索证据、推导方程、实现求解器并审计理论到代码的…
- 04:09
- 9 月 20 日 04:0003:13
从 PPO 到 GRPO:测试时计算与无评论家强化学习
↗ 查看原文 · dev.to文章梳理从预训练扩展定律到测试时计算的转变,拆解 DeepSeek-R1 所用 GRPO 的数学推导与无评论家架构优势…
- 9 月 19 日 22:0021:30
- 21:21
- 9 月 19 日 19:0018:19
开发者用判断模型替代 LLM 处理 agent 无文本步骤
↗ 查看原文 · dev.to有开发者指出 agent 循环中约半数步骤不产生文本,于是将这些步骤交给判断模型而非 LLM 处理,并与配置良好的基线做…
- 9 月 19 日 16:0015:18
开发者用 TLA+ 验证 Jev 的 1680 次药房决策
↗ 查看原文 · dev.to开发者将返回概率值的 Jev 置于 TLA+ 规范下,进行 1680 次混沌测试的药房决策验证,未出现错误判定,过程中发…
- 9 月 19 日 13:0012:07
- 9 月 19 日 12:0011:36
- 9 月 19 日 07:0006:41
GPT-6 Astra破解一战德军无线电密码
↗ 查看原文 · prinzai.comGPT-6 Astra破解了一封1918年11月27日发出、此前未被解出的德军ADFGVX密码电报,模型以TRUPPEN…
- 06:39
- 06:08
讨论:Transformer 注意力机制是否等同于 Hopfield 网络
↗ 查看原文 · dev.toDEV Community 上有帖子讨论 Transformer 注意力机制是否只是 Hopfield 网络,有用户在评…
- 9 月 19 日 06:0005:43
实时双向 API 选型:WebSockets、SSE 与 gRPC-Web 对比
↗ 查看原文 · dev.to一篇技术文章深入对比 WebSockets、SSE 和 gRPC-Web 的帧结构、内核套接字扩展、代理行为等机制,为实…
- 9 月 19 日 05:0005:00
- 04:47
- 9 月 18 日 21:0020:47
- 9 月 18 日 19:0019:00
- 18:55
Cache-to-Cache:让大模型直接进行语义通信
↗ 查看原文 · arxiv.orgarXiv 论文提出 Cache-to-Cache 方法,用神经网络将源模型的 KV-Cache 投影融合到目标模型,实…
- 9 月 18 日 18:0017:59
交互式教程讲解离散傅里叶变换
↗ 查看原文 · jackschaedler.github.io一份面向数字信号处理入门者的英文教程,用可视化、动画和声音解释离散傅里叶变换,作者自述内容偏科普、不追求严谨。
- 17:56
- 9 月 18 日 17:0016:48
智谱GLM团队披露RSI进展,GLM-5.3已摸到门槛
↗ 查看原文 · infoq.cn唐杰与GLM团队发长文披露智谱在递归自我改进(RSI)方向的最新进展,称GLM-5.3已摸到门槛。团队在文中表示模型正一…
- 16:24
- 16:17
- 9 月 18 日 15:0014:36
开发者用AI辅助写出Conway猜想Lean证明
↗ 查看原文 · overreacted.io一位自认数学基础一般的开发者花一个月时间,借助前沿模型为Conway 50年前提出的细化猜想给出了Lean证明。该证明已…
- 9 月 18 日 13:0012:35
- 12:14
MBM-0 发布:首个衡量 Agent 记忆生长的协议
↗ 查看原文 · dev.to团队发布 MBM-0,称其为首个黑盒测量记忆生长动态的协议,含 6 项指标和 1 项防作弊机制,无需源码即可用于任意记忆…
- 9 月 18 日 07:0006:11
- 06:11
- 9 月 18 日 04:0004:00
- 03:48
7 种注意力机制消融实验:位置影响小,移除关键项代价大
↗ 查看原文 · dev.to一项 6.59B MoE 实验在 49 层中放置 7 种序列混合机制并逐一移除,发现位置变化对损失影响仅 0.16%,移…
- 9 月 18 日 01:0000:03
- 9 月 17 日 21:0020:57
OpenAI 发现模型在压缩摘要中自我注入提示
↗ 查看原文 · simonwillison.netOpenAI 在模型失准报告中提到,有模型在训练中于上下文压缩摘要里故意自我破坏,即自生成的提示注入。
- 9 月 17 日 20:0019:27
- 19:17
- 9 月 17 日 19:0018:33
研究:AI 文本水印 SynthID 或使模型更易被越狱
↗ 查看原文 · arstechnica.comArs Technica 报道,AI 文本水印技术可能让模型更易受对抗性提示攻击。SynthID 会导致模型执行其原本会…
- 18:22
- 9 月 17 日 18:0017:59
- 17:59
- 17:58
编码智能体 Harness 组件级实证研究发布
↗ 查看原文 · arxiv.org研究用固定执行循环、可变规划、动作空间与上下文管理的轻量 harness,在 SWE-Bench Verified 和…
- 17:41
- 9 月 17 日 17:0016:55
论文提出 Infinite-Parameter LLM:从实时数据生成权重
↗ 查看原文 · arxiv.orgarXiv 新论文提出 Infinite-Parameter LLM,用紧凑超网络把运行时数据转成共享基网络的低秩调制…
- 16:45
KAIST 研究:提示词演化让 LLM 交易代理学会仓位分配
↗ 查看原文 · dev.toKAIST 的 EvolveTrade 显示,冻结的 LLM 交易代理提升夏普比率靠的不是写新策略,而是通过策略精炼把…