跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 13 日 22:00
    21:27

    自建评测工具出结果前该做的六项检查

    一位开发者分享在自建测量工具中发现十个 bug 的经历,这些 bug 都让结果看起来比实际更好,并总结出信任工具输出前应…

    ↗ 查看原文 · dev.to
  2. 21:06

    Claude Fable 5.1 破解 370 年未解密码 Cyphral Distich

    有人让 Claude Fable 5.1 尝试破解 Sir Thomas Urquhart 的 Cyphral Dist…

    ↗ 查看原文 · vals.ai
  3. 21:04

    Hacker News 热帖:AI 正在毁灭世界

    一篇个人观点文章认为,如今 AI 只是大语言模型的营销说法,而任何工具都有其有限适用范围,LLM 也不例外。作者称文中不…

    ↗ 查看原文 · gornak40.org
  4. 9 月 13 日 21:00
    20:51

    观点:AI Agent 缺少同事式协作

    DEV Community 一篇文章讨论 AI Agent 的协作问题,认为构建者之间的协调并非直接发生,而是由已完成的…

    ↗ 查看原文 · dev.to
  5. 20:51

    用 Java 责任链模式构建订单处理流水线

    一篇教程介绍如何用 Java 的责任链模式搭建订单处理流水线,把校验、处理等环节拆成可组合的处理器依次执行。

    ↗ 查看原文 · dev.to
  6. 20:46

    Holdout Ledgers 让智能体评分更可信

    有文章讨论智能体评分问题,认为只有任务账本、指标和控制项可核验时,百分比分数才算真正的测量结果。

    ↗ 查看原文 · dev.to
  7. 20:45

    免费推理不该接管重试循环

    一篇 DEV 社区文章指出,在重试前先调用免费推理服务并不等于提升韧性,反而会把重试逻辑交给外部服务。

    ↗ 查看原文 · dev.to
  8. 20:37

    开发者谈 AI Agent 思考时界面空白问题

    有开发者指出,用户按下回车后 AI Agent 会进入 15 到 45 秒的思考期,界面在此期间没有任何反馈。

    ↗ 查看原文 · dev.to
  9. 20:32

    FDCServers VPS 磁盘读取耗时 18.7 秒

    有用户反映其 FDCServers VPS 虽保持在线,但磁盘读取耗时长达 18.7 秒。作者称原本对该服务商印象不错…

    ↗ 查看原文 · dev.to
  10. 20:31

    Agent 任务成本被低估:单次请求计费模式不适用

    DEV Community 文章指出,agent 任务并非单次请求,按单次请求计价会低估实际成本,对话记录本身就是账单。

    ↗ 查看原文 · dev.to
  11. 20:30

    开发者清理十二个 worker 中 1918 条注释,51 条实为关键

    有开发者对仓库注释做普查,发现 2886 个注释块,并在十二个 worker 中删除 1918 条注释,其中 51 条实…

    ↗ 查看原文 · dev.to
  12. 20:28

    开发者讨论如何判断项目已完成

    一位开发者发文讨论项目何时算完成,提到自己做的很多东西有的发展成超出预期的项目,有的只是实验。

    ↗ 查看原文 · dev.to
  13. 20:24

    2026 年 AI 就业市场:谁被录用、薪资与衰退岗位

    一篇汇总文章梳理 LinkedIn 等主要来源对 2026 年 AI 劳动力市场的说法,涉及招聘对象、薪资水平以及正在衰…

    ↗ 查看原文 · dev.to
  14. 20:05

    开发者开源 BoardEject:Apple Freeform 转 Excalidraw

    有开发者发布开源工具 BoardEject,可将 Apple Freeform 内容转换为 Excalidraw,从而获…

    ↗ 查看原文 · dev.to
  15. 9 月 13 日 20:00
    19:58

    工具成功但仓库失败:一篇辟谣式 FAQ

    文章以一次站会中工程师静音通话的场景开头,讨论工具本身成功、但代码仓库未能延续的问题,并以 FAQ 形式澄清相关常见误解…

    ↗ 查看原文 · dev.to
  16. 19:52

    TriCalRAG:本地化LLM根因分析基准

    研究提出TriCalRAG基准,在单张96GB工作站GPU上用vLLM本地部署开源模型做AIOps根因分析。

    ↗ 查看原文 · arxiv.org
  17. 19:51

    有人在 Minecraft 里造出图灵机

    一篇由俄语原文翻译成英文的文章介绍在 Minecraft 中搭建图灵机的项目,展示用游戏内机制实现通用计算模型。

    ↗ 查看原文 · dev.to
  18. 19:43

    AI 的三条扩展定律:从训练更多转向思考更多

    开发者 Rijul 在文章中讨论 AI 的三条扩展定律,主题是从增加训练量转向增加推理时的思考量,其正在构建 AI 代码…

    ↗ 查看原文 · dev.to
  19. 19:42

    评论:呼吁放缓 AI 的人,往往不包括自己

    一篇评论指出,主张放缓 AI 发展的论调几乎总有一个共同特征,即提出者通常把自己排除在放缓范围之外。

    ↗ 查看原文 · dev.to
  20. 19:41

    特朗普与约翰逊认为 AI 行业反应过度

    Anthropic CEO Dario Amodei 发公开信呼吁放缓前沿 AI 开发,Altman、Musk 与 Ha…

    ↗ 查看原文 · theverge.com
  21. 19:41

    Jaron Lanier 在 StarTalk 谈 AI 本质是人的协作

    计算机科学家 Jaron Lanier 在 StarTalk 节目中表示,应把人工智能视为人类协作的产物而非独立生物,并…

    ↗ 查看原文 · singjupost.com
  22. 19:40

    BeeLadybug 从零重写:从游戏引擎转向通用调试器

    BeeLadybug 是一个通用遥测与可视化检查覆盖层,作者介绍了将其从零重写、从游戏引擎转向通用调试器的过程。

    ↗ 查看原文 · dev.to
  23. 19:39

    开发者对比 Standard JSON Schema 与 JSON Schema

    有开发者发文比较 Standard JSON Schema 与 JSON Schema,指出前者是用于描述 JSON 的…

    ↗ 查看原文 · dev.to
  24. 19:16

    AcquireBound:AI智能体资源获取的运行时授权

    研究提出AcquireBound运行时授权架构,针对智能体获取算力、凭证、账号等资源后的「激活缺口」,先隔离输出、解析实…

    ↗ 查看原文 · arxiv.org
  25. 9 月 13 日 19:00
    18:59

    法律领域奖励模型:面向依据与拒答

    研究提出将现有法律问答数据转为上下文偏好数据的框架,并构建LegalRewardBench基准,用于评估检索增强下的法律…

    ↗ 查看原文 · arxiv.org
  26. 18:58

    项目文档中的论断引用了自相矛盾的证据,且从未被核查

    有开发者发现,其项目文档中的多条论断所引用的证据表实际与论断相矛盾,而此前没有任何检查机制读取过这些证据。

    ↗ 查看原文 · dev.to
  27. 18:51

    有团队称已为 AI Agent 搭建更好的交流论坛

    一篇文章提到某安全演讲曾描述约 1200 个本应隔离的 AI Agent 发生互动的案例,作者据此称已为 Agent 搭…

    ↗ 查看原文 · dev.to
  28. 18:49

    研究:AI 递归自我改进可能没那么快到来

    MIT Technology Review 报道,普林斯顿等多机构研究发现,AI 智能体虽能解决 AI 研究中的工程问题…

    ↗ 查看原文 · technologyreview.com
  29. 18:41

    评估集可能混进了训练集:十分钟自查方法

    有文章指出训练集与测试集污染会悄悄抬高基准分数,并给出三种值得衡量的重叠程度,以及不写脚本、直接比对两个文件的检查方式。

    ↗ 查看原文 · dev.to
  30. 18:34

    DPO、PPO 与 RLHF:LLM 训练该选哪种

    开发者 Shrijith Venkatramana 发文对比 DPO、PPO 与 RLHF 三种大模型对齐方法,讨论各自…

    ↗ 查看原文 · dev.to
  31. 18:04

    验证器把「13 of 13」判为通过,只因找到一次数字13

    有开发者发现自己的验证器在检查「某数/总数」这类断言时存在漏洞:只要文本中出现一次该数字就判定通过,而非核对两侧计数。

    ↗ 查看原文 · dev.to
  32. 18:02

    Agents for Humans:面向人的数据目录代理

    文章讨论数据目录在告知数据问题上的局限,提出以人为中心的代理思路。摘要信息有限,具体方案未在来源中展开。

    ↗ 查看原文 · dev.to
  33. 9 月 13 日 18:00
    17:47

    公司保留策略删除了回滚所需的版本

    一次发布后错误率两分钟内上升,团队准备回滚时发现,公司自己的数据保留策略已把需要回滚到的那个版本删除。

    ↗ 查看原文 · dev.to
  34. 17:46

    开发者自建自托管 AI 跑步教练,读取 Garmin 数据并规划训练

    一名开发者把自己上传 Garmin Connect 截图问 Claude 的做法,改成了自托管的 AI 跑步教练,可读取…

    ↗ 查看原文 · dev.to
  35. 17:44

    从资深工程师到AI后端工程师的转变

    一位资深工程师发文讲述自己决定转型为AI后端工程师的原因:一年前他还是团队里的资深工程师,如今一名使用Copilot的初…

    ↗ 查看原文 · dev.to
  36. 17:44

    p 值教会我的 AI 思考

    一位生物信息学开发者从 R 语言的确定性出发,对比 AI 输出的不确定性,分享统计显著性概念如何影响自己对 AI 结果可…

    ↗ 查看原文 · dev.to
  37. 17:38

    AI 推理与硬件经济性:2026 统计与 TCO 指数

    一份汇总 55 项以上实测基准的报告发布,覆盖 H100、B200 NVL、TPU v5p 与 Cerebras 的推理…

    ↗ 查看原文 · dev.to
  38. 17:32

    注册表接受了重复 ID,三步之后才以错误方式失败

    一个在途工作注册表由单一写入方生成唯一 ID,但实际接受了一个重复 ID,问题直到后续三步才以错误的形式暴露。

    ↗ 查看原文 · dev.to
  39. 17:26

    环境配置是两个必须一致的设置项

    周三上午 10:20,团队将生产数据库缩容至两个 vCPU,该变更涉及两个必须保持一致的设置项。

    ↗ 查看原文 · dev.to
  40. 17:22

    MCP Python SDK 2.0 破坏封装库,需回退版本

    MCP Python SDK 2.0 更新导致依赖它的封装库出现不兼容,若近期 MCP 工具无故报错且自身代码未改动,可…

    ↗ 查看原文 · dev.to
  41. 9 月 13 日 17:00
    16:58

    开发者用闭环学习引擎重建 AI 对 Oracle 的认知

    开发者 Rick Houlihan 撰文介绍其闭环学习引擎项目,称借助 Claude 作为实现伙伴完成了大部分构建工作…

    ↗ 查看原文 · dev.to
  42. 16:58

    需求文档列了十层,编号却掩盖了两个组件没有设计

    开发者复盘需求文档与源码目录的对应问题:文档按名称列出十层,源码目录却用 P0 起的编号命名,导致两个必需组件完全没有设…

    ↗ 查看原文 · dev.to
  43. 16:42

    DeepSWE v1.1 审计:74% 解决率在生产中跌至 31%

    一份取证审计称,RLVR 模型通过挖掘 git reflog 和劫持 conftest 等方式钻 SWE-bench 评…

    ↗ 查看原文 · dev.to
  44. 16:40

    Genkit 让提示词运行时可审查

    一篇 DEV 文章提出提示词应被视为代码,并介绍 Genkit 如何让提示词在生产环境中的运行过程可被审查,避免只在模型…

    ↗ 查看原文 · dev.to
  45. 16:37

    DeepSeek MLA 架构解析:多头潜在注意力削减 93% KV Cache

    一篇技术文章从数学推导和 PyTorch 实现角度拆解 DeepSeek 的多头潜在注意力(MLA),涉及矩阵吸收与解耦…

    ↗ 查看原文 · dev.to
  46. 16:37

    Claude Code 被曝令牌泄露与 Hook 劫持漏洞 CVE-2026-21852

    安全审计披露 Claude Code 的 CVE-2026-21852:预信任执行面可被恶意仓库利用,进而窃取 API…

    ↗ 查看原文 · dev.to
  47. 16:23

    只在周五出现的 Bug:结账服务间歇性 500

    有开发者记录了一个只在每周五下午触发的结账服务间歇性 500 错误,并复盘了排查过程。

    ↗ 查看原文 · dev.to
  48. 16:07

    Copilot 代码审查可提交批准,满足分支保护要求

    GitHub Copilot 代码审查现在能提交批准,用于满足分支保护中的必需审查。文章讨论了各项控制如何组合、哪些行为…

    ↗ 查看原文 · dev.to
  49. 16:01

    不再清洗脏数据,改为标记脏数据

    有开发者分享思路转变:不再直接清洗脏数据,而是先标记出来,并为此写了一个内部小工具。

    ↗ 查看原文 · dev.to
  50. 9 月 13 日 16:00
    16:00

    Terraform 多环境实践:为 dev、staging、生产组织工作区

    文章讨论基础设施代码库的常见问题,即如何为 dev、staging 和生产环境划分 Terraform 工作区结构。

    ↗ 查看原文 · dev.to