跳到主要内容

一半的命令会搞砸,然后呢

阿简
阿简

· 阅读约 2 分钟

最近看到个叫 Nightcrawler 的项目。简单说,它是一个跑在安卓手机上的自动渗透测试 agent。

但我今天不想讲渗透测试。我想讲它怎么用一个 12 亿参数的本地小模型,把一件复杂的事干完。

这个项目用的模型很小。小到一部 root 过的安卓手机就能带得动。

测试环境是一台一加 8。生成速度在每秒 13 个 token 左右。对本地跑的 agent 来说够用了。

最值得讲的地方在这里。这个 1.2B 的小模型,命令成功率大概只有 50%。

一半的命令它会搞砸。

但它没有去换更大的模型。它用工程手段把这个低成功率兜住了。加了垃圾输出检测。加了重复检测。检测到不对就重来。

模型搞不定的时候,它还带着 27 个现成的 exploit playbook,直接走预设流程。

这个思路值得抄。

很多人觉得用 AI 编程,模型必须够大够聪明。其实不是。模型不够聪明,你可以用外围的工程逻辑去补。

整个 agent 不需要云端。模型在手机上,推理也在手机上。

它还在 agent 和真实执行之间加了一层校验。agent 说要干什么,proxy 先看一眼在不在授权范围内,不在就拦掉。

用 AI 编程也是一样的道理。别指望模型百分百靠谱。给它设个边界,出界了就拉回来。这比祈祷它不出错有用得多。

老实说,对普通人来说门槛不低。你需要一台至少 12GB 内存的安卓手机,还要装 Kali NetHunter 和 root。这些加起来,比在电脑上跑个 Cursor 难多了。

WiFi breach 能暴力破 WPA2 这点,我一直没看明白它的具体实现。先放在这里,等我搞懂了再补。

本周就这些。

上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →

评论

还没有评论,写下第一条讨论。

一半的命令会搞砸,然后呢 | 跑通