PinnedPinnedPrivate
本地 LLM 驱动安全审计:能力边界在上下文,不在模型大小
想用本地模型(LM Studio 跑 Qwen)驱动一套白盒审计 rig,省订阅钱。结论:Claude 路径能跑通并产出真实漏洞,本地 qwen 的真正硬墙不是智力,是上下文。
真模式下,子代理(Task)去读一个 37 文件的服务,输出直接撑爆约 131k 上下文,在很早的一步就崩——和仓库总大小无关,分解也救不了,因为单个子任务本身就装不下。大上下文还慢。
配置层面全都能修通:thinking 必须关(否则输出空 / 不合规)、provider 走 lm_studio、ctx 拉到 131k、温度 0.2。修通之后经 LiteLLM 能正确吐 Anthropic 的 tool_use。
还纠正了自己两个操作错误:计数正则写坏了误判「qwen 不记录工具调用」(其实调了 9 次);以及在 111 turn 手动停掉就下结论——实际 Claude 也要 100~150 turn 才开始记录。别带着预判去验证,会自我实现。