匿名模型又来了:跑分追平头部,跑起来慢到让人放弃

admin 2026-09-30 05:24:26 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 这篇文章评测了匿名AI模型PixelCanary,该模型在VercelAIGateway免费开放,Next.js编程评测成功率90.3%与GPT-6Astra持平,但平均耗时1015秒速度极慢。社区实测反馈慢且不稳定,有人等8小时放弃。文章提醒免费服务不提供零数据保留,提示词可能用于训练,建议敏感代码勿接入,用真实任务测试并注意文档补位。 综合评分: 75 文章分类: AI安全,安全意识,安全工具,威胁情报,实战经验


匿名模型又来了:跑分追平头部,跑起来慢到让人放弃

梓陌说科技

2026年9月29日 08:20 湖北

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

Pixel Canary 免费开放,代价写在条款里

又一款没有署名的模型出现在编程工具里。Pixel Canary 在 Vercel 的 AI Gateway 免费开放,Next.js 编程评测拿到 90.3%,和 GPT-6 Astra 持平。但榜单一翻页,平均完成任务耗时 1015 秒,接近 17 分钟。有人等了 8 小时放弃,有人跑了 5 小时中途报错。这篇把它的成绩、代价和这一整套「猜身份」玩法讲清楚。

01 90% 的成绩单,要连着看两行

Pixel Canary 9 月 25 日出现在 Vercel 的 AI Gateway,模型标识 stealth/pixel-canary,匿名期间限时免费。定位是应用构建、现有代码重构、前端开发和移动应用设计,支持约 26.2 万 Token 上下文和可调节的推理强度,开发方未披露。

榜单成绩是这样:Vercel 的 Next.js Agent Evals,常规设置下 31 项任务完成 28 项,成功率 90.3%,与 GPT-6 Astra 的高推理档持平,高于 Kimi K3 的 84%。当评测通过 AGENTS.md 把 Next.js 文档喂给模型,它完成了 30 项,成功率 96.8%——不过这个设置下,Kimi K3、GPT-6 Astra 也同样到 97% 左右,说明文档的作用比很多参数都大。

两行话要注意。一是评测用 pass@4:每项任务最多试四次,有一次成功就算通过。所以 90% 不能理解成「交给它十个任务,首轮完成九个」。二是同一张榜上,Pixel Canary 的平均耗时 1015.80 秒,GPT-6 Astra 是 251.89 秒,Kimi K3 是 352.34 秒。能做完,和能高效地做完,是两件事。

02 实测反馈:慢,且不稳定

社区实测的主力情绪就一个词:等。有测试者跑了 6 小时才拿到一个经典测试结果,评价是「慢得令人抓狂,而且很不稳定」;有人做鹈鹕测试,5 小时各种报错,输出速度个位数;有人熬过 20 多个 Provider 错误和 7 个多小时才拿到效果;还有网友等了 8 小时后直接放弃,理由是服务不稳定的话,再高的分数也谈不上实际价值。

稳定性问题也被多次提到。一位用户说自己用时多次遇到任务做到一半突然中断,最终停用;另一位测试者回应,自己也是试了好几次才得到结果。Reddit 上有反馈说,读取代码库这一步就花了很长时间,慢到没法形成对能力的完整判断。

这些是不同人在各自接入条件下的体验,不能直接当成模型的统一性能指标——延迟到底来自模型本身还是当时的服务资源,目前说不清。但它们和榜单上那 1015 秒指向同一个事实。

03 免费的另一面:数据条款

| | | | — | — | | 项目 | 情况 | | 使用成本 | 匿名期间免费 | | 数据保留 | 不提供零数据保留(ZDR) | | 提示词用途 | 可能被用于训练及模型改进 | | 开发方 | 未披露 | | 开放期限 | 限时,未公布截止日 |

Vercel 在发布说明里写得很明确:发送的提示词和回复可能被用于训练及模型改进,供应方也可能保留输入与输出。对把代码仓库接进智能体的开发者来说,这一条比「免费」两个字更值得先看一眼——代码、配置文件、项目上下文都可能随任务一起进入请求。客户代码和私有仓库,接之前最好掂量一下。

04 猜身份:一个月内第三次同款玩法

社区的反应很快分成两拨,一拨测能力,一拨猜身份。有人根据泰语、印地语的切分方式推测它和 Qwen 3.8 有关,有人觉得是 Kimi K3.1,还有人看名字里的 Pixel 和 Canary 猜是 Google,随即被提醒代号可能只是随机取的。Reddit 上一位用户还提出了反驳:Pixel Canary 标称 26.2 万 Token 上下文,而 Gemini 已支持 100 万 Token,从这个角度看不太像谷歌出品。到目前为止,官方信息为零。

有意思的是,这套玩法过去一个月已经演了两遍。8 月,Ox Alpha 匿名上线,七天内被全球开发者用掉 23.2 万亿 Token,中文社区给它起名「牛来」,各家猜了一圈,8 月 26 日智谱揭晓:是 GLM-5.3-Flash,3200 亿总参数、180 亿激活、MIT 协议开源。9 月 16 日,Union Alpha 出现在 OpenRouter,上线首日跑掉约 20 亿 Token,同样走完了一遍免费分发、积累反馈、等待揭晓的流程。

匿名上线本身有道理:拿掉厂商名字,开发者先动手测,少受品牌印象干扰。但同一套悬念连演三次,注意力容易从「这个模型能解决什么问题」滑向「这次又是谁在造悬念」。目前没有证据表明 Pixel Canary 的发布方刻意炒作,这个疑问值得留个心眼。

05 值得留意的两个背景

第一个值得看的是分发方式。Pixel Canary 没有做独立的聊天界面,而是作为一个可选项,塞进开发者已经在用的编码 Agent 里,由网关统一处理计费和路由。Vercel 的 CEO 透露了一个数字:AI 编码 Agent 目前触发了平台 600 万次日部署的一半以上,半年前这个比例还不到 3%,公司年度经常性收入 3.4 亿美元。模型放在网关里免费试用,本质是在抢占这个入口。

第二个是跑分的归属。这些分数是 Vercel 自己的评测套件、跑在 Vercel 自己分发的模型上,属于自报口径,值得独立验证。而且全部成绩只来自 Next.js 一个框架,对其他技术栈的参考价值有限。

想试的话,三件事先做:拿自己项目里的真实任务去测,别看榜单,同一个任务跟现有模型跑个对照;注意项目文档的补位,AGENTS.md 一类的说明能把通过率拉高好几个点,代码规范写清楚可能和选模型一样重要;敏感代码别接,没有零数据保留承诺的免费服务,本质上是用数据换的。

匿名模型,会不会试?

评论区聊聊用下来的体验,或者猜猜它是谁。觉得有用就点个赞和在看。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。

本文转载自:梓陌说科技 《匿名模型又来了:跑分追平头部,跑起来慢到让人放弃》

评论:0   参与:  0