GPT-6 Astra「鹈鹕测试」:从骑车鹈鹕看空间与推理档位
新模型一上线,开发者社区里最快出圈的往往不是完整榜单,而是一个能截图传播的小实验。GPT-6 Astra 发布后,这类实验里最有名的之一,是沿用多年的 「画一只骑自行车的鹈鹕」(pelican on a bicycle)——通常要求模型输出 SVG,再把不同模型、不同推理档位的结果排成对比网格。
Simon Willison 等在拿到 Astra 后,用 low / medium / high / xhigh / max 等档位生成鹈鹕 SVG,并与 GPT-5.6 的 Sol、Terra、Luna 放在同一张对比图里。结论很直观:Astra 的鹈鹕明显更像「一只鸟在骑车」,而不只是抽象色块拼图。
鹈鹕测试测的是什么
它不是官方基准,而是社区压力测试,主要考察:
- 空间关系——鸟、车架、轮子、腿是否在合理位置
- 结构完整性——SVG 是否可渲染、部件是否齐全
- 指令遵循——是否真的在「骑」车,而不是鸟和车分家
- 推理档位的边际收益——多花 Token 是否换来更清晰的结构
对 Astra 这类强调 空间、机械与 Agent 的模型,鹈鹕测试恰好踩在「几何关系 + 可执行输出」上,所以参考价值比纯文笔打分更贴发布叙事。
Astra 网格里常见观察
综合公开对比与社区记录,大致有这些共识:
| 观察 | 含义 |
|---|---|
| Astra 各档鹈鹕整体强于 5.6 Sol 等 | 空间与构图能力代际可见 |
| 即便 low,也可能好过旧旗舰任意档 | 「地板」抬高,不只靠拉满推理 |
| 未到 max 时,腿与车轮左右关系仍可能不稳 | 细节结构仍随 effort 波动 |
| max 档常出现最完整、最好认的一只 | 最难空间约束仍吃推理预算 |
| 同档 Token 与费用结构和旧模型不同 | 比标价更要看「这一档实际消耗」 |
也有人顺带用 Blender 等做「鹈鹕骑车」三维场景,与 SVG 测试形成同一主题的 2D 结构 vs 3D 工具操作 对照,和 Astra 的 Computer Use / 空间生成讨论是一条线上的。
它能说明什么,不能说明什么
能说明:
- 模型在 向量图形级空间布局 上相对上代有肉眼可见的提升
- 提高 reasoning effort 对结构复杂度任务仍然有用
- 「好玩的小测试」可以快速暴露 地板与天花板,适合做发布后的第一轮体感
不能说明:
- 不等于 AGI,也不等于写作、法律或长文风格一定更强(有早期体验认为文笔相对上代并不占优)
- 不等于 ARC-AGI 等正式基准的分数可直接换算
- 单次 SVG 成功 ≠ 生产环境里长程 Agent 稳定
因此更合理的读法是:鹈鹕测试是空间与可控生成的烟测(smoke test),用来决定「值不值得继续做重测试」,而不是用来下最终判决。
和正式榜单怎么一起看
Astra 发布材料强调电脑操作、工程、数学与对齐;第三方则提醒综合智能指数未必暴涨、部分分数依赖评测 harness。鹈鹕网格的作用是:
- 若鹈鹕仍然「碎成几何色块」→ 空间能力叙事要打折
- 若 low 档就明显可读 → 日常成本档可能就够用
- 若只有 max 才像鸟 → 生产上要慎用默认满档,并做费用上限
这与「短任务用低档、难空间/难 Agent 再升档」的工程策略一致。
想自己复现时注意什么
- 固定提示词(例如:生成鹈鹕骑车的 SVG,要求部件可辨、可独立打开渲染)。
- 只改模型与 reasoning 档位,便于对比。
- 记录输入/输出 Token 与费用,避免只比「好不好看」。
- 多跑几次:生成有随机性,网格应看成分布而不是一张定终身。
接入与试用
鹈鹕测试用官方 ChatGPT / API 即可。若团队要在统一入口切换 GPT 与 Claude 等模型做并排实验,可用兼容网关管理密钥。
DDS Hub 按 Model Group 分组管理模型,便于把旗舰与日常模型分开计费;GPT-6 Astra 等是否在列以 www.ddshub.cc/models 为准,文档见 www.ddshub.cc/docs 。
结语
GPT-6 Astra 的「鹈鹕测试」爆红,是因为一句话提示就能把 空间结构能力 展现在网格里:相对 GPT-5.6 系列,骑车鹈鹕从「抽象拼贴」更接近「可识别的场景」。它适合作为发布后的第一轮体感与档位成本实验,但真正的选型仍要回到仓库任务、电脑操作链路与账单结构。先看鹈鹕是否像鸟,再决定要不要为 max 档买单——这是社区测试最实用的读法。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu