有效成果
- 从零建立 Hono + Cloudflare Workers 项目
- 完成线上导航页和可玩的 2048
- 创建并公开 GitHub 仓库,持续提交修复
- 补齐模型环境、参数和测试说明
- 能够根据用户反馈定位并修复核心逻辑错误
2026.08.19 / Google Colab A100 / 完整执行记录
让模型从空目录开始,完成 Hono 项目、Cloudflare 部署、GitHub 公开仓库和一款可玩的 2048。这里保留它做对的事,也保留误判、失败和返工。
自主执行和代码产出能力不错,但首轮正确性及基础设施判断不够稳定;未经真实设备和线上访问验证,不能直接把“已完成”当作最终结果。
信息来自本次 Colab 运行记录和实际服务检查。模型未经微调,使用量化版本,单并发运行。
全程约两小时。绿色节点是有效推进,红色节点是出现误判、错误或返工的位置。
按要求在 Projects 下建立 qwen38-test,作为独立验证仓库。
创建项目文件、安装依赖,通过 Wrangler 部署到 Cloudflare Workers,并用真实请求确认首页返回正常。
模型发现问题后尝试回退,但第一次回退命令失败;随后清理暂存和历史,最终建立了干净仓库。
首次命令参数不兼容,修正后成功推送;之后补充 README,并把仓库改为公开。
终端工具返回 401/404 后,本地会话映射被清空,模型过早判断会话丢失。后续从历史和重新连接中确认实例仍在。
README 一度写成关闭思考。用户指出实际能看到思考后,模型重新检查响应格式并修正文档:思考内容是内嵌正文。
Cloudflare Quick Tunnel 与 Colab 之间断开,模型请求暂时不可用。恢复 tunnel 后才继续执行,说明临时地址不适合作为稳定服务入口。
实现计分、最高分、历史记录、撤销、重开、键盘和手机滑动,并完成部署。
首版游戏看似完整,但核心移动逻辑没有把临时数组写回棋盘,导致滑动后数字消失,属于严重可玩性问题。
直接按坐标更新棋盘,13 个逻辑用例通过;手机触摸、桌面键盘和重开流程也通过浏览器测试。
将域名写成普通 Worker 路由后就宣称生效,但真实 DNS 请求失败。正确方式应使用 Cloudflare 自定义域名配置。
改为真正的自定义域名,重新部署,并把完整过程、错误和客观结论集中展示在本页。
尽管过程有返工,模型最终确实交付了一个公开、可部署、可交互的完整小项目。
评价模型不能只看最后页面,也要看它在不确定信息下如何判断,以及错误是否被真正验证和修复。
| 问题 | 发生原因 | 处理结果 |
|---|---|---|
| Git 历史污染 | 初始化时缺少忽略规则,首次提交把依赖目录一起加入。 | 已修复 清理提交历史并重建干净根提交。 |
| Colab 会话误判 | 把终端工具的本地状态异常直接等同于远程实例消失。 | 暴露判断缺口 后续从历史与重连结果恢复信息。 |
| 思考模式描述错误 | 根据配置和历史记录推断,没有先对真实响应做确认。 | 已修复 实测后更正为思考内容内嵌正文。 |
| 接口报 530 | Colab 使用临时 Cloudflare Tunnel,隧道断开后外部请求无法到达。 | 运行限制 重建隧道可恢复,但稳定性仍取决于临时会话。 |
| 2048 方块消失 | 移动逻辑只修改临时数组,没有正确写回棋盘状态。 | 已修复 重写移动算法,并通过逻辑和浏览器测试。 |
| 自定义域名失败 | 普通路由配置不会替自定义域名自动创建对应 DNS 和证书。 | 本次修复 改为 Cloudflare 自定义域名并重新部署。 |
修复 2048 后,不再只看代码和返回状态,而是对核心操作进行了自动化浏览器验证。
这次实测说明 Qwen3.8-27B 能够理解连续任务、操作本地工具、创建项目、部署服务并在反馈后修复问题。它不是只能给代码片段,而是具备完成一条小型交付链路的能力。
但它也多次在验证不足时给出过早结论。最明显的是首版 2048 核心玩法错误,以及域名尚未解析时声称已经生效。因此,更准确的使用方式是:让模型承担大量执行工作,同时把真实构建、浏览器操作、网络请求和最终验收设为硬性门槛。