把梅西六届世界杯、20年、33场比赛、15MB原始资料一次性丢进去, 从深度人物稿到可上线的交互网站,全程 AI 端到端完成。
一、缘起
2026年世界杯决赛前夕,我想做一件事:为梅西的六次世界杯征途写一份完整的数字人物志。
不是做一个足球数据后台,不是做 PowerBI 风格的数据看板,而是做一篇「可以读的传记」——用户像读《人物》杂志一样阅读,同时可以随时点开某届世界杯、某场比赛、某个进球,查看背后的数据和故事。
这个想法正好踩中了豆包 Seed-Evolving 的两个核心能力:
- 百万级超长上下文:需要把六届世界杯、二十年间的比赛数据、新闻报道、维基百科条目一次性喂进去;
- 长程任务处理:从数据抓取、人物稿撰写、网站设计编码、图片爬取、Cloudflare 部署,是一个几十步不中断的复杂工程链路。
二、第一步:1M+ 长上下文,一口气喂进去 420 万 tokens 的原始数据
我没有手动整理数据,而是直接让 Codex CLI(底层调用 Doubao-Seed-Evolving)去抓:
- Wikipedia:梅西完整词条、每届世界杯页面、淘汰赛/决赛详细比赛报告、进球事件时间线、队友/对手/教练词条;
- RSSSF:Rec.Sport.Soccer Statistics Foundation 的梅西国家队逐场出场记录(2005-2026 全部 206 场);
- 每届杯赛的小组赛/淘汰赛/决赛:从 2006 德国到 2026 美加墨的全部 33 场比赛逐场比分、进球分钟、球员表现;
- 关键对手和队友:C罗、姆巴佩、莫德里奇、迪马利亚、斯卡洛尼等数十人维基页面;
- 2026年最新数据:包括半决赛 2-1 英格兰、38 岁帽子戏法、超越克洛泽成为历史射手王等实时赛果。
最终在 data-source/ 目录下攒了 126 个文件、16MB、约 420 万 tokens 的原始资料。
这个量级如果是以前,我需要先做数据清洗、切分、向量检索才能处理。但这次直接让模型全量读取——它能跨几十个文件找到关联:比如「2014 年决赛梅西那个偏出的单刀」和「2022 年决赛的梅开二度」之间的叙事呼应,「2018 年对尼日利亚的停球射门」和「2026 年对埃及的凌空抽射」之间的技术对照。
三、第二步:先生成一万四千字的深度人物稿
数据到位后,第一波输出是一篇编年史长文:
2026年7月19日,纽约大都会人寿体育场。39岁的梅西将率领阿根廷队走进决赛场。 这一天距离他第一次踏上世界杯赛场——2006年6月16日,盖尔森基兴—— 整整过去了二十年零三十三天……
文章按六届杯赛分章,每届包含:
- 那一年的故事(200-500 字叙事)
- 数据概览(出场/进球/助攻/分钟)
- 逐场比赛进程
- 关键节点(第 91 分钟绝杀伊朗、基多高原帽子戏法、卢赛尔加冕等)
- 当时的媒体评价(BBC、卫报、FIFA 官方原话)
让我意外的是模型对「叙事节奏」的把握——它没有把所有年份都写得一样重,而是区分了「首秀的惊艳」「2010 的沉默」「2014 的咫尺天涯」「2018 的至暗时刻」「2022 的终极救赎」「2026 的传奇继续」,情绪弧线非常清晰。
四、第三步:不满足于文章,直接做一个可交互的网站
长文有了,但「数字人物志」应该是可以点的。于是我继续让它把文章变成一个完整的静态网站。
4.1 产品形态
最终网站是「杂志专题」风格,不是数据后台:
- 深色背景 + 大幅人物照片 + 大字号衬线标题
- 阿根廷蓝白 + 深蓝 + 金色 配色
- 每届杯赛用不同色调:2006 灰蓝(少年感)、2014 银色(遗憾)、2018 暗红(压抑)、2022 金色(完成)、2026 深金(传奇)
4.2 网站包含哪些页面
| 页面 | 说明 |
|---|---|
| 首页 | 杂志封面 + 生涯总览 + 决定性瞬间 |
| 时间线 | 纵向滚动时间轴,六届杯赛逐个展开,含身份演变图 |
| 6 个章节页 | 每届世界杯的完整故事 + 数据 + 比赛列表 + 影像画廊 |
| 34 场比赛页 | 单场比赛进球事件时间轴 + 比赛意义 + 简化球场示意图 |
| 数据探索器 | 按年份/阶段/首发替补/有进球 动态筛选,实时统计 |
共 48 个页面,纯静态 HTML/CSS/JS,零框架依赖。
4.3 五个核心交互
- 年份切换:首页/时间线顶部的年份按钮,点击跳转到对应章节;
- 数据筛选:数据探索器支持按年份/小组赛/淘汰赛/首发替补/有进球 动态聚合;
- 比赛事件轴:每场比赛按分钟排列进球事件,用不同颜色区分梅西进球、队友进球、对手进球;
- 灯箱看图:首页影像记忆区点击任意照片全屏放大;
- 瞬间弹窗:9 个决定性瞬间卡片,点击弹出详细故事,可直接跳到对应比赛页。
五、第四步:自动爬取 Wikimedia 25 张历史照片并填充
文章里有数据,但还缺「画面感」。我让模型去 Wikimedia Commons 自动识别和下载代表性照片:
- 从 Wikipedia wikitext 中提取所有含
messi/argentina/lionel的图片引用; - 通过 Commons API 解析缩略图 URL;
- 按年份分类下载了 25 张照片(总计 9.2MB),包括:
- 2006 年的年轻梅西、2010 对韩国、2014 马拉卡纳凝视奖杯、2018 对尼日利亚停球、2022 举杯、2026 对埃及等;
- 自动把照片填充到首页 hero、时间线节点、章节页背景、比赛页、照片画廊。
六、第五步:一键部署到 Cloudflare Pages + 自定义域名
最后一步:
- 用 Wrangler CLI 登录 Cloudflare;
- 创建 Pages 项目,上传 81 个静态文件;
- 绑定自定义域名
messi.cornisrice.me,自动配置 CNAME 和 SSL 证书。
从「我要部署」到「访问 https://messi.cornisrice.me 看到网站上线」,全是模型自己完成的。
七、一些感受
整个过程持续了大概一个多小时的对话,但模型没有「断链」。几个让我印象深刻的点:
1. 真正用上了 1M+ 上下文,而不是嘴上说说
16MB、420 万 tokens 的原始资料,不是摘要、不是切片检索,而是模型在同一上下文中读完并建立了跨文件关联。当我要求写「2014 年到 2022 年之间梅西角色的变化」时,它能引用 RSSSF 里 2014 年某场比赛的出场数据、Wikipedia 里 2018 年预选赛的报道、再和 2022 年决赛的战术对比串起来。
2. 长程任务不需要我拆步骤
从「抓数据 → 写文章 → 做网站 → 下载图片 → 上线部署」,我没有画流程图,没有写需求文档。模型自己在每一步完成后会判断下一步要做什么:发现缺图片就去爬,发现 CSS 路径有问题就修,发现 Cloudflare 需要先建项目再部署就主动处理报错。
3. 对细节的把控超出预期
- 数据矛盾时会主动标注来源(「RSSSF 记录 26 场 13 球,Wikipedia 记录截至 2026 年已更新为 33 场 21 球」);
- 2026 年世界杯决赛是 7 月 19 日,它注意到是「明天」,所以在文章中保留了「决赛待定」的标记,没有虚构结果;
- 移动端适配、深色主题、滚动动画、键盘 ESC 关闭弹窗——这些我没提,它自己加了。
八、如何访问
🌐 项目地址:https://messi.cornisrice.me
技术栈:HTML + CSS + Vanilla JS + JSON,纯静态,无构建步骤,无框架依赖。 数据截至 2026 年 7 月 18 日(世界杯决赛前)。
方向:世界杯 × AI(球星编年史长文方向) 模型:Doubao-Seed-Evolving(通过 Codex CLI 接入) 用时:约 1.5 小时对话 产出:一篇 1.4 万字人物稿 + 一个 48 页面的可交互网站 + 16MB 原始数据集
