近几年大语言模型(LLM)行业陷入一种奇怪的数字版本竞赛——每发布一个新版本,就要办一场盛大的发布会,堆砌一组惊艳的跑测对比数据。对于这种“月更甚至季更”的节奏,带来的不仅是营销疲劳,更是实际应用中的版本撕裂。对于 AI 行业的开发者来说,刚基于某个版本做完开发适配,新版本又要来了,API 要切换、Prompt 要重新调试、评测要重做,对于普通用户来说,对于众多的版本更是一头雾水。
最近,豆包 Seed 团队给出了新的答案,不是一个新版本号,而是一套全新的模型交付模式:
Evolving —— 持续进化,周级迭代,永远给用户一张“最新”的模型卡片。
Seed-Evolving 不再是一个静态的版本快照,而像是一条持续优化的流水线,每周以热更新的方式迭代升级。
首先,简单理解一下本次 doubao-seed-evolving 模型的升级要点,主要有五个方面,如下:
1、模型型号常态化
使用固定的模型code,统一调用 Model ID doubao-seed-evolving,后续无需再关注版本切换,对于开发者,不需要进行模型版本升级,调整调用方式等,同时也减少了“V1”“V2”之类的版本号管理的焦虑,一套对接好,即可长期使用。
2、1M 超长上下文全面落地
上下文窗口扩展至 1M tokens,单次任务可处理更大规模信息,比如大型代码仓库、长篇文档、多轮对话记录等。不要以为这是简单的数字的放大,在某些场景会有很好的应用,比如在一个对话中就可以阅读一本书或者几本书,基本上可以一次处理《三体》三部小说的体量,肯定要比之前分散处理文本要简单的多,准确性也会更高。
3、长程任务表现强劲
在有了 1M 长上下文的加持,在时间更长、步骤更多、依赖更复杂的任务中表现更稳定。基于该能力,能提升任务编排、多轮交互等场景的应用。
4、国内 Opus 再填平替
在长文本综合理解、创作连贯性、知识融合深度上,Seed-Evolving 已达到对标国际一线 Claude Opus 模型的水平,且 API 调用的成本仅为其零头。
5、面向 Agent 与 Coding 场景打造的分支模型
首次推出面向代码生成与智能体任务的分支模型,且以周级频率专项强化,专治“复杂工程化 Prompt ”和“多工具调用编排”场景。
1、工具下载、安装
本次的案例是在工作中真实场景,稍作简化。工具为:TRAE CN、TRAE Work CN
下载地址:https://www.trae.cn/,或者搜索下载。
下载后安装即可,安装好后,如下图:
TRAE:
TRAE Work:
2、模型开通、工具配置
(1)模型开通(两种方式)
火山方舟平台地址:https://ark.volcengine.com/region:cn-beijing/overview
- 一种方式:登录,进入控制台
左下角“开通管理”,选择对应的大模型,点击“操作”下面的“开通服务”,过一会儿就可以调用了。
- 另外一种方式:登录,查看对应的模型
点击右上角“API 接入”,按照 step 便可开通。
本次实测需要开通两个模型:Doubao-Seed-Evolving、Doubao-Seed-2.1-pro
(2)工具配置
TREA 模型配置:
点击添加模型,按步骤配置。
TREA Work 模型配置:
点击添加模型,按步骤配置。
其中选择“火山引擎”,选择 Doubao-Seed-Evolving、Doubao-Seed-2.1-pro 两个模型,同时配置 API key,API key 从火山方舟控制台左下角“API Key 管理”里获取。
Case 1:1M上下文,阅读理解《金字塔原理》,从“截断式阅读”到“全书级理解”
**执行如下:
(1)工具 TRAE Work + 模型 Doubao-Seed-Evolving,效果如下:
(2)工具 TRAE Work + 模型 Doubao-Seed-2.1-pro,效果如下:
以上是相同的任务,使用了不同的模型,不同的效果,其中可以看出如下对比结果:
- 第一:Doubao-Seed-Evolving 模型执行的时间长,但任务执行过程中计划更加完善,考虑到的步骤更多,而 Doubao-Seed-2.1-pro 模型执行时间短,反复思考(ReAct)执行的能力相对比下要弱一些。
- 第二:从生成的结果、效果看 Doubao-Seed-Evolving 总结的也更好,生成的网页也更美观,因生成的页面比较长,这里就不粘贴出来对比了。
- 第三:本次任务消耗的 Token 量,Doubao-Seed-Evolving 消耗 182.8 万,Doubao-Seed-2.1-pro 使用量级差不多,但是它任务执行简单些,调用次数少些,相比还是 Evolving 使用量更少。
Case 2:Agent 与 Coding 能力提升,tianying-agent-chat 应用自动化开发
工具 TRAE + 模型 Doubao-Seed-Evolving, 需求如下:
提示词如下:
现在公司准备开发一个应用,前端使用vue2语言开发,包含功能及页面如下:
1、登录页面,给出默认登录用户及账号,提供两种登录方式,一种是账号密码登录,一种是短信登录。
2、登录后的默认页面,页面为工作台,工作台主要以块状+标题的方式展示Agent,有分页功能,并且鼠标移动到 Agent 上时,有动态效果。
3、聊天页面,点击Agent后,跳转到对应 Agent 的聊天页面,可以进行对话聊天。
要求:
1、页面UI可以使用element ui等主流ui框架。
2、需要能够自适应,适配移动端。
执行任务前,先创建好项目目录“tianying-agent-chat”,下面就是等待任务执行了,生成的全流程如下:
生成的代码:
页面效果:
页面的视频效果可以到公众号(StarkLi)上查看。
不得不说,这效果已经非常可以了,从0到1完成了项目框架的搭建、代码开发、效果验证。
Case 3:长程任务,从页面原型设计师来看执行迭代
任务如下:
使用工具 TRAE Work + 模型 Doubao-Seed-Evolving,执行流程如下:
页面效果:
本来 Case 3 是实测长程任务的,才一两轮效果已经很好了😂。
不过每一次的提问后,其实任务执行是有计划性的,这其实也是长程型的任务,只是 Agent 包装好了,从第一个 Case 也能看出来,同时说明了模型在 Agent 编排上能力的提升。
本次从实际的案例出发,可以看得出来,不管是对话聊天、Vibe Coding,还是设计,能力都有很大的提升,基本可以用到工作中了。
