文档备案控制台
登录
注册
首页
AI 大模型体验中心AI 大模型体验中心AI 大模型体验中心
动手实验室动手实验室动手实验室
Agent 评测集Agent 评测集Agent 评测集
AI 案例广场AI 案例广场AI 案例广场
火山杯大赛学习中心
社区
去发布
首页
AI 大模型体验中心AI 大模型体验中心AI 大模型体验中心
动手实验室动手实验室动手实验室
Agent 评测集Agent 评测集Agent 评测集
AI 案例广场AI 案例广场AI 案例广场
学习中心
社区
lucas
lucas
文章
专栏
问答
lucas
lucas
MiniMax H3 开源:33B 全模态视频模型来了,但「开源」两个字得拆开看
AI生态AIGC大模型算法
💡 一句话总结:MiniMax H3 是个 33B 的全模态视频生成模型(不是语言模型),7 月底预告、8 月初开放了 H3-Base 权重;但「开源」指的是基础权重,2K 超分和多模态上下文编排这两个亮点能力还在闭源 API 后面,协议也是 MiniMax 自有的——想本地玩、想商用、想看跑分,各有各的注意点。 \最近 AI 视频生成这条赛道卷得厉害——OpenAI 的 Sora、快手的可灵
0
0
0
0
lucas
lucas
Qwen3.6-Fable-Fusion-711:209万下载是真的,「首个开源破700」得另说
AI生态大模型AI生态
💡 一句话总结:下载量、热度、模型本身能跑——这些都真实成立。但「首个开源模型突破 700 ARC-C」这个最抓眼的卖点,目前只有作者一个人说了算:所有媒体报道都转自同一个导流站,连评测用什么框架都没交代,唯一相对独立的行业媒体直接标了「unverified」。把它当「一个热门的去审查开源模型」看,成立;当「开源已经追上闭源」看,还早。 \最近 HuggingFace 的 trending 和
0
0
0
0
lucas
lucas
Skill-α:教 Agent 学会自己'改说明书'
AI生态SkillAIGCAI生态
💡 一句话带走:Skill-α 把 agent skill 的生成变成"一步步改",用 rollback reward(编辑前后在同一任务上跑一遍对比)给每次编辑打分,绕开了"skill 没有天然监督信号"这个本质难题。如果你在做 agent、正头疼 skill 怎么积累而不是手写,这篇值得读。 \先问一个可能戳到你的问题:你给 agent 配的那份 skill(或者叫工具说明、操作手册、SO
1
0
0
0
lucas
lucas
SwanTale:字节把声音克隆和「自然语言导演」塞进了同一个模型
AI生态AIGC
💡 一句话带走:字节 2026 年 8 月的技术报告 SwanTale 用一套统一框架(SwanVAE 连续 latent + Flow-matching Transformer + Unified MoE + GRPO 后训练)同时做好了两件原本要分开做的事——用自然语言 caption 当「导演」指挥生成(instruct TTS)和用参考音频克隆音色(zero-shot TTS),还能在一
4
1
0
0
lucas
lucas
为什么调一个文档抽取 pipeline 要花几周?IDP AutoOpt 让 agent 来替你
AI生态AI生态技术解析大模型
💡 一句话带走:AWS 的 IDP AutoOpt 派一个跑在闭环里的 LLM agent(评分 → 逐字段诊断错误 → 改配置 → 重评),把一整条文档处理流水线的配置(prompt、模型、OCR、schema、结构)自动调到人类专家水平,号称 2 小时干完几周的活、还更省钱。做 RAG / 多 agent / 文档抽取的人,哪怕不碰 IDP,也该带走它那三条反直觉的工程经验。先问一个可能戳到
4
1
0
0
lucas
lucas
做文档解析的人该看看 Infinity-Parser2:一个模型把版面、表格、公式、图表全端了
AI生态行业趋势技术解析深度学习
💡 一句话带走:Infinity-Parser2 把"可控数据合成 + 多任务联合强化学习"拧成一个端到端文档解析大模型,开源 500 万双语数据和两个模型,给"用一个模型替掉整条解析流水线"提供了很强的公开基线——做 RAG / 文档智能的人值得在自己数据上跑一遍。做 RAG 或文档智能的人,多半都和 PDF 解析较过劲。你拿一份双栏论文、一张密密麻麻的财务表、一段手写公式塞给解析工具,结果版
3
0
0
0
lucas
lucas
阅读笔记:ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
AIAI生态技术解析图像识别
资源论文:https://arxiv.org/abs/2607.29677代码:https://github.com/run-llama/ExtractBench数据集:https://huggingface.co/datasets/llamaindex/ExtractBench项目主页:n/a这篇论文用 一个五轴挑战标注的 benchmark(370 篇真实/合成企业文档、4869 页、8 领域
1
0
0
0
lucas
lucas
阅读笔记:DocOCR-Eval
AI图像识别人工智能文字识别
这篇论文用 "MLLM 当 corrector、衡量 OCR 原始输出与校正后输出的差异" 的思路,提出一个无需人工标注的 OCR 引擎选择框架 DocOCR-Eval:对每个候选引擎的输出依次跑三阶段错误诊断(字符噪声 $D_c$ / 分词错误 $D_t$ / 语义一致性 $D_s$)并条件触发两个 MLLM 校正器(纯文本 $C_t$ / 带视觉裁剪重识别 $C_v$),再用校正后 ANLS
1
0
0
0