登录注册
首页
AI 大模型体验中心AI 大模型体验中心AI 大模型体验中心
动手实验室动手实验室动手实验室
Agent 评测集Agent 评测集Agent 评测集
AI 案例广场AI 案例广场AI 案例广场
火山杯大赛学习中心
社区
去发布
首页
AI 大模型体验中心AI 大模型体验中心AI 大模型体验中心
动手实验室动手实验室动手实验室
Agent 评测集Agent 评测集Agent 评测集
AI 案例广场AI 案例广场AI 案例广场
学习中心
社区
lucas
lucas
文章
专栏
问答
lucas
lucas
把表格压成 64 个 token,长文档问答反而更准了:先找表,再看数
AI生态AI生态技术解析行业趋势
💡 一句话总结:把文档里的表格渲染成图、压缩到 64 个视觉 token,模型读不出具体数字,却还能准确判断"哪张表和问题相关"——爱丁堡大学团队据此设计了两段式问答:先用压缩图找表,再对找出的表做原生分辨率推理,长文档上省 41% token、准确率反涨 7 个点。做文档 QA / RAG 的人值得花十分钟读完。 \先问一个可能戳到你的问题:你的文档问答 pipeline 接了一份 100
3
0
0
0
lucas
lucas
把 8300 万个报纸版面单元变成可查询对象
AI生态行业趋势技术解析AI生态
💡 一句话总结:这条管线把历史报纸从“页图加 OCR 噪声”改成 crop 级结构化数据;每个 crop 挂着文本、类型、语言、实体、主题、顺序和向量,研究者可以过滤、重建和审计。 \历史报纸大概是文档处理里最难啃的版面之一:新闻、广告、标题、图像、漫画和 masthead 混在一页;栏目不规则,纸张破损,字号小,语言多样。如果直接做页级 OCR,常见结果不是“读错几个字”,而是栏目串读。广告
1
0
0
0
lucas
lucas
ArmorOCR:模型读出了隐藏文字,但它知道自己在读哪里吗?
AI生态技术解析行业趋势Agent
💡 一句话总结:ArmorOCR 把对抗 OCR 从“能不能读出文字”升级为“能不能定位正确区域、读出内容并回答区域级问题”;两阶段训练把 8B 模型的 AdvSpot accuracy 从 31.2 拉到 55.7,但离解决还很远。 \你把一张网页截图、AI 生成图或验证码式图片交给多模态模型,它输出了一段看似正确的隐藏文本。你是直接信,还是想追问一句:你说的到底是图里哪个区域?这不是抬杠。
2
0
0
0
lucas
lucas
35 种开源文档抽取配置,只有 4 个跨过 F1 0.5
AI生态AI生态技术解析Agent
💡 一句话总结:在真实公共部门成绩单上,开源零样本结构化抽取远未到可自动化水平;决定成败的不只是模型大小,OCR 是否保留行分组和表格结构同样关键。 \做文档抽取原型时,表格通常很配合:PDF 清晰、列名规整、每行课程、成绩和学分都乖乖待在自己的单元格里。真实申请材料不是这样。同一批成绩单来自不同学校,混合标题、校徽、自由文本、非统一表格、多语言记录和不同成绩制式。你要输出的不是一个答案,而是
61
0
0
0
lucas
lucas
DocClaw:让文档 Agent 记住自己刚刚读过哪里
AI生态AI生态技术解析Agent
💡 一句话总结:DocClaw 的贡献不是发明新 backbone,而是把文档任务差异放到技能层、把可复用知识放到状态层、把感知动作放到工具层;技能提升质量,状态降低重复计算。 \想象一个很常见的文档智能工作台:用户先问“这页写了什么”,接着问“第三页的合同金额是多少”,然后又要求抽发票号、付款条件和供应商字段。很多系统会把这三件事当成三个任务:OCR 跑一遍,DocQA 再跑一遍,KIE 又
10
0
0
0
lucas
lucas
OmniHandwritingOCR:别让多模态大模型把手写公式读成幻觉
AI生态AI生态行业趋势技术解析
💡 一句话总结:OmniHandwritingOCR 用 77,572 个图像-标签对、6 个子任务和 12 个子集把手写 OCR 从“总分游戏”变成失败模式诊断;它最刺眼的发现是,多行公式一难,最强模型的字符错误也会失控。 \先问一个可能戳到你的问题:你把手写作业拍照丢给多模态大模型,它输出了一段流畅 LaTeX,你敢直接进题库、判分系统或知识库吗?做文档智能的人大概都经历过这种时刻:单行文
5
0
0
0
lucas
lucas
DocMemo:让长文档 RAG 学会带记忆地翻页
AI生态AI解决方案AI生态技术解析
💡 一句话总结:DocMemo 把长文档检索从“先选一批页再硬答”改成“读、记、更新置信度、再找”的循环;如果你做的是 RAG、文档 Agent 或多模态文档理解,这篇最值得拿走的不是分数,而是把检索状态显式建模的工程思路。 \先问一个可能戳到你的问题:你那个长文档问答系统,第一次检索错页之后,还有机会自己纠正吗?很多做文档 RAG 的人大概都见过这一幕:问题明明在第 38 页的表格和第 52
14
0
0
0
lucas
lucas
83.85% vs 17.91%:FormStruct-Bench 揭开表单解析的错觉
AI生态AI解决方案行业趋势技术解析
💡 一句话总结:FormStruct-Bench 把表单解析从“字段抽取对了几个”推进到“结构到底坏在哪一层”;它测出最强内容分数可达 83.85%,但最佳主结构指标只有 17.91%。如果你做文档 AI、RAG 前置解析或流程自动化,这篇很值得读。 \先问一个可能戳到你的问题:你那个表单解析 pipeline,真的知道每个值属于哪里吗?做文档抽取的人多半见过这种场面:模型把 “Bob”“Ma
7
0
0
0
lucas
lucas
DEC:别急着重训,先让表格解析器再检查一遍
AI生态人工智能人工智能与算法
💡 一句话总结:这篇论文把“公开基准高分但真实复杂表格仍翻车”的问题拆开诊断,再用 DEC 在不重训解析器的前提下做拆表、增强、修正和回滚;它不是万能 OCR 升级,但给冻结模型和闭源解析器提供了一条很工程化的补丁路线。 \先问一个可能戳到你的问题:你的文档抽取 pipeline 里,最怕的是 PDF 没文字,还是表格明明在眼前,模型却把第三列接到了第五行?做 RAG、财报抽取、合同结构化、报
8
0
0
0
lucas
lucas
喂张白纸也能吐出证件号?文档 MLLM 的"关系级泄露"被测出来了
AI生态AI解决方案技术解析行业趋势
💡 一句话总结:文档 MLLM 在看不清图的时候会靠"背下来的字段关系"成组吐出敏感信息,这篇 ACM MM 2026 论文量化了这个风险(最坏 95.5% 泄露率)并给出遗忘方案 DRUF——如果你的业务里有证件识别、表单抽取这条链路,建议花十分钟了解一下。 \先问一个可能让你后背发凉的问题:把你家文档抽取模型拿过来,喂一张空白图或者一张无关的风景照,再问一句"这份证件的信息是什么"——它会
1
0
0
0
lucas
lucas
1.2B 小模型赢过 235B 大模型:NaviDC-OCR 把文档解析卷明白了
AI生态Agent技术解析AI生态
💡 一句话总结:NaviDC-OCR 证明了在文档解析这条赛道上,"针对性的数据工程 + 训练配方"比堆参数量管用——1.2B 模型四大基准全第一,还顺手赢了一堆几十倍大的通用大模型;做 RAG、OCR、文档智能的人值得读它的方法部分。 \你的 RAG 系统里塞进去一份 PDF,检索质量还行。然后用户传了张手机拍的合同照片——页面有点弯、有阴影、表格被透视压扁——chunk 切出来一片狼藉,检
1
0
0
0
lucas
lucas
AutoDesign:让 Agent 自己改自己的 harness,40 分钟把论文变成会议海报
AI生态AIGCAgentPrompt
💡 一句话总结:AutoDesign 把「围绕模型的那套系统」(prompt、工具、流程)变成可被 Agent 自动优化的对象——外层循环改系统、内层循环出作品,模型权重一动不动。落在论文转海报任务上,它超了商业系统 Claude Design 7.45 分。做 Agent 开发的人,这篇的「怎么让系统自己进化」可以直接抄作业。 \先问一个可能戳到你的问题:过去一年里,你有多少个晚上是在改 s
1
0
0
0
lucas
lucas
视频生成得很真,机器人却抓了个寂寞:DreamX-Phi 的几何药方
AI生态AI生态行业趋势人工智能
💡 一句话总结:DreamX-Phi 1.0 用"把每条手臂的 3D 运动轨迹直接钉进注意力机制"的几何化方式,解决视频世界模型"画面很真、动作不听"的老毛病,拿下 WorldArena 2.0 视频预测赛道第一——做世界模型、具身智能或视频生成的人都该看看这个思路。 \如果你玩过或做过视频世界模型(world model,一种"给定当前画面和你的输入,预测接下来会发生什么"的生成模型),下面
1
0
0
0
lucas
lucas
Grok 4.6:追平 GPT-5.6 Sol 的半价旗舰,但别只看跑分
AI生态AI生态行业趋势Agent
💡 一句话总结:Grok 4.6 在智能指数上追平了 GPT-5.6 Sol(都 61 分),token 价格只有一半——但真正让人意外的是它的回合效率(完成 Agent 任务只要 Claude Opus 5 一半的步骤),而真正让人犹豫的是 200K+ 翻倍定价规则和 Grok 品牌一长串治理黑历史。 \8 月 12 日是个疯狂的日子。DeepSeek V4-Pro 正式 GA,阿里首个开源
1
0
0
0
lucas
lucas
DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说
AI生态AI生态deepseekAgent
💡 一句话总结:DeepSeek V4-Pro 旗舰模型今天正式 GA,Agent 能力据报暴涨(DeepSWE 从 12.8 飙到 62.7),价格比 Claude Fable 5 便宜约 46 倍——但所有跑分都是 DeepSeek 自己发的,还没有任何第三方验证过。便宜是真的,强不强得再等等。 \如果你是一个天天挂着 Claude Code 或者 GPT 写代码的人,最近几个月大概率有过
1
0
0
0
lucas
lucas
给检测器插 LoRA,'插对地方'比'插什么'更要命
AI生态AI解决方案技术解析AI生态
要理解为什么会"静默翻车",得先看看现代检测器长什么样。大语言模型基本上是一摞结构几乎相同的 Transformer 层——每一层都是注意力 + MLP,参数化的方式高度一致。所以你在任意一层插 LoRA,行为都是可预测的,这就是 HuggingFace PEFT 这类通用库"按模块名匹配就能用"的底气。但实时检测器完全是另一回事。一个现代检测器是个异构算子的大杂烩:普通 dense 卷积(可以用
1
0
0
0
lucas
lucas
延迟只多 0.8 毫秒,检索质量涨 2.92%:抖音 DME 怎么让多模态检索又快又准
AI生态AI解决方案AI生态技术解析
💡 一句话总结:抖音搜索团队提出 DME,用"隐式 latent reasoning + 跨条件重建"两个训练期机制,让多模态嵌入在不增加推理延迟的前提下既快又准,还提出 acc@K 指标证明嵌入向量能解码回文本。 \做过多模态检索的朋友,大概率都撞过同一堵墙。你用对比学习(contrastive learning)训了个 bi-encoder——就是 query 和文档各自编码成一个向量,算
1
0
0
0
lucas
lucas
Muse Glimmer 30B:Meta 难得给的真开源,强在哪、虚在哪
AI生态AI解决方案AI生态技术解析
💡 一句话总结:Meta 用 Apache 2.0 放了一个 30B、单卡能跑、冲着本地 agent 去的模型——官方跑分漂亮、生态一天内就跟上,但蒸馏来源不透明、跑分有人怀疑、安全对齐已有翻车报告,值不值得下手得看你是哪类用户。 \玩本地大模型的人这几年大多有个同感:30B 这个段位(够聪明、又不至于让消费级显卡哭)能选的就那几个——Qwen 系强是强,思考起来 token 哗哗地烧,半天等
1
0
0
0
lucas
lucas
Q-CueGraph:你的多模态大模型会 zoom,但真的知道该看哪儿吗?
AI生态算法大模型AIGC
💡 一句话总结:Q-CueGraph 把多模态大模型"看哪里"的决策拎出来,做成一个独立、可审计的坐标级策略,在冻结的 Qwen2.5-VL 上用 19% 的画面帮 V*Bench 准确率从 0.696 拉到 0.833——但别急着当 SOTA 读,它真正的价值是一份"什么时候该让模型 zoom"的清醒账。 \先问一个可能戳到你的问题:你给多模态大模型喂了一张 4K 大图——一份密密麻麻的发票
4
0
0
0
lucas
lucas
Prompt-Region Grounding:为什么把题目画进图片,多模态大模型就集体"不会做题"了
AI生态AI生态大模型人工智能
💡 一句话总结:把题目从文本挪进图片,主流多模态大模型几乎全军覆没(24 个组合全掉分,平均 17.8 分),而它们常常能正确"读"出题目却不照它作答——这篇论文用一套干净的控制实验证明"读视觉文本"和"把它当任务指令用"是两种能力,并给了一个 region 级训练法把这道鸿沟缩小,推理还不用 OCR。你有没有过这种经历:让大模型看一张图——工单截图、学生拍的试卷、一张报表——它明明把图里的文字
7
0
0
0