登录
注册
首页
AI 大模型体验中心
动手实验室
Agent 评测集
AI 案例广场
火山杯大赛
学习中心
社区
去发布
首页
AI 大模型体验中心
动手实验室
Agent 评测集
AI 案例广场
学习中心
社区
lucas
文章
专栏
问答
lucas
把表格压成 64 个 token,长文档问答反而更准了:先找表,再看数
AI生态
AI生态
技术解析
行业趋势
💡 一句话总结:把文档里的表格渲染成图、压缩到 64 个视觉 token,模型读不出具体数字,却还能准确判断"哪张表和问题相关"——爱丁堡大学团队据此设计了两段式问答:先用压缩图找表,再对找出的表做原生分辨率推理,长文档上省 41% token、准确率反涨 7 个点。做文档 QA / RAG 的人值得花十分钟读完。 \先问一个可能戳到你的问题:你的文档问答 pipeline 接了一份 100
3
0
0
0
lucas
把 8300 万个报纸版面单元变成可查询对象
AI生态
行业趋势
技术解析
AI生态
💡 一句话总结:这条管线把历史报纸从“页图加 OCR 噪声”改成 crop 级结构化数据;每个 crop 挂着文本、类型、语言、实体、主题、顺序和向量,研究者可以过滤、重建和审计。 \历史报纸大概是文档处理里最难啃的版面之一:新闻、广告、标题、图像、漫画和 masthead 混在一页;栏目不规则,纸张破损,字号小,语言多样。如果直接做页级 OCR,常见结果不是“读错几个字”,而是栏目串读。广告
1
0
0
0
lucas
ArmorOCR:模型读出了隐藏文字,但它知道自己在读哪里吗?
AI生态
技术解析
行业趋势
Agent
💡 一句话总结:ArmorOCR 把对抗 OCR 从“能不能读出文字”升级为“能不能定位正确区域、读出内容并回答区域级问题”;两阶段训练把 8B 模型的 AdvSpot accuracy 从 31.2 拉到 55.7,但离解决还很远。 \你把一张网页截图、AI 生成图或验证码式图片交给多模态模型,它输出了一段看似正确的隐藏文本。你是直接信,还是想追问一句:你说的到底是图里哪个区域?这不是抬杠。
2
0
0
0
lucas
35 种开源文档抽取配置,只有 4 个跨过 F1 0.5
AI生态
AI生态
技术解析
Agent
💡 一句话总结:在真实公共部门成绩单上,开源零样本结构化抽取远未到可自动化水平;决定成败的不只是模型大小,OCR 是否保留行分组和表格结构同样关键。 \做文档抽取原型时,表格通常很配合:PDF 清晰、列名规整、每行课程、成绩和学分都乖乖待在自己的单元格里。真实申请材料不是这样。同一批成绩单来自不同学校,混合标题、校徽、自由文本、非统一表格、多语言记录和不同成绩制式。你要输出的不是一个答案,而是
61
0
0
0
lucas
DocClaw:让文档 Agent 记住自己刚刚读过哪里
AI生态
AI生态
技术解析
Agent
💡 一句话总结:DocClaw 的贡献不是发明新 backbone,而是把文档任务差异放到技能层、把可复用知识放到状态层、把感知动作放到工具层;技能提升质量,状态降低重复计算。 \想象一个很常见的文档智能工作台:用户先问“这页写了什么”,接着问“第三页的合同金额是多少”,然后又要求抽发票号、付款条件和供应商字段。很多系统会把这三件事当成三个任务:OCR 跑一遍,DocQA 再跑一遍,KIE 又
10
0
0
0
lucas
OmniHandwritingOCR:别让多模态大模型把手写公式读成幻觉
AI生态
AI生态
行业趋势
技术解析
💡 一句话总结:OmniHandwritingOCR 用 77,572 个图像-标签对、6 个子任务和 12 个子集把手写 OCR 从“总分游戏”变成失败模式诊断;它最刺眼的发现是,多行公式一难,最强模型的字符错误也会失控。 \先问一个可能戳到你的问题:你把手写作业拍照丢给多模态大模型,它输出了一段流畅 LaTeX,你敢直接进题库、判分系统或知识库吗?做文档智能的人大概都经历过这种时刻:单行文
5
0
0
0
lucas
DocMemo:让长文档 RAG 学会带记忆地翻页
AI生态
AI解决方案
AI生态
技术解析
💡 一句话总结:DocMemo 把长文档检索从“先选一批页再硬答”改成“读、记、更新置信度、再找”的循环;如果你做的是 RAG、文档 Agent 或多模态文档理解,这篇最值得拿走的不是分数,而是把检索状态显式建模的工程思路。 \先问一个可能戳到你的问题:你那个长文档问答系统,第一次检索错页之后,还有机会自己纠正吗?很多做文档 RAG 的人大概都见过这一幕:问题明明在第 38 页的表格和第 52
14
0
0
0
lucas
83.85% vs 17.91%:FormStruct-Bench 揭开表单解析的错觉
AI生态
AI解决方案
行业趋势
技术解析
💡 一句话总结:FormStruct-Bench 把表单解析从“字段抽取对了几个”推进到“结构到底坏在哪一层”;它测出最强内容分数可达 83.85%,但最佳主结构指标只有 17.91%。如果你做文档 AI、RAG 前置解析或流程自动化,这篇很值得读。 \先问一个可能戳到你的问题:你那个表单解析 pipeline,真的知道每个值属于哪里吗?做文档抽取的人多半见过这种场面:模型把 “Bob”“Ma
7
0
0
0
lucas
DEC:别急着重训,先让表格解析器再检查一遍
AI生态
人工智能
人工智能与算法
💡 一句话总结:这篇论文把“公开基准高分但真实复杂表格仍翻车”的问题拆开诊断,再用 DEC 在不重训解析器的前提下做拆表、增强、修正和回滚;它不是万能 OCR 升级,但给冻结模型和闭源解析器提供了一条很工程化的补丁路线。 \先问一个可能戳到你的问题:你的文档抽取 pipeline 里,最怕的是 PDF 没文字,还是表格明明在眼前,模型却把第三列接到了第五行?做 RAG、财报抽取、合同结构化、报
8
0
0
0
lucas
喂张白纸也能吐出证件号?文档 MLLM 的"关系级泄露"被测出来了
AI生态
AI解决方案
技术解析
行业趋势
💡 一句话总结:文档 MLLM 在看不清图的时候会靠"背下来的字段关系"成组吐出敏感信息,这篇 ACM MM 2026 论文量化了这个风险(最坏 95.5% 泄露率)并给出遗忘方案 DRUF——如果你的业务里有证件识别、表单抽取这条链路,建议花十分钟了解一下。 \先问一个可能让你后背发凉的问题:把你家文档抽取模型拿过来,喂一张空白图或者一张无关的风景照,再问一句"这份证件的信息是什么"——它会
1
0
0
0
lucas
1.2B 小模型赢过 235B 大模型:NaviDC-OCR 把文档解析卷明白了
AI生态
Agent
技术解析
AI生态
💡 一句话总结:NaviDC-OCR 证明了在文档解析这条赛道上,"针对性的数据工程 + 训练配方"比堆参数量管用——1.2B 模型四大基准全第一,还顺手赢了一堆几十倍大的通用大模型;做 RAG、OCR、文档智能的人值得读它的方法部分。 \你的 RAG 系统里塞进去一份 PDF,检索质量还行。然后用户传了张手机拍的合同照片——页面有点弯、有阴影、表格被透视压扁——chunk 切出来一片狼藉,检
1
0
0
0
lucas
AutoDesign:让 Agent 自己改自己的 harness,40 分钟把论文变成会议海报
AI生态
AIGC
Agent
Prompt
💡 一句话总结:AutoDesign 把「围绕模型的那套系统」(prompt、工具、流程)变成可被 Agent 自动优化的对象——外层循环改系统、内层循环出作品,模型权重一动不动。落在论文转海报任务上,它超了商业系统 Claude Design 7.45 分。做 Agent 开发的人,这篇的「怎么让系统自己进化」可以直接抄作业。 \先问一个可能戳到你的问题:过去一年里,你有多少个晚上是在改 s
1
0
0
0
lucas
视频生成得很真,机器人却抓了个寂寞:DreamX-Phi 的几何药方
AI生态
AI生态
行业趋势
人工智能
💡 一句话总结:DreamX-Phi 1.0 用"把每条手臂的 3D 运动轨迹直接钉进注意力机制"的几何化方式,解决视频世界模型"画面很真、动作不听"的老毛病,拿下 WorldArena 2.0 视频预测赛道第一——做世界模型、具身智能或视频生成的人都该看看这个思路。 \如果你玩过或做过视频世界模型(world model,一种"给定当前画面和你的输入,预测接下来会发生什么"的生成模型),下面
1
0
0
0
lucas
Grok 4.6:追平 GPT-5.6 Sol 的半价旗舰,但别只看跑分
AI生态
AI生态
行业趋势
Agent
💡 一句话总结:Grok 4.6 在智能指数上追平了 GPT-5.6 Sol(都 61 分),token 价格只有一半——但真正让人意外的是它的回合效率(完成 Agent 任务只要 Claude Opus 5 一半的步骤),而真正让人犹豫的是 200K+ 翻倍定价规则和 Grok 品牌一长串治理黑历史。 \8 月 12 日是个疯狂的日子。DeepSeek V4-Pro 正式 GA,阿里首个开源
1
0
0
0
lucas
DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说
AI生态
AI生态
deepseek
Agent
💡 一句话总结:DeepSeek V4-Pro 旗舰模型今天正式 GA,Agent 能力据报暴涨(DeepSWE 从 12.8 飙到 62.7),价格比 Claude Fable 5 便宜约 46 倍——但所有跑分都是 DeepSeek 自己发的,还没有任何第三方验证过。便宜是真的,强不强得再等等。 \如果你是一个天天挂着 Claude Code 或者 GPT 写代码的人,最近几个月大概率有过
1
0
0
0
lucas
给检测器插 LoRA,'插对地方'比'插什么'更要命
AI生态
AI解决方案
技术解析
AI生态
要理解为什么会"静默翻车",得先看看现代检测器长什么样。大语言模型基本上是一摞结构几乎相同的 Transformer 层——每一层都是注意力 + MLP,参数化的方式高度一致。所以你在任意一层插 LoRA,行为都是可预测的,这就是 HuggingFace PEFT 这类通用库"按模块名匹配就能用"的底气。但实时检测器完全是另一回事。一个现代检测器是个异构算子的大杂烩:普通 dense 卷积(可以用
1
0
0
0
lucas
延迟只多 0.8 毫秒,检索质量涨 2.92%:抖音 DME 怎么让多模态检索又快又准
AI生态
AI解决方案
AI生态
技术解析
💡 一句话总结:抖音搜索团队提出 DME,用"隐式 latent reasoning + 跨条件重建"两个训练期机制,让多模态嵌入在不增加推理延迟的前提下既快又准,还提出 acc@K 指标证明嵌入向量能解码回文本。 \做过多模态检索的朋友,大概率都撞过同一堵墙。你用对比学习(contrastive learning)训了个 bi-encoder——就是 query 和文档各自编码成一个向量,算
1
0
0
0
lucas
Muse Glimmer 30B:Meta 难得给的真开源,强在哪、虚在哪
AI生态
AI解决方案
AI生态
技术解析
💡 一句话总结:Meta 用 Apache 2.0 放了一个 30B、单卡能跑、冲着本地 agent 去的模型——官方跑分漂亮、生态一天内就跟上,但蒸馏来源不透明、跑分有人怀疑、安全对齐已有翻车报告,值不值得下手得看你是哪类用户。 \玩本地大模型的人这几年大多有个同感:30B 这个段位(够聪明、又不至于让消费级显卡哭)能选的就那几个——Qwen 系强是强,思考起来 token 哗哗地烧,半天等
1
0
0
0
lucas
Q-CueGraph:你的多模态大模型会 zoom,但真的知道该看哪儿吗?
AI生态
算法
大模型
AIGC
💡 一句话总结:Q-CueGraph 把多模态大模型"看哪里"的决策拎出来,做成一个独立、可审计的坐标级策略,在冻结的 Qwen2.5-VL 上用 19% 的画面帮 V*Bench 准确率从 0.696 拉到 0.833——但别急着当 SOTA 读,它真正的价值是一份"什么时候该让模型 zoom"的清醒账。 \先问一个可能戳到你的问题:你给多模态大模型喂了一张 4K 大图——一份密密麻麻的发票
4
0
0
0
lucas
Prompt-Region Grounding:为什么把题目画进图片,多模态大模型就集体"不会做题"了
AI生态
AI生态
大模型
人工智能
💡 一句话总结:把题目从文本挪进图片,主流多模态大模型几乎全军覆没(24 个组合全掉分,平均 17.8 分),而它们常常能正确"读"出题目却不照它作答——这篇论文用一套干净的控制实验证明"读视觉文本"和"把它当任务指令用"是两种能力,并给了一个 region 级训练法把这道鸿沟缩小,推理还不用 OCR。你有没有过这种经历:让大模型看一张图——工单截图、学生拍的试卷、一张报表——它明明把图里的文字
7
0
0
0