关闭
范文网_范文鱼
您当前的位置:首页 > 职场资讯 > 人才网站

DeepSeek开源新模型!单张A100日处理可超20万页数据

来源:乐安人才网 时间:2026-03-06 作者:人才网 浏览量:
DeepSeek又发新模子了,此次是一个OCR 模子。10月20日,DeepSeek在Github开源了这一新模子,并公布《DeepSeek-OCR:Contexts Optical Compression》(《DeepSeek OCR:高低文光学紧缩》)论文,表明了这一功效。

论文提到,以后的大说话模子在处置进程中面对侧重大的计较挑衅,文本内容太长,是以团队摸索了一种具有潜力的办理计划:操纵视觉模态作为文本消息的高效紧缩介质。详细来讲,这一OCR模子能够将文本紧缩成视觉模态,所谓“一图胜千言”,如许能够耗费更少的Token,测试表现,经过文本到图象的办法能够完成近 10 倍无益高低文紧缩,OCR 精确率还能坚持在 97% 以上。论文提到,在实践利用中,单张A100-40G显卡,可撑持逐日20万页以上的大说话模子/视觉说话模子锻炼数据天生。复杂来看,团队的思绪是,既然一张图就可以包括少量笔墨消息,同时用的 Token 更少,那便可以将文本转成图象,这就是标题中提到的“光学紧缩”,用视觉模态紧缩文本消息。这一成果表现出该办法在长高低文紧缩和大模子的回忆忘记机制等研讨标的目的上具有相称潜力。DeepSeek-OCR由两个焦点组件构成,此中DeepEncoder(编码器)担任图象特点提取和紧缩,DeepSeek3B-MoE(解码器)担任从紧缩后的视觉 Token 中重修文本。解码器用的是 DeepSeek-3B-MoE 架构。固然只要 3B 参数,但采纳了 MoE(混淆专家)计划,64 个专家中激活 6 个,再加 2 个同享专家,实践激活参数约 5.7 亿。这也让模子既有 30 亿参数模子的表达本领,又坚持了5亿参数模子的推理服从。尝试数据表现,当文本 token 数目在视觉 token 的 10 倍之内(即紧缩率小于10倍)时,模子的解码(OCR)精度可达 97%;即便在紧缩率到达 20倍的环境下,OCR 精确率仍坚持在约60%。DeepSeek 团队在论文里还提出了具有设想力的将来——用光学紧缩模仿人类的忘记机制。人类的回忆会随工夫阑珊,越长远的事变记得越含糊,那能否AI也能如许?因而,团队计划将更长远的高低文,渐渐减少衬着图象的巨细,以进一步淘汰token耗费。跟着图象愈来愈小,内容也愈来愈含糊,终极到达“文本忘记”的结果,就像人类回忆的阑珊曲线一样。论文中提到,这仍是个必要进一步伐查的初期研讨标的目的,但这对均衡实际上无穷的高低文消息是一个很好的办法,假如真能完成,对处置超长高低文将是个宏大冲破。是以,此次公布的DeepSeek-OCR 表象上是个 OCR 模子,但从另外一个角度来看,其研讨代表了一个有远景的新标的目的。有网友以为,这是一步好棋,人类就是浏览视觉笔墨,同时了解物理天下的时空观点,假如能同一说话和视觉,大概通向超等智能。这一OCR模子公布不久就在GitHub得到超越1400颗星星。从论文签名来看,这一项目由 DeepSeek 三位研讨员 Haoran Wei、Yaofeng Sun、Yukun Li 配合完成。行业动静表现,此中一作 Haoran Wei 曾在阶跃星斗工作过,曾主导开辟了旨在完成“第二代 OCR”的 GOT-OCR2.0 零碎,是以由其主导 DeepSeek 的 OCR 项目也在道理当中。不外,DeepSeek迟迟不发R2如许的新模子,市场曾经有一些声响以为其掉队了,也有概念以为,DeepSeek今朝只是在修炼“内功劳”,为下一代模子蓄力。文章根源:第一财经
微信扫一扫分享资讯
分享到:
友情链接: 南昌人才网 抚州人才网 赣州人才网 吉安人才网 景德镇人才网 九江人才网 萍乡人才网 上饶人才网 新余人才网 宜春人才网 临川人才网 南城人才网 黎川人才网 南丰人才网 崇仁人才网 乐安人才网 宜黄人才网 金溪人才网 资溪人才网 东乡人才网
微信公众号
APP下载

2025 ©Copyright 100kp.com 快聘网 版权所有 警惕虚假招聘,避免上当受骗! 闽ICP备2024078201号-3

地址:上海徐汇区四平路真和大厦16A座 人力资源服务许可证:人服证字[2026]第0107019656号 EMAIL:Bmren@126.com

微信扫一扫



『 公众号 』



『 小程序 』