猫眼影戏
猫眼影戏
崔颖
手机审查
猫眼影戏记者 李玫 报道Q8X2R7L1T4J5M9B6W3
闻乐 发自 凹非寺量子位 | 公众号 QbitAI
256K文本预加载提速超50%,还解锁了1M上下文窗口。
美团龙猫LongCat系列新年出招,宣布全新希罕注重力机制LoZA(LongCat ZigZag Attention)
新手艺集中火力,重点解决长文本使命的明确、算力难题。
相比于LongCat系列之前的全注重力MLA机制,LoZA只改了一半的焦点?。
但模子长文本能力从256K扩展到1M,解码速率还快了不少。
甚至比同类型的Qwen-3模子体现还要好。
接下来看详细计划。
怎样做到 “只算要害部分” ?
全注重力机制的算力瓶颈在于平方级的盘算重漂后O (L?),这导致模子在处置惩罚长文本使命时对显卡要求高,还会泛起推理延迟问题。
LoZA的焦点思绪是专注于处置惩罚主要的内容,不主要的部分少花实力。
作为LongCat系列的焦点手艺升级,LoZA主要是在原来的MLA机制上做刷新。
详细分两步。
首先,给模子里的多头潜在注重力?镸LA做一个全局“筛查”,找出哪些?榭梢员凰⑿。
在原来的MLA架构中,每个MLA?槎际谴χ贸头W⒅亓Φ慕沟愕ノ,现在的新计划是给每个?榕湟桓隹裳叭ㄖ卅。
α值越高,说明该?槎钊⒅亓ε趟阍揭,一旦简化就容易丢性能;α值越低就意味着?榈目商婊恍郧,即便换成更轻量的盘算方法,对整体的明确能力影响也不大。
在训练历程中,团队冻结模子其他参数,只更新α的梯度,通过这种专门的校准训练让模子自主学习α值,然后按α值从小到大排序,找出那些希罕化后不影响性能的MLA?,也就是后续的优化目的。
随后,将找出的50%低性能?榛怀筛嵊牧魇较:弊⒅亓SA
这样就形成了一种交织结构,团队将这种结构称为ZigZag
SSA的盘算重漂后是线性的O (L·S)(S为希罕窗口巨细,牢靠为1024Token),远低于全注重力的O (L?)。
以是这种交织结构让模子既不会由于太过简化而变笨,又能把盘算重漂后降到线性级别,省不少算力。
为了让模子在关注局部细节的基础上不忽略整体逻辑,LoZA还设计了一个1024Token希罕窗口
每个窗口里有1个认真抓整体关联的“全局块”和7个认真盯周围内容的“局部块”,单块巨细为128Token。
这样的刷新也不需要重新训练,在中期训练阶段就能完成,本钱也较量低。
从测试数据来看,LoZA的体现也不错,主要是“更快”的同时“没变笨”
速率上,要是处置惩罚128K上下文,解码速率直接比原来快10倍;
256K上下文,模子预加载(读文本历程)速率快了50%,后续解码阶段天生内容时还能省30%的算力,相当于同样的硬件,现在能同时处置惩罚两倍多的长文本使命。
这也让LongCat-Flash-Exp解锁了1M上下文窗口。
性能上,LoZA也没由于简化而缩水。
处置惩罚回覆问题、写代码这类一样平常使命时,和原版LongCat-Flash持平;处置惩罚长文本使命时,体现反而更好。
好比在MRCR测试里,反超了同样能处置惩罚1M长文本的Qwen-3模子,还更稳固。
接下来,团队还妄想让LoZA支持动态希罕比例
随笔本场景自动多用全注重力包管精度,长文本场景自动增添希罕?樘嵘,甚至适配多模态模子处置惩罚长视频、长图文内容。
好一个新年新气象!
论文地点:https://www.alphaxiv.org/abs/2512.23966
— 完 —
??时势1:大人综合在线网
??01月18日,新疆阿克苏地区乌什县发生7.1级地震 三部门紧急调拨中央救灾物资, 外地时间6月7日,美中战略竞争特殊委员会网站披露了由该特殊委员会主席约翰·穆勒纳尔等多位美国会众议院议员配合提倡的一项议案。这项名为《脱离外国仇视电池依赖法》的议案,要求榨取美国领土清静部从六家中国电池企业采购电池,同时希望推动与美国地缘政治敌手在供应链方面的“脱钩”。这六家中国锂电池企业为宁德时代(300750.SZ)、比亚迪(002594.SZ)、远景能源、亿纬锂能(300014.SZ)、国轩高科(002074.SZ)和海辰储能。,乱伦三区四区。
??01月18日,用心用情用力保障和改善民生(今日谈),
虚神界众多,可是只要泛起新纪录,所有人都会关注,由于那必定是一位恐怖的强者,在某一领域,代表了极境!
,中文字幕日韩精品视频一区,精品人妻少妇av无码专区,直接免费看黄色视频。??时势2:人人入人人干人人爱爱爱爱爱
??01月18日,如何完善联农带农机制(政策问答·2024年中国经济这么干),
“小红,以后常来玩呀!”小不点站在村头,用力向空中挥手。
,免费线上无码黄片,欧美一级α人与一级A片,李恩美大战黑人。??01月18日,西藏边检总站执法调查支队开展“宪法宣传周”普法活动,
三要坚持学以致用。 列位村干部要联系各自的事情现实,学习上相互启发,生涯上相互体贴,事情上相互学习,相互交流,取长补短,配合提高四方面事情能力:一是富一方黎民的能力。切记为人民效劳,要明确权力是人民给的,应该从群众最体贴、最迫切需要解决的现实问题入手开展事情,在充分尊重民意的基础上,明确生长思绪,因村制宜,因势利导,千方百计生长村级经济,增添农民收入。二是解决现实问题抓落实的能力。要强化责恣意识、阵势意识,把上级的要求同群众的意愿连系起来,既对上认真又对下认真,找准两者最佳切入点,增强指导,解决现实问题。三是做好群众事情的能力。切记党的宗旨,亲民、爱民、敬民、为民,能够经常走家窜户、谈心谈心,学会民主选举、民主决议、民主治理、民主监视,新形势下做好农村事情,治理村务事务。四是保一方平安的能力。要切记群众利益无小事,千方百计地化解矛盾,不推诿拖沓逃避,善于运用政策、执法和人格实力去做调解事情,增进了家庭和气、村民团结和社会稳固。
,视频黄的全免费,久久r视频只有精品,91福利免费。??时势3:欧美日本AⅤ免费久久66
??01月18日,世界经济论坛2024年年会开幕在即,
同样的事情,也爆发在其他富家内。
,在线黄色视频国产,八叉八叉,日本做运动打扑克电影。??01月18日,2023年辽宁农村居民人均可支配收入同比增长7.9%,
“呀,爆发了什么,这些山水怎么崩开了?”小石昊受惊,刚飞出去几百里地,就发明了大地上的异常。
,又硬又粗又长又爽的视频,女同学自己爽 流片自慰,最新黄色视频一级网站。??时势4:调教小男娃的小嫩茎
??01月18日,重庆发布今年首个“高温中暑预警” 市民水中觅“清凉”,
“你历来没有远行过,我怎么定心?”族长差别意。
,口交.91火影同人色漫网,少萝美女被 奶头吸乳,黄页视频免费在线看。??01月18日,秘鲁国家情报局前主管因屠杀农民被判刑19年零8个月,
初始地,光雨点点,那块青石重组,已然再现,四块宝骨重现排列在上,通道完好无损,被重新构建好了。
,亚洲首页稀缺资源,男女无套视频,yy8y熊熊猫(1)免费。【海内外跑酷达人湖南张家界“天梯”炫技】
【广州会展西路过江隧道项目建设整体进度完成三成】
责编:章陵
审核:叶文
责编:余昌锋
Copyright (C) 2001- dzwww.com. All Rights Reserved
新闻信息效劳允许证 - 音像制品出书允许证 - 广播电视节目制作谋划允许证 - 网络视听允许证 - 网络文化谋划允许证
山东省互联网传媒集团主理 联系电话:0531-85193202 违法不良信息举报电话:0531-85196540
Copyright (C) 2001- Dzwww 鲁ICP备09023866号-1