论坛首页    职业区    学术与写作    工程技术区    软件区    资料区    商务合作区    社区办公室
 您好! 欢迎 登录注册 最新帖子 邀请注册 活动聚焦 统计排行 社区服务 帮助
 
  • 帖子
  • 日志
  • 用户
  • 版块
  • 群组
帖子
  • 111阅读
  • 14回复

[热点探讨]常用模型有哪些? [复制链接]

上一主题 下一主题
离线cdddd

发帖
62034
土币
434393
威望
5192
原创币
0
只看该作者 12楼 发表于: 前天 14:46
分布式训练集群 6L@g]f|Y@  
分布式训练集群就是把多台装有GPU等计算加速设备的服务器连起来,共同训练一个大规模模型的算力系统。 kQlXcR  
它要解决的核 心问题很简单:大模型参数动辄千亿甚至万亿,单台机器根本装不下、也跑不动,所以要把训练任务拆开,分给多台机器并行算,再把结果汇总更新模型参数 e"en ma\_  
RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)是一种通过将人类反馈纳入训练过程,为机器提供互动学习方式的技术。 & i|x2; v  
RLHF是什么意思ht tps://baike.baidu.com/item/RLHF/63555805 ;zI;oY#.y  
异构指由不同元素或部分组成、不均匀的性质,英文为 heterogeneous,源自希腊语 heterogenēs。根据剑桥词典与大英百科全书,该词正式含义为"由彼此不同的部分或类型组成"。 T 1m097  
异构数据是指在数据结构、存储格式、访问接口等方面存在差异的数据集合。简单来说,就是"不一样"的数据汇聚在一起形成的集合。 p1t9s N,  
“掩码语言”不是指某一种人类语言,而是一种让AI模型通过“填空”来学习语言的技术,通常就叫掩码语言模型(MLM)。简单说,就是随机把句子里的部分词遮住,让模型根据上下文猜出被遮住的词是什么。 Z[8{V  
MLM是Multi-Level Marketing的缩写,中文称为“多层次营销”或“多层次信息网络营销”。在中文语境、特别是在网络及相关监管讨论中,MLM模式常特指一种以网站为载体 "El$Sat`  
“掩码”的英文是 mask,在计算机领域通常指用来按位屏蔽或筛选数据的一串二进制代码。 pKO\tkMJ  
日常语境下,mask 本身是“面具、口罩、掩饰”的意思;在计算机里它专指通过“位与”等运算,从数据里提取或屏蔽特定部分 $x;wnXXXM  
文本概率分布,简单说就是:在自然语言处理中,用概率来描述“哪些词、哪些句子更可能出现”的统计规律。它回答的核 心问题是“下一个词(或某个语言单位)出现的可能性有多大”。 *,1^{mb  
“分类标签”这个词,要看在什么场景下用,一般有两种理解: cad1eOT'  
一种是把“分类”和“标签”当成两个不同的东西。 这是最常见的情况,尤其在网站、App或内容管理里。简单说: #p~tkQ:'1  
分类:是给内容划的大类,像书架上的格子。它从上到下建立,结构固定,一篇文章通常只属于一个分类。比如“科技”、“美食”、“体育”就是分类。 )_!t9gn*wr  
标签:是给内容贴的精细关键词,像便利贴。它从下到上产生,更自由灵活,一篇文章可以同时贴好几个标签。比如一篇讲“手机拍照”的文章,可以贴上“手机”、“摄影”、“测评”这些标签。 +) 2c\1  
所以分类决定内容放在哪,标签决定内容能被哪些关键词搜到。一个帮你搭框架,一个帮你做细节索引。 Qz&I~7aoyV  
另一种是“标签分类”连在一起,指给标签本身分个类。 比如有些系统会把“地域”、“人群”、“场景”作为不同的标签维度,每个维度下再设具体标签,这种对标签的管理方式也叫标签分类。 * bmdY=#7  
唯一键对应唯一值的数据结构 ;;BQuG  
键值对是编程中一种基础的数据结构,由唯一的“键”和对应的“值”组成,用来实现快速查找 。简单说,键就像字典里的索引,值就是具体的内容 。 GIQ/gM?Pv  
键(Key):必须唯一,不能重复,用来标识数据 。 i}Ea>bi{N  
值(Value):可以重复,存储实际的数据信息 。 ji {V#  
关系:通过键能唯一找到对应的值,类似“姓名”对应“电话号码” 。 %)_R>.>  
这种结构广泛应用于字典、缓存系统(如 Redis)以及 JSON 数据格式中 。 b\~rL,7(  
htt ps://baike.baidu.com/item/%E9%94%AE-%E5%80%BC%E5%AF%B9/14818783 kK!An!9C  
离线cdddd

发帖
62034
土币
434393
威望
5192
原创币
0
只看该作者 13楼 发表于: 前天 14:56
KV Cache上下文管理‌,就是大模型推理时,把已经算好的历史内容(Key和Value向量)缓存起来,避免每次生成新内容都从头重算一遍,从而大幅提速、省算力的技术。‌‌ o?uTL>Zin  
6 )eO%M`  
简单理解:大模型是一个字一个字往外蹦的,每生成一个新字都要参考前面所有内容。没有KV Cache时,每蹦一个字都要把前面整段重新算一遍,字越多计算量爆炸式增长;有了它,前面算好的结果直接存进显存,后面只算新字,直接读旧结果。 这就像写作文提前记好前文要点,不用每次重读全文。‌‌ '3=[xVnv  
5}gcJjz  
KV Cache的显存占用会随上下文长度线性增长,所以上下文越长,缓存越占显存、越烧钱,这就是“上下文管理”要解决的问题——怎么让这笔缓存又快又省。‌‌ Uxx=$&#  
在深度学习中,Encoder 是编码器,Decoder 是解码器,两者常组成“编码器 - 解码器”架构协同工作
离线cdddd

发帖
62034
土币
434393
威望
5192
原创币
0
只看该作者 14楼 发表于: 前天 20:48
岩土工程常见模型、核 心模型、经典模型有哪些?土友分享一下!
快速回复
限100 字节
温馨提示:欢迎交流讨论,请勿纯表情、纯引用!
 
上一个 下一个

      https://beian.mps.gov.cn/ 粤公网安备 44010602012919号 广州半山岩土网络科技有限公司 粤ICP备2024274469号

      工业和信息化部备案管理系统网站