论坛首页    职业区    学术与写作    工程技术区    软件区    资料区    商务合作区    社区办公室
 您好! 欢迎 登录注册 最新帖子 邀请注册 活动聚焦 统计排行 社区服务 帮助
 
  • 帖子
  • 日志
  • 用户
  • 版块
  • 群组
帖子
  • 72阅读
  • 6回复

[热点探讨]岩土数值与统计 [复制链接]

上一主题 下一主题
在线cdddd
 

发帖
62034
土币
434393
威望
5192
原创币
0
只看楼主 倒序阅读 使用道具 楼主  发表于: 前天 20:47
岩土工程经常遇到数值,怎么根据数值多少?变化?来鉴别是真假!以及有哪些统计方法适用岩土工程!
在线cdddd

发帖
62034
土币
434393
威望
5192
原创币
0
只看该作者 1楼 发表于: 昨天 08:49
岩土勘察中主要土层试样少于6个(2~3个)时,不能直接套用规范中n≥6的T分布统计公式,需采用适配小样本的合规处理方法。 8ZtJvk`  
📋 核 心前提说明 ^q-%#  
《工程勘察通用规范》GB55017-2021明确要求,详细勘察阶段每一主要土层的原状试样或原位测试数据不应少于6组,这是为了bao证参数统计的可靠性,避免小样本偏差。当实际仅能获取2~3个试样时,属于过小样本场景,样本代表性有限,需结合工程经验和补充测试完成数据处理。 $%EX~$=m]-  
u!X~!h-6~  
🔧 2~3个试样的3种主流统计方法 h0F=5| B  
折减系数法(工程最常用) +$C9@CZM9  
先计算所有有效数据的算术平均值,再根据土层均匀性乘以0.85~0.95的折减系数得到标准值: Z_ GGH2u  
%R GZu\p  
当n=3且数据极差大于平均值的30%时,最终取值不得大于样本最小值; ct\msG }b:  
当土层均匀性好、数据离散性小时,折减系数取0.9~0.95;土层不均匀时取0.85~0.9。 =z. hJu  
小值平均法 T@1;Nbz]  
剔除样本中的最大值后,对剩余的2个数据取算术平均值,直接作为参数建议值。该方法天然偏于安全,适合地基承载力、抗剪强度等对工程安全敏感的力学指标。 aE0R{yupZ  
}83 8F&  
多源数据校核法 %{ BV+&  
补充同层位原位测试数据(如标准贯入、静力触探),将室内试验结果与原位测试结果交叉验证,结合邻近场地同层岩土参数的地区经验值,综合确定最终建议值,避免单一样本的偶然性偏差。 .$\-{)  
h1~h& F?  
⚠️ 关键操作注意事项 'Xik2PaO  
异常值剔除:小样本场景下禁止用3σ准则剔除数据,仅能剔除明显因试验操作失误产生的无效值,避免样本量进一步缩减。 S)hDsf.I  
统计成果披露:勘察报告中需明确标注该土层的样本数量、最大值、最小值、平均值,说明小样本取值的依据,提示设计单位结合工程经验复核。 h,\{s_b  
适用边界:该处理方法仅适用于次要建筑、次要土层,对于一级工程、特殊性岩土,应补充取样或原位测试,满足n≥6的规范要求。 Kw-<o!~  
在线cdddd

发帖
62034
土币
434393
威望
5192
原创币
0
只看该作者 2楼 发表于: 昨天 08:55
一、T分布核 心公式(最常用的统计推断形式) -nGcm"'6F  
T分布(也叫学生t分布)最核 心的t统计量公式为: C@a I*+@-"  
𝑡=𝑋ˉ−𝜇𝑆/𝑛t= S/ n Xˉ −μ 其中各参数含义:𝑋ˉXˉ :你抽取的小样本计算出的平均值𝜇μ:你想要推测的总体真实平均值𝑆S:用样本计算出的标准差(代表样本数据的离散程度)𝑛n:样本数量,𝑆/𝑛S/ n 叫做标准误,代表样本均值的波动大小这个t值服从自由度𝑑𝑓=𝑛−1df=n−1的t分布。二、通俗理解:T分布是“小样本下的bao守版正态分布”你可以把它理解为:当你手里数据很少、又不知道整体数据的真实波动有多大时,用来“不盲目自信”做推断的工具,核 心逻辑可以用3句话讲清:解决的痛点:如果样本量很大(n≥30)、或者你知道整体数据的真实标准差,用正态分布(Z分布)推断就很准;但现实中往往只能拿到几个、十几个小样本,也不知道整体的真实波动,这时候用正态分布会过度自信,容易得出错误结论。厚尾的意义:T分布比标准正态分布“尾巴更厚”,意思是它承认“小样本算出来的标准差不准,可能低估了真实波动”,所以把极端情况的概率算得更高,相当于给推断结果留了更大的安全余量,不会因为几个样本的偶然偏差就草率下结论。自由度的规律:自由度𝑑𝑓=𝑛−1df=n−1,样本量越小,自由度越低,T分布的尾巴越厚,推断越bao守;当样本量越来越大(n→∞),T分布会完全和标准正态分布重合,这时候就不需要“bao守余量”了。三、结合岩土勘察场景举例(和你之前的问题对应)假设你在某土层取了3个土样做压缩模量试验,得到3个数值:4.2MPa、4.8MPa、5.1MPa,你想推断这个土层真实的平均压缩模量,给出95%置信度的取值范围:第一步计算样本统计量:样本均值𝑋ˉ=(4.2+4.8+5.1)/3=4.7 MPaXˉ =(4.2+4.8+5.1)/3=4.7 MPa样本标准差𝑆=(4.2−4.7)2+(4.8−4.7)2+(5.1−4.7)23−1≈0.458 MPaS= 3−1(4.2−4.7) 2 +(4.8−4.7) 2 +(5.1−4.7) 2   ≈0.458 MPa标准误𝑆/𝑛=0.458/3≈0.264 MPaS/ n =0.458/ 3 ≈0.264 MPa自由度𝑑𝑓=3−1=2df=3−1=2,查t分布表得95%置信度对应的临界值𝑡0.025,2=4.303t 0.025,2 =4.303(如果用正态分布临界值仅为1.96,明显偏激进)第二步计算置信区间:区间为𝑋ˉ±𝑡𝛼/2,𝑑𝑓×(𝑆/𝑛)=4.7±4.303×0.264Xˉ ±t α/2,df ×(S/ n )=4.7±4.303×0.264,即3.56MPa~5.84MPa。结果解读:因为只有3个样本,T分布给出的区间很宽,相当于提醒你“样本太少,真实均值可能在这个很大的范围里,别太笃定样本算出来的4.7MPa就是真实值”;如果样本量增加到6个,自由度df=5,对应的t临界值会降到2.571,置信区间会明显收窄,推断的可靠性也会提升——这也正好解释了为什么岩土勘察规范要求主要土层取样数不少于6个:样本量足够时,T分布的bao守余量会缩小,参数推断更准确。四、和你之前问的“2~3个试样怎么分析”的关联当样本量只有2~3个时,T分布的临界值会非常大(比如n=2时df=1,95%置信度的t临界值高达12.706),算出来的置信区间宽到几乎没有工程参考价值,这也是为什么规范要求样本量≥6:此时自由度df=5,t临界值2.571,推断结果的精度已经能满足工程设计要求,不会因为样本波动产生过大的偏差。  ?s,oH  
在线cdddd

发帖
62034
土币
434393
威望
5192
原创币
0
只看该作者 3楼 发表于: 昨天 19:46
自由度(degree of freedom, df)指的是计算某一统计量时,取值不受限制的变量个数。通常df=n-k。其中n为样本数量,k为被限制的条件数或变量个数,或计算某一统计量时用到其它独立统计量的个数。自由度通常用于抽样分布中。 jU-LT8y:  
统计自由度通俗来说,就是统计计算里,扣除掉被固定的约束条件后,剩下的能自由随便变的数据个数。 gdIk%m4  
JV_`E_!  
核 心逻辑 %U{6 `m  
它的通用计算规则是 df = n - k: O _9r-Zt^  
) f3A\^  
n 是你手里的总样本数据量 2)IM<rf'^  
k 是你提前固定住的约束条件/要估计的总体参数个数 db 99S   
每多一个被固定的条件,就少1个能自由变动的数据,自由度就减1 。 1gK|n  
几个一看就懂的生活化例子 (Z<@dkO?)  
班级平均分例子  )M;~j  
一个5人班级,已知平均分固定是80分(总分400)。前4个同学的成绩你可以随便填(比如75、85、80、78),但第5个同学的成绩就被唯一锁定成82分,没法自由改了。这里总数据5个,1个约束条件,自由度就是 5-1=4 。 |&K;*g|a  
!SuflGx,q  
零花钱例子 y A5h^I  
你有100元零花钱,被强制要求必须花20元买文具,剩下的钱才能自由支配。这时候能自由花的80元,就相当于这里的“自由度”——总数扣掉被固定的部分,剩下的就是自由空间 。 h; q&B9  
:2j`NyLI.  
3个数字求均值例子 0[UI'2  
已知3个数字的平均值固定是6,前两个数字你可以随便选(比如5和7),但第三个数必须是6才能凑出均值6,完全没法自由变动。这里自由度就是 3-1=2 。 RQ=rB9~:ZN  
g;Ugr8  
结合你之前接触的统计场景 DOyO`TJi  
你之前了解的小样本t分布,样本量n=6时,计算样本方差的自由度是 6-1=5,这也是为什么小样本下用t分布而不是正态分布的核 心原因之一:自由度越小,分布越bao守,更贴合小样本的真实波动情况 。 //NV_^$y  
岩土勘察里样本量少于6个时,自由度会进一步降低,统计推断的不确定性会变大,所以才需要用折减系数等方法来修正结果,bao证工程上的可靠性。 M4Cb(QAVP  
在线cdddd

发帖
62034
土币
434393
威望
5192
原创币
0
只看该作者 4楼 发表于: 昨天 20:01
t分布密度函数详解:公式、图像、性质及应用 i6yA>#^  
h ttps://wenku.baidu.com/view/ad7c4c2ef06527d3240c844769eae009581ba2bd.html? U-DQ?OtmC@  
一、t分布的历史来源 @PM<pEve  
t分布(又称学生t分布)由英国统计学家威廉•希利•戈塞(William Sealy Gosset)于1908年提出。当时戈塞在爱尔兰健力士酿酒厂工作,负责啤酒生产的质量控制:酿酒过程中只能获取小批量样本,无法得知总体的真实标准差,而传统的正态分布(Z检验)仅适用于大样本、总体方差已知的场景,小样本下推断误差极大。由于酒厂禁止员工以个人名义发表论文,戈塞便使用“Student(学生)”作为笔名发表了相关成果,这也是“学生t分布”名称的由来。后续该理论经统计学家罗纳德•费雪完善推广,成为小样本统计推断的核 心工具。 |mMsU,*gB  
二、t分布公式的推导背景与前提 ]s Euh~F  
t分布解决的核 心问题是:当总体服从正态分布、但总体标准差σ未知时,如何基于小样本对总体均值进行可靠的概率推断。 #~p;s>  
五、t分布公式的核 心性质与解读 ;BuMzG:tmZ  
形态特征:t分布是以0为中心、左右对称的单峰分布,比标准正态分布更“平坦”、尾部更厚——这意味着小样本下出现极端值的概率更高,推断结果比正态分布更bao守,恰好反映了用样本标准差估计总体标准差带来的额外不确定性。 cn}15JHdR  
自由度的影响:t分布是一簇曲线,形态由自由度 8(`e\)%l0  
𝜈=𝑛−1ν=n−1决定:自由度越小,尾部越厚、分布越分散;当自由度 XW aa`q  
𝜈→∞ν→∞时,ΓΓ函数的极限性质使得 $'l<2h>4  
𝑓(𝑡)f(t)收敛于标准正态分布的密度函数 YWU@e[  
12𝜋𝑒−𝑡2/22π 1 e −t 2 /2 h GA2.{  
,此时t分布与标准正态分布完全一致,对应大样本下样本标准差s趋近于总体标准差σ的场景。 UG\2wH_  
数字特征:当𝜈>1ν>1时,t分布的期望𝐸(𝑡)=0E(t)=0;当𝜈>2 yr'-;-u  
ν>2时,方差𝐷(𝑡)=𝜈𝜈−2D(t)= ν−2ν @ 95p[  
,始终大于1(标准正态分布方差为1),进一步体现了其更大的离散性。 Xc[ym  
应用场景:基于t分布可以完成小样本下总体均值的置信区间估计、单样本/双样本/配对样本的t检验等统计推断,是实验科学、医学、社会科学等领域小样本数据分析的核 心工具。 0j8fU7~6S  
在线cdddd

发帖
62034
土币
434393
威望
5192
原创币
0
只看该作者 5楼 发表于: 4小时前
一次搞懂卡方检验三大类型:独立性检验、同质性检验、拟合优度检验! g@ J F  
ht tps://www.bilibili.com/video/BV15tHQzrECH/? }Bv1fbD4U  
卡方检验是一种用于分析分类变量的非参数假设检验方法,通过比较观察频数与期望频数的差异,判断变量间是否存在显著关联或数据是否符合理论分布 。  dF `7]  
核 心用途:主要用于拟合优度检验(检验数据分布是否符合理论模型)和独立性检验(判断两个分类变量是否相互独立)。 xD*Zcw(vj~  
计算公式:χ² = Σ[(O-E)²/E],其中 O 为实际观察频数,E 为理论期望频数 。 }V ]*FCpQ  
提出背景:由英国统计学家卡尔•皮尔逊(Karl Pearson)于 1900 年首次发表,是统计学中最常用的非参数检验之一 。 ="]lN  
拟合优度检验是一种统计方法,用来判断实际观测到的数据分布,是否与某种理论分布或模型预测相符 。简单说,就是检验“数据长得像不像理论上应该的样子”。 L4^/O29  
非参数检验是一类不依赖总体分布假设的统计检验方法,主要用于在总体分布未知或数据不满足参数检验条件时进行推断 。它不对总体参数(如均值、方差)直接进行估计,而是通过样本的秩次、排序等简单操作来检验总体分布的位置或形状差异 。 |8E~C~d  
独立性检验是统计学中用来判断两个分类变量是否相互独立的一种假设检验方法,它属于卡方检验的一种 。简单来说,就是通过数据分析来判断“两个因素之间有没有关系”。 }Rz,}^B  
适用条件:适用于分类数据(定类或定序变量),不要求数据服从正态分布,样本量需满足理论频数要求 rOOo42Y W`  
同质性检验是统计学中用于判断多个样本或总体是否具有相同分布或属性的检验方法 。简单来说,就是看几组数据是不是“同质”的,能不能合并分析 。 G9Xkim Q'  
通常指拟合优度 ]]y>d!  
“优度”在日常口语中很少单独使用,通常指统计学中的“拟合优度”,用于衡量模型对数据的拟合程度。 od#Lad@p  
核 心含义:表示样本数据点聚集在回归线周围的密集程度,数值越高说明模型拟合得越好 。 MR|A_e^x  
常见指标:常用决定系数 𝑅2R 2 XOX$uLm  
  来表示,取值在 0 到 1 之间,越接近 1 代表解释能力越强 。 t,LK92?  
应用场景:主要出现在回归分析、机器学习模型评估中,用来判断预测结果是否可靠 。 y9mV6.r  
在线cdddd

发帖
62034
土币
434393
威望
5192
原创币
0
只看该作者 6楼 发表于: 2小时前
htt ps://zhidao.baidu.com/question/1780186950125005420.html iZk4KX  
一、先讲最通俗的核 心理解 uPl7u 1c  
你可以把这两个概念直接对应生活里的场景: Mx w-f4j  
m> +  
排序:就是给一堆数据“排队”的动作,按照指定规则(通常是从小到大,也可以根据需求从大到小)把杂乱的数据排成有序的序列,就像考试后把全班成绩从低到高捋顺、奶茶店按顾客到店先后排号。 Qe F:s|[  
秩次:就是排完队之后,每个数据拿到的“排队号”,本质就是它的排名。和普通排名唯一的区别是:如果遇到数值一样的数据(并列名次),秩次会取它们本该占的名次的平均值,bao证所有秩次加起来的总和是固定的。 1D[V{)#  
二、举个生活化的例子一看就懂 F3V:B.C  
假设你统计了6位同学的数学测验成绩,原始数据是:72分、85分、60分、85分、93分、78分 'bRf>=  
 }c||$  
第一步:先做排序 I]n X6=j5  
我们按成绩从低到高给这6个分数排队,排完的有序序列是: mNC?kp  
60分 → 72分 → 78分 → 85分 → 85分 → 93分 a;dWM(;Kw  
这个“把乱序数据排成有序序列”的过程,就是排序。 @5&57R3>  
1q;R+65  
第二步:给每个数据分配秩次(排队号) 2Bi]t%<{  
先给不重复的数分配名次: (~Bm\Jn  
60分排第1位,秩次=1 X"3p/!W.4  
72分排第2位,秩次=2 1<~n2}   
78分排第3位,秩次=3 Q}Ah{H0C  
93分排第6位,秩次=6 <mP_K^9c  
处理并列的重复值: +o3n%( ^~  
两个85分本来应该占第4、第5两个名次,按照秩次的规则,并列数据要取所占名次的平均值,也就是 0Gj/yra9MO  
(4+5)/2=4.5 {8mJ<b>VA  
(4+5)/2=4.5,所以两个85分的秩次都是4.5。 j)G%I y[`  
最终每个原始成绩对应的秩次如下表: 6Z1O:Bou  
表格 ,Gy,bcv{  
原始成绩(分)    60    72    78    85    85    93 xY)eU;*  
对应秩次    1    2    3    4.5    4.5    6 EwcFxLa!F  
三、补充两个常见疑问 !.%*Tp#k#  
为什么并列数据要用平均秩次? _S[@?]=`b  
你可以算一下上面所有秩次的和: rmBzLZ}  
1+2+3+4.5+4.5+6=21 7kD?xHpe  
1+2+3+4.5+4.5+6=21,和1到6连续整数的和完全相等。如果给两个85分都编4或者都编5,秩次总和就会变,后续做秩和检验等统计计算时结果就会出错。 47Vt8oyh%  
秩次和普通排名有什么区别? >/Z*\6|Zx#  
生活里的并列排名通常会给相同的名次(比如两个85分都排第4名,下一个93分直接排第6名),但秩次通过取平均值的方式,既bao留了“并列”的信息,又bao证了整体排名序号的数学性质稳定,适合统计计算。 UxMy8} w!y  
什么时候会用到秩次? I!Dx)>E&  
当数据不满足正态分布、或者是“优/良/中/差”这种没有精确数值的等级数据时,我们没法用平均数做比较,就可以用秩次(排名)来代替原始数值做统计分析,比如常用的秩和检验,本质就是比较不同组的“排名总和”,判断组间有没有整体差异——就像比较两个班的成绩排名总和,就能看出哪个班整体成绩更好,不用纠结单个分数的极端值影响。 #&uajo  
快速回复
限100 字节
温馨提示:欢迎交流讨论,请勿纯表情、纯引用!
 
上一个 下一个

      https://beian.mps.gov.cn/ 粤公网安备 44010602012919号 广州半山岩土网络科技有限公司 粤ICP备2024274469号

      工业和信息化部备案管理系统网站