Skip to content
QIAN数据
Main Navigation
首页
全部文章
关于
Return to top
文章档案
全部文章按时间归档 · 可用分类 / 月份 / 关键词筛选,或切到日历视图按日期浏览
全部 72
🛡️ 风控技术 25
🤖 LLM风控 15
📊 数学统计 29
💼 风控职场 3
☰ 列表
▦ 日历
2026年9月
5 篇
21日
月相与经纬度——从"月有阴晴圆缺"到球面天文学,中秋到底该哪天圆?
月相变化是人类最早观测到的天文周期之一。朔望月(Synodic Month)——从一个新月到下一个新月——平均长度为29.53天。
统计
21日
一条风控规则的完整一生——该不该写、怎么管、什么时候该删
(本篇为技术原理型文章,不含任何真实业务数据实验。文中公式为自洽推导,用于说明原理,不构成授信政策建议。)
风控
16日
QIAN数据:门控遗漏定律与设计效应DEFF——定时任务跑了998次只失败4次,就敢说系统可靠吗?
998次定时任务只失败4次、成功率99.6%——但按设计效应折算,有效样本只有约23个。用门控遗漏定律、Clopper-Pearson精确上界与最优验证次数,算清“我测过了”这句话到底值多少证据。
统计
02日
Agent风险评分——12个维度怎么算成一张分数表
Agent风险评分怎么做:12维指标、熵权与CRITIC权重对比、分数校准与阈值定义、PSI漂移监控
LLM
01日
多Agent合谋——当一个AI骗另一个AI时,反欺诈怎么接
多个AI Agent会不会合谋骗过反欺诈?合谋让群体影响率从17%升到41%,附共现矩阵与模块度检测代码
LLM
2026年8月
18 篇
25日
消费贷贴息潮——利率降下来,风险升上去?
消费贷贴息潮:利率降下来风险为什么升上去?逆向选择与风险定价的数学关系
风控
19日
KS 与 AUC——单点 vs 积分,为什么 AUC 相同,KS 能差 40%
KS是单点、AUC是积分:两者存在精确数学关系,AUC相同时KS可能差40%。选模型看AUC,定阈值看KS
风控
18日
交易图上的洗钱迷宫——非法交易抱团到什么程度?36,624 条边的实测答案
Elliptic 实测更正:非法节点的邻居不是「99.8% 全是非法」,均值仅 51.0%(富集 7.36 倍)。同配性真实存在——非法–非法边是随机期望的 5.68 倍,置换检验 p<0.0001;但富集 ≠ 垄断:最大连通分量非法占比 0.86%,反而低于全图 6.92%。
风控
18日
欺诈率0.1%的建模战争——99.9%准确率的模型为什么没用?
欺诈率0.17%时,99.92%准确率只比全部放行多抓0.09个百分点。贝叶斯最优阈值与PR曲线的正确用法
风控
18日
KV-Cache——为什么AI回复越来越快,不用从头算一遍?
KV-Cache是自回归生成"每步从头算"的解药:缓存历史token的K和V矩阵,每步只算新token,计算量从O(T²)降到O(T),长序列推理加速可达百倍。
LLM
18日
RLHF与DPO——大模型是怎么学会说"人话"的?
大语言模型经过预训练和指令微调后,虽然能生成流畅的文本,但仍然存在一个根本问题:模型不知道什么是"好"答案,它只知道什么是"像"训练数据的答案。
LLM
18日
违约时间才是真信号——Cox 生存分析与竞争风险
违约时间才是真信号:Cox比例风险模型与竞争风险,风险比HR怎么算、Aalen-Johansen如何估计
风控
17日
Vintage 分析——批次×账龄:暴露速度、违约高峰与客群分层
Vintage分析怎么做:账龄、生存曲线与风险函数,右删失数据下如何正确比较不同批次的资产质量
风控
16日
概率校准——什么时候是白干,什么时候救命
同一个逻辑回归换个切分方式:随机切分ECE为0.0009天然校准,时间切分0.0904崩溃,错误校准越校越糟
风控
15日
评分卡单调性——WOE 排序与回归系数,谁在说谎
评分卡单调性为什么必须检查:WOE与逻辑回归共线性怎么导致翻转,用SymPy做单调约束求解
风控
13日
策略规则里的死分支——阈值设得再严,客户根本不存在
规则引擎里的死分支:实测226万笔贷款,证明有些规则从上线起就永远不可能命中,附区间代数检测法
风控
12日
风控策略规则的代理变量冗余——九条规则三个维度,最优只需三条
两条策略规则看着不同,其实在拦同一批人:代理变量与策略冗余检测,用独有命中找最优组合
风控
11日
全球平均只升了1.2°C,为什么热浪一年比一年猛
平均气温只升1.2度,极端高温为什么涨了近3倍?146年NASA数据揭示均值平移如何放大尾部风险
统计
11日
风控策略规则里的冗余——布尔代数怎么把规则迷宫变简单
风控规则能不能化简?用布尔代数做逻辑等价变换,删掉冗余条件同时不改变判定结果
风控
09日
AI Agent越来越多,但谁来给Agent的风险分类——一个实用治理框架
AI Agent越来越多,谁来管?ARC框架把Agent拆成12个可评分维度,输出三级治理动作
LLM
08日
评分卡地形图——模型眼里的安全平原,现实里的危险山脊
把评分卡画成风险地形图:用PDP部分依赖找模型失准区,交叉变量裂缝与策略落地评估
风控
03日
James-Stein定理——为什么把估计往均值拉一点,整体反而更准
James-Stein定理:同时估计多个参数时向均值收缩,总误差反而更小。50个分组验证改善52.5%
统计
01日
KS下降了,真的是模型出了问题吗——一个反事实诊断框架
KS下降不等于模型退化:四层反事实诊断把KS下滑归因到抽样、构成、协变量与真实漂移,避免误回退
风控
2026年7月
32 篇
20日
L1/L2正则化的数学解读——从Ridge到Lasso的收缩之路
L1与L2正则化怎么防过拟合:Lasso做特征选择、Ridge等比例收缩,含闭式解推导与Lasso路径图
统计
18日
Z-score预警——A股科技股拥挤踩踏的量化信号拆解
科创50六月涨26%七月跌22%:用实时数据拆解拥挤踩踏的形成与崩塌,Z-score信号怎么提前预警
统计
17日
贝叶斯更新——失败只是更新了先验,不是你的终局
1763年,Richard Price在皇家学会宣读了一篇论文。作者已经去世三年了——一个叫Thomas Bayes的英国长老会牧师。
统计
17日
马尔可夫链——过去不决定你,只有现在这一步说了算
1906年,Andrey Markov发了一篇论文,标题平平无奇:《论大数定律的扩展》。
统计
17日
回归均值——跌到谷底之后,数学保证你会回升
1886年,Francis Galton在伦敦发布了一篇论文,标题叫做《遗传身高中均值的回归》。
统计
15日
A/B检验的统计学原理:样本量计算与功效分析
A/B测试是数据科学中最基础也最重要的实验设计方法。无论是互联网产品的界面改版、推荐算法的策略更新、还是营销活动的文案优化,都离不开A/B测试。
统计
15日
ARIMA vs Prophet:时间序列预测方法对比
时间序列预测的核心问题:如何从历史数据中推断未来规律?ARIMA和Prophet代表了两种不同的回答路径,分别根植于统计学和工程学的不同传统。
统计
15日
自由度——统计学里你只剩这么点自由了
我问你一个很简单的问题:三个数的平均数是10。前两个数是8和12,第三个数是多少?
统计
15日
Word2Vec词向量:让机器理解词语的语义
在自然语言处理中,最基础的问题莫过于:如何让计算机理解词语的含义?传统方法使用One-Hot编码将每个词表示为一个高维稀疏向量(向量的维度等于词典大小,该词对应位置为1,其余位置为0)。这种方法有两个致命缺陷:
LLM
15日
指数增长的盲区——e不是什么神秘常数,是你的直觉上限
传说中国际象棋的发明者向国王要报酬:第一个格子放1粒麦子,第二个格子2粒,第三个4粒,每个格子翻一倍,直到64个格子。国王笑了——要几粒麦子而已,给。然后管粮仓的人算了一笔账,脸色变了。
统计
15日
特征工程全指南:从原始数据到建模特征
原始数据到模型之间,有一个关键步骤常被忽视:特征工程。同样的算法,喂不同质量的特征,效果天差地别。好的特征工程能让简单模型碾压复杂模型,而糟糕的特征则会拖垮最先进的算法。
风控
15日
Lasso风控模型:从89个工程特征到11个关键指标
风控建模中有一个经典困境:征信数据商给你200个变量,但大部分是噪声;即使只有20个原始变量,一通特征工程(分箱哑变量、交叉组合、多项式)也能炸出80-100个派生特征。全部塞进模型,过拟合;人工选,可能漏信号。
风控
15日
LDA主题模型:从文本中发现隐藏结构
一篇文档通常由多个主题混合而成。例如一篇新闻报道可能80%讲"科技"、20%讲"商业"。LDA(Latent Dirichlet Allocation,隐含狄利克雷分配)是一种生成式概率模型,
LLM
15日
matplotlib高级绘图:从基础到学术论文级
from sklearn.datasets import load_iris, load_diabetes
统计
15日
缺失值处理的统计学方法——MCAR、MAR、MNAR 与 MICE 多重插补
真实数据中缺失值几乎不可避免:用户未填写问卷、传感器间歇性故障、API调用超时、数据库迁移中的记录丢失。忽视缺失值会导致估计偏误、统计效力下降,甚至得出完全错误的结论。
风控
15日
从零实现多层感知机:反向传播推导
人工神经网络起源于生物神经元的数学抽象。1943年,McCulloch和Pitts提出了M-P模型(McCulloch-Pitts Neuron),它是所有人工神经元模型的鼻祖:
统计
15日
开源数据库存储结构研究报告:从写入落地到 RUM 三角,五条物理约束如何决定选型
但如果把主流开源数据库的存储层拆开,会看到一个不太一样的图景:它们回答的是同一组物理问题,只是答案不同。磁盘一次随机寻道要几毫秒、一页能装多少行、索引能占多少内存——这些量级不因软件品味而变。
统计
15日
最优分箱算法在评分卡中的应用——WOE与IV
在信用评分卡建模中,原始连续变量(如年龄、收入、负债率)不能直接入模,原因在于以下几个方面。
风控
15日
PCA主成分分析:从高维到低维的数学地图
当数据有几十、几百个特征时,可视化困难、模型容易过拟合、计算成本高。PCA(Principal Component Analysis)通过线性变换将高维数据映射到低维,同时最大化保留数据的方差(信息量)。
统计
15日
数据不会骗人,但分组会——辛普森悖论
1973年,加州大学伯克利分校被起诉了。原因是那年的研究生录取数据显示了一个醒目的差异:
统计
15日
STL时间序列分解:从趋势到季节性的全拆解
时间序列的底层逻辑由三种不可观测的隐变量叠加而成。这三种成分各自捕捉数据中不同时间尺度的模式,是理解一切时序分析方法的基础。
统计
15日
Tokenization详解:从分词到大模型的语言基础
人类理解语言,是从「字→词→句→段→篇」逐层构建的。机器没有这种天生的层次感——它只能处理数字。Tokenization(分词)就是连接人类文本与机器数字的那座桥梁:
LLM
15日
平均数的暴政——当你不再是一个个体,而是一个均值
1851年,一个德国医生拿了几万人的腋下温度,算了个平均数。然后这个数就进了教科书,成了标准答案,一待就是一百多年。
统计
10日
做风控的人都在说长尾分布——但你知道你的数据到底是不是幂律吗?
你的数据真是幂律吗?长尾被滥用了。Python拟合加KS检验加似然比,三步分清幂律、对数正态与指数
统计
10日
R语言评分卡最优cutoff——约登指数、成本效益与KS最大点
评分卡cutoff怎么定?约登指数、成本效益分析与损失函数三种口径,附R语言实现与对比
风控
10日
QIAN数据:我在风控策略里用了3年SHAP,发现最重要的不是特征重要性
SHAP不只是解释工具:三年风控实战看特征重要性漂移,Shapley值可加性怎么做模型监控
风控
06日
风控规则引擎实战:从RETE到决策表
规则引擎从RETE算法到决策表:产生式系统怎么评估覆盖率与命中率,规则链冲突如何消解
风控
01日
MCP协议打通风控工具链——让AI直接连决策引擎/黑名单库/特征平台
MCP(Model Context Protocol)让 AI 直接连决策引擎、黑名单库、特征平台:从「5-8 个系统来回切」到一句话拿到结果,附三个真实场景的提示词与数据安全三级方案。
LLM
01日
世界上最简单的数学定理,却不只是鸽子和洞
鸽巢原理:看起来幼稚,却能推出Ramsey定理、生日悖论和Dirichlet逼近,含组合数学的经典应用
统计
01日
为什么你认识的人总能通过不超过6个人认识任何人
六度分隔是真的吗?Watts-Strogatz小世界模型解释现实网络为何既短又聚,附反欺诈网络应用
统计
01日
一个期望值∞的游戏,为什么没人愿意出超过20块
期望无限大却没人愿意玩:圣彼得堡悖论引出预期效用与风险厌恶,前景理论怎么解释真实决策
统计
01日
正负开方术 vs Newton-Raphson:两种求解风控参数的数学哲学
秦九韶的正负开方术比Newton-Raphson早了五百年:逐位试商的数值求解原理与逻辑回归求根
风控
2026年6月
11 篇
26日
三角函数在风控中的应用——循环特征编码与三角回归
周期性变量怎么做特征:sin与cos循环编码加三角回归,用LendingClub月度违约率验证效果
风控
18日
3个递推公式,100万次迭代,都收敛到同一个数——压缩映射的秘密
2022年5月21日,QIAN数据发了《压缩数列与Stolz定理》——一篇纯数学推导的文章。那时风格偏学术:给定义、列定理、写代码算结果。
统计
17日
大模型当风控分析师:读报表、找问题、出策略
大模型当风控分析师:读报表、找问题、出策略,函数调用架构加策略仪表盘异常检测的三层能力
LLM
15日
6σ事件每几年发生一次?金融风险的厚尾真相
厚尾分布揭示金融极端风险:沪深300峰度4.82,正态假设让VaR系统性低估,极值理论与巴塞尔ES转向
统计
15日
每个被骗的人都说过一句话:我不会上当
201份真实诈骗案件剖析:为什么越自信的人越容易被骗?信号检测理论和贝叶斯更新解释骗术本质
LLM
12日
大模型在风控里到底能干什么?一个CART、LLM合并与评分卡的全面实测
序贯覆盖、决策树与评分卡三套策略怎么比:用Lift、KS、AUC与策略曲线找到最优组合
LLM
10日
因果推断实战——贷款金额×违约,一个反直觉的统计真相
贷款金额对违约到底有多大影响?220万笔数据显示负向混杂让效应被低估2倍,DAG识别加逐步回归
统计
06日
大模型在信贷风控中的实战:智能审单与欺诈文本识别
大模型在信贷风控怎么用:智能审单与欺诈文本识别,零样本分类、混合模型与大模型边界的实测对比
LLM
05日
欺诈团伙 vs 反欺诈系统:不是道高一尺魔高一丈,是数学的周期性战争
反欺诈为什么总在反弹?用捕食者-猎物模型解释欺诈率周期性振荡,附微分方程与模拟代码
风控
04日
切比雪夫不等式——任何分布都逃不出的概率边界
切比雪夫不等式给出了一个适用于任何分布的万能概率边界——无论数据是什么形状,落在均值kσ范围内的概率至少为$1-1/k^2$。
统计
01日
模型说低风险你就放款了?——服从权威的数学致命曲线
米尔格拉姆实验说65%的人会服从权威。当权威变成模型评分,风控决策会陷入同样的服从陷阱
职场
2026年5月
5 篇
25日
牛顿法 vs 梯度下降——二阶优化的力量
牛顿法利用二阶导数(Hessian矩阵)同时考虑梯度方向和曲率,在极值点附近达到二次收敛——每步有效数字翻倍。梯度下降只用一阶导数,线性收敛。本文从多元牛顿法推导到阻尼牛顿法、BFGS拟牛顿法,完整代码见第四节。
统计
25日
大模型做信贷审批:闭卷考试不及格,开卷考试满分
大模型做信贷审批合格吗?288条监管知识库加检索增强,闭卷与开卷的对比实测,附合规边界
LLM
24日
TF-IDF与文本分类——从词频到语义
计算机无法直接理解文字,需要将文本转换为数值向量。将文本转化为机器可处理的数值表示,是自然语言处理中最基础也是最关键的一步。本小节从数学角度深入讲解词袋模型和TF-IDF两种经典方法的原理与差异。
LLM
20日
你的公司自动分裂成两派,不是人心坏了,是数学
派系是必然还是人心散了?结构平衡理论、谢林隔离模型、囚徒困境与沙普利值拆解组织政治
职场
10日
风控决策引擎实战:从规则链到多源评分融合
决策引擎不只是规则链:从贝叶斯决策风险最小化推出最优Cutoff,规则、评分卡与模型三层融合
风控
2026年3月
1 篇
10日
你的风控团队集体沉默了?不是人心散了,是信息级联的数学
风控团队为什么集体沉默?信息级联模型表明,只要发言顺序不对,集体沉默就是数学必然
职场
‹ 上月
2026年9月
下月 ›
最新月份
一
二
三
四
五
六
日
1
1
2
1
3
4
5
6
7
8
9
10
11
12
13
14
15
16
1
17
18
19
20
21
2
22
23
24
25
26
27
28
29
30