图由节点和边组成,边可有方向与权重。最短路找两点间最低代价,最小生成树以最低总成本连通所有节点,最大流研究网络容量。
关键是边权含义:距离、时间、费用或风险不能随意混用。
最短路要求路径边权相加;Dijkstra 适用于非负边权。最小生成树连接所有节点且无环,含 n 个节点时有 n−1 条边。
先画小网络并手算,再上算法。检查有向/无向、可达性、重复边和单位。
补齐图论、排队、蒙特卡洛、主成分等常用工具,并用“目标—数据—约束—输出—验证”快速选型。
节点、边、权重表达连接
道路、社交关系和工序先后为什么都可以画成图?
图由节点和边组成,边可有方向与权重。最短路找两点间最低代价,最小生成树以最低总成本连通所有节点,最大流研究网络容量。
关键是边权含义:距离、时间、费用或风险不能随意混用。
最短路要求路径边权相加;Dijkstra 适用于非负边权。最小生成树连接所有节点且无环,含 n 个节点时有 n−1 条边。
先画小网络并手算,再上算法。检查有向/无向、可达性、重复边和单位。
切换三种输出。
优先考虑最短路径。
连接 5 栋楼,使铺设总长度最短。
楼栋为节点,可建设连接为边。
边权为铺设距离。
要求全部连通且总边长最小,属于最小生成树。
不是找某两楼最短路线,而是以最低总成本连通全部楼。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
目标是全体连通。
最小生成树。
贪心前提。
错误。经典 Dijkstra 要求非负边权;负权应考虑 Bellman–Ford 等方法并检查负环。
树的边数为 n−1。
8−1=7 条。
局部通路 vs 全体连通。
最短路连接指定起终点并最小化该路径代价;最小生成树连接所有节点并最小化全网边权总和。
到达、服务与拥堵
平均每分钟来 5 人、服务 5 人,队伍为什么仍可能越来越长?
排队系统至少描述到达率 λ、服务率 μ、服务台数 c、队列规则和容量。随机波动使平均相等仍可能造成长等待。
单服务台 M/M/1 的稳定条件是 ρ=λ/μ<1;接近 1 时等待会急剧上升。
M/M/1:ρ=λ/μ;系统平均人数 L=ρ/(1−ρ);平均逗留 W=1/(μ−λ);Little 定律 L=λW。
先用数据检验到达/服务分布和时段稳定性;高峰、预约、优先级常需分时段或仿真。
观察系统接近满载时的变化。
有缓冲,随机高峰较易消化。
λ=4 人/分,μ=5 人/分。
利用率 ρ=4/5=0.8。
平均逗留 W=1/(5−4)=1 分钟。
系统平均人数 L=λW=4 人。
若 λ 增到 4.8,W=5 分钟,利用率只增 0.16,等待却大幅上升。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
到达率除以服务率。
ρ=3/5=0.6。
ρ 必须小于 1。
错误。稳定要求 λ<μ;λ=μ 时没有消化随机积压的余量。
使用 W=1/(μ−λ)。
W=1/(6−4)=0.5 分钟。
平均平衡仍不够。
随机到达和服务波动缺乏缓冲,会使队列和等待时间非线性急升。
重复随机试验看结果分布
只用平均需求做库存计划,会漏掉什么风险?
蒙特卡洛从输入概率分布反复抽样,每次计算模型输出,最终得到成本、缺货、收益等结果分布。
模拟不会自动修复错误分布;输入相关性、尾部风险和样本数都需检查。
步骤:定义随机输入及相关性→抽样→运行确定性模型→重复 N 次→汇总均值、分位数、超标概率与置信误差。
固定随机种子,检查样本数收敛;报告 P5/P50/P95,而不只报平均值。
比较均值方案与分布方案。
忽略尾部和超标概率。
每日需求服从历史经验分布,库存 100。
每次抽一个需求值 d。
缺货量=max(d−100,0)。
重复 10000 次,统计缺货概率与平均缺货量。
得到“库存 100 时约 8% 概率缺货”,比只报平均需求更支持风险决策。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
随机输入产生随机输出。
结果分布、分位数与风险概率。
垃圾分布进,垃圾结果出。
错误。次数只降低抽样误差,不能修复错误机制或分布假设。
频率估计概率。
820/10000=0.082,即 8.2%。
随机也可以可复现。
便于复现同一随机样本、调试代码和比较模型版本。
选择任务目标、样本规模和约束强度,得到优先候选并读出理由。
调整左侧参数,观察模型输出怎样变化。
选择器只给候选,不给最终答案。还需要检查哪些假设和验证方法,才能真正决定模型?
降维不是删掉“不显著”变量
10 个高度相关指标都在测“规模”,能否用 1–2 个综合成分表示?
主成分分析寻找原特征的线性组合,使第一成分解释最大方差,后续成分与前面正交并解释剩余方差。
通常先标准化;载荷用于解释成分与原变量关系。成分数学上最大化方差,不一定天然有业务含义。
标准化矩阵协方差/相关矩阵特征分解;解释方差比 λj/Σλ。按累计解释率、碎石图和解释性选成分数。
报告标准化、解释方差、载荷矩阵和成分命名理由;PCA 后模型仍需验证。
比较机械保留与可解释 PCA。
不知道成分代表什么。
营收、资产、员工数高度正相关。
对三列标准化。
第一主成分载荷都为正且接近。
可谨慎解释为“综合规模”成分。
用一个成分减少共线和维度,但要说明它是原指标的线性组合。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
数学方向不等于现实概念。
错误。它最大化方差,业务含义需根据载荷和情境解释,有时并不清楚。
PCA 也受尺度影响。
标准化,避免大尺度特征主导方差。
特征值占总和。
5/(5+3+2)=0.5,即 50%。
成分与原特征的桥。
每个主成分由哪些原变量、以何方向和强度构成,从而支持成分解释与命名。
目标、数据、约束、输出、验证
题目写“建立合理模型”,怎样在 30 分钟内把几十种方法缩小到 2–3 个候选?
先问目标是什么、数据有什么、现实约束是什么、需要输出什么、怎样验证。
候选模型要比较数据要求、假设、复杂度、解释性、实现时间和验证方式。
输出排序→评价;未来数值→预测;受约束决策→优化;已知标签→分类;无标签分组→聚类;连接路径→图网络;随机风险→模拟。
做一张候选表,每问至少一个简单基准和一个进阶候选。先跑基准,进阶模型必须证明增益。
比较模型菜单与结构匹配。
“最佳”可能是评价也可能是优化。
未来需求未知,需决定路线并评估延误风险。
预测需求:时间序列/回归。
路线决策:车辆路径/整数优化。
延误风险:情景或蒙特卡洛模拟。
问题需要“预测→优化→风险模拟”的模型链。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
“决定数量 + 最好 + 约束”。
优化模型。决策变量、目标与约束都明确。
任务类型不等于具体算法。
错误。应根据样本量、结构、解释需求和基准表现选择,简单模型可能更合适。
让选择有证据。
数据要求、核心假设、输出、验证方式、解释性、实现成本/风险;还可列基准表现。
无标签分组。
聚类。
复杂度必须换来可验证增益
一个模型做到 95 分,三个模型串联为什么可能只剩 80 分?
模型链中上游误差会传递到下游。接口要写清输入、输出、单位和不确定性。
设置止损:若进阶模型在限定时间内不能稳定超过基准,保留简单可解释方案。
每一环都有局部验证,整条链还有端到端验证。预测输出进入优化时,用高/中/低情景而非单一点值。
为每个模型写最晚完成时间、最低验收指标和备用方案。不要在最后 6 小时继续重写核心模型。
比较一味升级与有基准止损。
实现风险高,可能无验证时间。
预测 MAPE 10%,库存优化使用点预测。
建立预测低/中/高需求情景。
分别求库存方案与缺货成本。
检查同一方案在预测误差内是否稳健。
若方案对 ±10% 需求极敏感,应增加安全库存或使用稳健优化。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
局部最优不保证全局好。
错误。接口、单位、误差传递和目标错配都可能让整条链失效。
上游误差不能消失。
使用高/中/低情景或稳健方法,把预测不确定性传给决策。
防止最后阶段沉没成本。
事先约定的最晚时间和最低增益标准;若进阶方案未达标,就回到已验证基准并完成论文。
增益要有证据。
在公平验证中稳定改善关键指标,且复杂度、解释和实现风险可接受。
选择一份综合赛题,不求解,先设计模型链与备用路线。
讲义、练习、实验与挑战清单均在本地页面内。