R语言逻辑回归分析连续变量和分类变量之间的“相关性“
比如说分类变量为是否幸存、是因变量,连续变量为年龄、是自变量,这两者可以做相关分析吗?两者又是否可以做回归分析?
比如说分类变量为是否幸存、是因变量,连续变量为年龄、是自变量,这两者可以做相关分析吗?两者又是否可以做回归分析?
当我们将CNN(卷积神经网络)模型用于训练多维类型的数据(例如图像)时,它们非常有用。
我们首先讨论多项式回归,进一步,我们会想到分段线性或分段多项式函数,可能还有附加的连续性约束,这些是样条曲线回归的基础。
本文对人口统计预测方法进行讨论。
根据我们对温度的预测,我们可以预测电力消耗。
随着越来越多的数据被数字化,获取信息变得越来越困难。我们在本文中重点关注的一个示例是评估公司面临的不同风险领域。
在本文中,我们使用了逻辑回归、决策树和随机森林模型来对信用数据集进行分类预测并比较了它们的性能。
动量和马科维茨投资组合模型使 均值方差优化 组合成为可行的解决方案。
本文简要介绍一下网络分析,我想提供一些有关“友谊悖论”的R语言例证。友谊悖论指出
最近我们被客户要求撰写关于MCMC采样的研究报告。在许多情况下,我们没有足够的计算能力评估空间中所有n维像素的后验概率 。在这些情况下,我们倾向于利用称为Markov-Chain Monte Carlo 算法的程序 。
本文在股市可视化中可视化相关矩阵 :最小生成树
指数加权波动率是一种波动率的度量,它使最近的观察结果有更高权重。
巴斯Bass扩散模型已成功地用于预测各种新推出的产品以及成熟产品的市场份额。
由于目标是预测理赔频率(以评估保险费水平),因此他建议使用旧数据来训练该模型,并使用最新数据对其进行测试。问题在于该模型没有包含任何时间模式。
在现实世界中,我们的生活受到大量网络的支配。网络流可以表示很多模型,比如管道中的石油、高压线中电流,或者计算机网络中的数据。
今天早上,我们使用一些论文中提到的示例,使用最大流最小割定理将流量拥塞降至最低, 并应用了最短路径分析了交通瓶颈。
最近,我们继续对时间序列建模进行探索,研究时间序列模型的自回归和条件异方差族。我们想了解自回归移动平均值(ARIMA)和广义自回归条件异方差(GARCH)模型。它们在量化金融文献中经常被引用。
最近,我们使用隐马尔可夫模型开发了一种解决方案,并被要求解释这个方案。
本文提出了一种算法,可以根据市场波动性在均值回归和趋势跟随策略之间进行切换。
本说明介绍使用Student-t改进的GARCH(1,1)模型对汇率对数收益进行贝叶斯估计。
为了帮助客户正确使用POT模型,本指南包含有关使用此模型的实用示例。本文快速介绍了极值理论(EVT)、一些基本示例,最后则通过案例对河流的极值进行了具体的统计分析。
正如有配偶的寿命之间存在很强的相关性,我们可能会问,孩子和孙子的出生是否具有对一个人的剩余生命的影响(或者我们是否可以像这样假设独立性)。
本文中,我们讨论了一个将Poisson过程与Wiener过程结合在一起的最佳算法的问题。
灰色关联分析包括两个重要功能。
第一项功能:灰色关联度,与correlation系数相似,如果要评估某些单位,在使用此功能之前转置数据。第二个功能:灰色聚类,如层次聚类。
POT模型其主要动机是为高洪水流量的概率模型提供实用工具。但是,EVT的优势在于结果不取决于要建模的过程。因此,人们可以使用POT来分析降水,洪水,金融时间序列,地震等。
从这个XML文件中,我想创建一个具有ID,name 列的R数据框。请注意,name和ID应包含变量的所有级别。
我需要安装R软件包stochvol,该软件包 仅适用于3.6.0版的R。
最近我们被客户要求撰写关于分析各种投资的历史收益的研究报告。要执行此分析,我们需要资产的历史数据。数据提供者很多,有些是免费的,大多数是付费的。
对于此示例,我将对R中的时间序列进行建模。我将最后24个观察值保留为测试集,并将使用其余的观察值来拟合神经网络。
关联挖掘通常用于通过识别经常一起购买的产品来提出产品推荐。但是,如果您不小心,则规则在某些情况下可能会产生误导性的结果。
风险价值VaR和损失期望值ES是常见的风险度量。
结合POT模型的洪水风险评估能够从有限的实测资料中获取更多的洪水风险信息。
增量法使我们具有(渐近)正态性,因此一旦有了标准偏差,便可以得到置信区间。
R语言绘图中的中文默认字体宋体,希望用其他字体绘图,保存成PDF格式不能识别中文。
在本指南中,我们想向您展示如何使用现在提供的一些奇妙,免费的工具和软件包编写美观,可重复的报告。这些工具将帮助您交流科学知识,并希望您再也不会复制和粘贴R输出。
通常,GLM的连接函数可能比分布更重要。
一种类型的平滑称为样条平滑。柔性金属(通常是铅),可以用作绘制平滑曲线的参考。将选择一组点(称为结),然后将样条线压在特定的x,y点,然后弯曲以通过下一个点,依此类推。
回归分析是一种十分常见的数据分析方法,通过观测数据确定变量间的相互关系。传统回归分析以点数据为研究对象,预测结果也是点数据,而真实数据往往在一定范围内变动的。
WeChat Tencent QQ email print 由Kaizong Ye,Qing Li撰
如何使用蒙特卡洛模拟来推导随机变量可能的分布,我们回到统计数据(无协变量)进行说明。
至少在统计学的角度上,要评估一个投资组合是否最优是很困难的。
我们已经看到了如何考虑风险敞口,计算包含风险敞口的多个数量(经验均值和经验方差)的非参数估计量。让我们看看如果要对二项式变量建模。
这里的想法是使距离最大化:想法是区分,所以我们希望样本尽可能不独立。要计算基尼系数。
通常,我们在回归模型中一直说的一句话是“ 请查看一下数据 ”。
R语言提供了丰富的功能,可用于绘制R中的时间序列数据。
我们已经很自然地认为,不仅可以用一些协变量来解释单个索赔的频率,而且可以用单个成本来解释。
使用Chain Ladder方法完成流量三角形,即计算我们认为未来几年将支付的平均金额
当我们要为预测提供一个置信区间时,建议您为预测器确定置信区间参数的估计和潜在值的置信区间。
在之前的课堂上,我们已经看到了如何可视化多元回归模型(带有两个连续的解释变量)。
本文为非人寿保险课程的一部分,该示例对1900 -2005年间的“ 美国标准化飓风损失 ”数据集进行研究(2008)。我们使用了广义线性模型和帕累托分布Pareto distributions分析。
上周在 非人寿保险课程中,我们了解了广义线性模型的理论
在概率课程中经常会看到标准的正态分布表。
对精算科学来说,当我们处理独立随机变量的总和时,特征函数很有趣,因为总和的特征函数是特征函数的乘积。
我和同事一起分析死亡率。我们在研究人口数据集,可以观察到很多波动性。
拥有参数模型变得有趣,该模型应该比经验平均值更健壮。
今天上午,在课程中,我们讨论了利率制定中可观察和不可观察异质性之间的区别(从经济角度出发)。
在保险定价中,风险敞口通常用作模型索赔频率的补偿变量。
这周,我在http://waitbutwhy.com/上发现了一张图片 ,它代表了典型的人类生活
变量重要性图是查看模型中哪些变量有趣的好工具。
从动态的角度看,负利率效应也可以被描述为银行利率变化的速度小于价格指数变化的速度,这是一种违反经济规律的特殊状态。
在课程中进行案例研究(使用真实数据)时,学生都会惊讶地发现很难获得“好”模型
当我们要可视化事故数量时,其想法是根据部门的人员进行标准化。
本文我们绘制英国脱欧投票的地图。
布丰投针是几何概率领域中最古老的问题之一。它最早是在1777年提出的。
我们决定使用航空公司的航班数据探讨这个问题。
R语言ggmap空间可视化机动车碰撞–街道地图热力图
永远不要错过任何见解。当新文章发表时,我们会通过微信公众号向您推送。
技术干货
最新洞察
This will close in 0 seconds