LASSO
方法的总结与思?/p>
统计学习中如果一味提高对训练数据的拟合能力,
模型复杂度也会相应提高,
这种情况下训练出的方程总是能很好的拟合训练数据?/p>
得到的代价函数可能非?/p>
接近?/p>
0
,但这样的曲线千方百计的去拟合训练数据,通常会导致它无法泛化?/p>
新的数据样本中,这类情况被叫做过拟合
(overfitting)
。例如在生物医学领域中,
数据的维度很高,
但由于收集数据需要实验代价高昂,
可用的训练数据却相当少,
很容易发生过拟合问题
[3]
?/p>
对于过拟合,
可以通过人工筛选去除某些变量,
留下关键的变量,
但是在剔
除变量的时候,
就舍弃了一部分信息?/p>
可能会对最终的预测结果造成影响?/p>
另一
种方法是正则化,在经验风险的基础上加一个正则化项,降低某些参数的影响,
事实上,这些参数的值越小,对应更加简单的函数,就不易发生过拟合的问题?/p>
常见的正则化方法有岭回归?/p>
LASSO
回归,它们间的区别在于,岭回归是一?/p>
系数收缩的连续的过程,并且因此更加稳定,但任何系数都不为
0
,因此不能使
模型降维?/p>
LASSO(Least absolute shrinkage and selection operator)
算法
[1]
?/p>
1996
年由
Robert Tibshirani
首次提出,这种方法在保留了岭回归的优点的同时,可?/p>
将某些参数变?/p>
0
,使模型更简?/p>
[2]
?/p>
对最简单的线性回归模型:
1
(
)
p
j
j
T
j
f
x
x
?/p>
?/p>
?/p>
?/p>
?/p>
ω
x
(1)
然后如式
(2)
按照经验风险的最小化策略,求解多项式系数?/p>
?/p>
?/p>
?/p>
?/p>
2
2
1
1
1
(
)
n
i
i
i
L
y
f
x
n
n
?/p>
?/p>
?/p>
?/p>
?/p>
?/p>
w
y
Xw
(2)
其中
i
x
?/p>
R
是输?/p>
x
的观测值,
i
y
?/p>
R
是输?/p>
y
的观测值。该问题具有解析
解:
?/p>
?/p>
1
ˆ
T
T
X
X
X
?/p>
?/p>
w
y
(3)
如果
变量个数
p
大于数据点的个数
n
的话,矩?/p>
T
X
X
将会不是满秩的,?/p>
有无穷多个解?/p>
如果从所有可行解里随机选一个的话,
很可能并不是真正好的解,
发生过拟合?/p>
岭回归是?/p>
经验风险上再添加一?/p>
2
L
正则化项?/p>
2
2
1
(
)
+
L
n
?/p>
?/p>
?/p>
w
y
Xw
w
(4)
此时问题的解为: