1.一种基于Q学习和多属性决策的WiFi卸载方法,其特征在于该方法包括:(1)获取用户终端在LTE网络、WiFi网络重叠小区内部移动过程中经过的位置,并计算每个位置的网络属性,形成集合S={si=(Posii,Envii)|i∈{1,2,...,Np}},其中,Posii表示位置i,Envii表示位置i的网络属性,包括吞吐量TPi、功耗PCi、花费Ci和时延Di,Np表示用户终端经过的位置数;
(2)建立用于获取最优WiFi卸载策略的Q学习模型,所述Q学习模型中,将用户终端视为智能体,将集合S定义为Q学习的状态,将WiFi卸载决策定义为Q学习中的动作选择过程,即A={ak,k∈{0,1,2,...,NAP}},其中,a0表示用户终端接入LTE网络基站,{ak,k∈{1,2,...,NAP}}表示用户终端卸载到对应下标的WiFi网络接入点;
(3)分别计算网络属性吞吐量TPi、功耗PCi、花费Ci和时延Di的权重(4)建立Q表,Q表中的元素为Q(s,a),表示智能体在状态s下做出动作a所获得的累积折扣奖励,并设置初始时刻Q0(s,a)=0,其中,s∈S,a∈A;
(5)获取智能体的第一个状态si|i=1;
(6)在当前状态si下进行Q学习的动作选择,具体为:智能体以概率ε随机选取一个网络进行接入,否则选择值maxQ(si,a)所对应的网络进行接入,将最终选择的动作采用a^表示;
(7)计算智能体在执行动作a^后的即时奖励,即:将实际吞吐量小于吞吐量阈值TPith的无效网络过滤,将被过滤掉的无效动作对应的即时奖励直接置零,对于过滤后得到的候选网络集合,根据权重 采用多属性决策方法计算用户终端接入网络获得的即时奖励Rw(si,a^);
(8)利用下列公式更新Q表中的元素Q(si,a^):
其中,下标t表示当前时刻计算得到对应值,t-1表示上一次计算得到对应值,μ∈(0,1)为学习速度, 为经验奖励,δ是经验奖励的折扣因子,s'是智能体接下来转移到的状态;
(9)将智能体的状态转移到下一个状态,即i=i+1,并重复步骤(6)至步骤(8),直至i=Np后执行(10);
(10)判断智能体在每一个状态下的最大Q(s,a)值对应的动作是否改变,若不再改变,则迭代结束,执行步骤(11),否则返回执行步骤(4);
(11)根据最终的Q表控制WIFI卸载,即当用户终端经过位置Posii时,控制用户终端选择Q(si,a)的最大值所对应的网络进行WIFI卸载,其中,i∈{1,2,...,Np}。
2.根据权利要求1所述的基于Q学习和多属性决策的WiFi卸载方法,其特征在于:步骤(1)中计算每个位置的吞吐量TPi和功耗PCi的方法具体为:(1-1)根据以下公式计算位置i的吞吐量TPi:
式中, 表示网络收到的来自用户终端的信号功
率,Pt为用户终端的发射功率,d0为参考距离,L0是当终端距离网络d0时的路径损耗,α为路径损耗指数,d为网络与用户终端的距离,G(θ,β)为满足高斯分布的均值为θ,方差为β的阴影衰落,N0为加性高斯白噪声功率谱密度,W为智能体的可用带宽;
(1-2)根据以下公式计算位置i的功耗PCi:
PCi=P0+Pt
式中,P0是用户终端的固定运行功耗。
3.根据权利要求1所述的基于Q学习和多属性决策的WiFi卸载方法,其特征在于:步骤(3)中计算权重所采用的方法具体包括:(3-1)由用户业务类型j和吞吐量、功耗、花费和时延四种属性建立成对比较矩阵B:其中,bmn表示第m个网络属性和第n个网络属性之间重要程度之比,j=1表示流媒体业务,j=2表示会话业务,j=3表示后台业务,,n=1,2,3,4分别表示吞吐量、功耗、花费和时延;
(3-2)获取B的最大特征值λ*对应的特征向量,并将其归一化得到AHP权重向量(3-3)计算成对比较矩阵B的一致性率CR:式中,N是网络属性的个数,也是矩阵B的阶数,RI是平均随机性一致性指标;
(3-4)若一致性率CR>0.1,则返回步骤(3-1)调整矩阵B,重新计算AHP权重向量,直至CR<0.1,采用最终的AHP权重向量。
4.根据权利要求3所述的基于Q学习和多属性决策的WiFi卸载方法,其特征在于:所述成对比较矩阵B中的元素bmn为1到9之间的整数或1到9的倒数,且有bmn=1/bnm,对角线上的值为1。
5.根据权利要求1所述的基于Q学习和多属性决策的WiFi卸载方法,其特征在于:步骤(7)具体包括:(7-1)将实际吞吐量小于吞吐量阈值TPith的无效网络过滤,被过滤掉的无效动作对应的即时奖励直接置零,设过滤后的候选网络集合为{Net1,...,Netl,...,NetL},即从动作集合A中提取出的L个有效动作;
(7-2)构造候选网络属性矩阵X:
式中,l代表候选网络的编号,n代表网络属性的编号形如 表示候选网络Netl的对应网络属性,xln表示网络属性矩阵X的第l行第n列的元素;
(7-3)根据候选网络属性矩阵X构造标准化判决矩阵H,其中H的元素hln为:(7-4)根据属性权重得到加权判决矩阵Y,其中Y的元素yln为:yln=wnhln;
(7-5)设置最理想方案Solution+为:
最不理想方案Solution-为:
(7-6)利用TOPSIS方法的原理计算每个候选网络和最理想方案的相对接近程度,得到接入候选网络的即时奖励:式中, 为第l个候选网络和Solution+的欧几里得距离,为第l个候选网络和Solution-的欧几里得距离。