当前位置: 首页 > news >正文

沈阳黑酷做网站建设优化公司怎么样网站的网络推广

沈阳黑酷做网站建设优化公司怎么样,网站的网络推广,网页站点是什么意思,绿色大气网站句子长度为n;比如2048,或1024,即,一句话最多可以是1024个单词。 1, 位置编码 可知,E是由n个列向量组成的矩阵,每个列向量表示该列号的位置编码向量。 2, 输入向量 加入本句话第一个单词的词嵌入向量是, 第…

句子长度为n;比如2048,或1024,即,一句话最多可以是1024个单词。

1, 位置编码

E=[e_1 e_2 \cdots e_{n}]\\ e_{pos}(2i) = PE(pos, 2i) = sin(pos/10000^{2i/n})\\ e_{pos}(2i+1) =PE(pos,2i+1)=cos(pos/10000^{(2i+1)/n})\\ where\,\, pos \in \{1,2,\cdots,n\}

可知,E是由n个列向量组成的矩阵,每个列向量表示该列号的位置编码向量。

2, 输入向量

加入本句话第一个单词的词嵌入向量是x_1, 第二个单词是 x_2, 以此类推,最多是x_n.

如果句子长度不足 n个单词,则后面没有单词对应的x_i = \mathbf{0}

X=(x_1\,x_2\,\cdots\,x_n)为句子的词嵌入编码矩阵表示,为了让单词携带位置信息,直接将每个单词的词嵌入向量上加位置编码向量:

x_i = x_i + e_i

矩阵表示为:

X=X+E

X=(x_1+e_1 \,\,x_2+e_2\,\,\cdots\,\,x_n+e_n)

作为第一层 self-attention 模块的输入向量。

3, 完整的一层编码器计算过程

X=(x_1\,\,x_2\,\, \cdots\,\,x_n)

[q_1\,q_2\cdots\,q_n] = Q = W_qX=W_q[x_1\,\,x_2\,\,\cdots\,\,x_n]

[k_1\,k_2\,\cdots\,k_n]=K=W_kX=W_k[x_1\,\,x_2\,\,\cdots\,\,x_n]

[v_1\,v_2\,\cdots\,v_n]=V=W_vX=W_v[x_1\,\,x_2\,\,\cdots\,\,x_n]

\left[ \begin{array}{cccc} a_{1,1} & a_{2,1} & \cdots &a_{n,1}\\ a_{1,2} & a_{2,2} & \cdots &a_{n,2}\\ \vdots & \vdots & \ddots & \vdots\\ a_{1,n} & a_{2,n} & \cdots &a_{n,n}\\ \end{array} \right] = A =K^TQ= \left[ \begin{array}{c} k_1^T\\ k_2^T\\ \vdots\\ k_n^T\\ \end{array} \right] [q_1\,q_2\, \cdots \,q_n]

\left[ \begin{array}{cccc} a_{1,1}^{'} & a_{2,1}^{'} & \cdots &a_{n,1}^{'}\\ a_{1,2}^{'} & a_{2,2}^{'} & \cdots &a_{n,2}^{'}\\ \vdots & \vdots & \ddots & \vdots\\ a_{1,n}^{'} & a_{2,n}^{'} & \cdots &a_{n,n}^{'}\\ \end{array} \right] = A^{'} = \mathbf{softmax}_{column}(\mathbf{A}) = \mathbf{softmax}_{column} ( \left[ \begin{array}{cccc} a_{1,1} & a_{2,1} & \cdots &a_{n,1}\\ a_{1,2} & a_{2,2} & \cdots &a_{n,2}\\ \vdots & \vdots & \ddots & \vdots\\ a_{1,n} & a_{2,n} & \cdots &a_{n,n}\\ \end{array} \right] )

Y=\mathbf{V}\mathbf{A}^{'}=[v_1\,v_2\,\cdots\,v_n]\mathbf{A}^{'}

\mathbf{Y}=\mathbf{Y}+\mathbf{X}

\mathbf{Y}=normalized(\mathbf{Y})

\mathbf{Z} =[\mathbf{Y_1Y_2 \cdots Y_8}] 

上面是把8个multihead的输出拼接起来了。

然后经过本层的这个个feed forward neuron network:

\mathbf{Z}=\mathbf{FFNN}(\mathbf{Z})

\mathbf{Y} = \mathbf{Y}+\mathbf{X}

然后将 \mathbf{Y} 送入下一层编码器,进行相同的计算过程,只是其中的\mathbf{W_q, W_k, W_v, FFN} 的权重不同而已。

4, 更多参考资料

 The Illustrated Transformer – Jay Alammar – Visualizing machine learning one concept at a time.

图解Transformer(完整版)!翻译

自然语言处理Transformer模型最详细讲解(图解版)-CSDN博客

未完待续 ... ...

http://www.hengruixuexiao.com/news/42141.html

相关文章:

  • 郑州做网站擎天seo网站推广优化
  • 内页网站地图 权重seo门户网站
  • 可以免费做宣传的网站惠州百度seo哪里强
  • 抽奖网站怎么做的广州seo外包公司
  • 早期做网站 如何推广推广信息发布平台
  • 咸阳网站建设报价免费b站推广软件
  • 免费网站一键生成南宁网站建设服务公司
  • 静态网站做毕业设计经营管理培训课程
  • 网站建设自助建站云建站杭州新站整站seo
  • 网上哪些网站可以做设计项目成都企业seo
  • 做夺宝网站要办理什么虞城seo代理地址
  • 北京网站sem、seo杭州seo平台
  • php网站上传教程广州百度推广代理公司
  • 做街机棋牌上什么网站发广告陕西网站推广公司
  • 网站后台管理的超链接怎么做怎么在线上推广自己的产品
  • 建个人网站需要哪些交换链接营销实现方式解读
  • html5开发安卓app就业seo好还是sem
  • 驻马店做网站建设的公司一个新产品怎么推广
  • phpcms网站开发网站制作大概多少钱
  • 外贸主动营销网站建设自己的网站怎么做seo
  • 东莞网站建设营销网站品牌推广的意义
  • 企业公司简介范文广西seo公司
  • 地方政府网站建设中存在的问题怎样推广自己的商城
  • 怎么做电影流量网站吗德国搜索引擎
  • 电子商务网站建设重点厦门seo关键词优化培训
  • 长沙定制网站开发恢复正常百度
  • 湖北城乡建设厅官方网站线上如何做推广
  • 推荐网址云巅seo
  • 如何java做网站淘宝推广怎么做
  • 东莞长安网站推广公司seo的研究对象