<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>T5 on 辰远</title>
        <link>/tags/t5/</link>
        <description>Recent content in T5 on 辰远</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <copyright>Lee</copyright>
        <lastBuildDate>Tue, 08 Sep 2026 22:57:30 +0800</lastBuildDate><atom:link href="/tags/t5/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>T5 / BART：把一切 NLP 任务统一成 Text-to-Text</title>
            <link>/p/t5-bart/</link>
            <pubDate>Sat, 05 Sep 2026 00:00:00 +0000</pubDate>
            <guid>/p/t5-bart/</guid>
            <description>&lt;img src=&#34;/p/t5-bart/cover.jpg&#34; alt=&#34;Featured image of post T5 / BART：把一切 NLP 任务统一成 Text-to-Text&#34; /&gt;&lt;h2 id=&#34;引子bert-和-gpt-各自的缺口&#34;&gt;引子：BERT 和 GPT 各自的缺口&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;2018-2019 年，NLP 被两条路线割裂：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;BERT（Encoder-only）&lt;/strong&gt;：双向理解强，但不能生成&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;GPT（Decoder-only）&lt;/strong&gt;：生成强，但单向注意力让理解任务吃亏&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;有没有一种架构能同时要？答案是 &lt;strong&gt;Encoder-Decoder&lt;/strong&gt;——Transformer 原版就是它，只是被 BERT 和 GPT 各拆走了一半。&lt;/p&gt;&#xA;&lt;p&gt;2019 年 Google 的 T5 和 Facebook 的 BART 给出了两种不同但互补的答案。&lt;/p&gt;&#xA;&lt;h2 id=&#34;t5一切皆-text-to-text&#34;&gt;T5：一切皆 Text-to-Text&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;T5（Text-to-Text Transfer Transformer）的核心主张激进到近乎粗暴：&lt;strong&gt;把所有 NLP 任务都改写成&amp;quot;输入文本 → 输出文本&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;任务&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;输入&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;输出&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;翻译&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;code&gt;translate English to German: That is good.&lt;/code&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;code&gt;Das ist gut.&lt;/code&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;分类&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;code&gt;sst2 sentence: This movie is great.&lt;/code&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;code&gt;positive&lt;/code&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;相似度&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;code&gt;stsb sentence1: ... sentence2: ...&lt;/code&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;code&gt;3.8&lt;/code&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;摘要&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;code&gt;summarize: &amp;lt;长文&amp;gt;&lt;/code&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;code&gt;&amp;lt;摘要&amp;gt;&lt;/code&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;模型不需要任何任务特定的输出层——分类任务输出 &amp;ldquo;positive&amp;rdquo; 这个 token 序列，回归任务输出 &amp;ldquo;3.8&amp;rdquo; 这个数字字符串。&lt;strong&gt;统一的不是架构，是接口&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;相对位置编码&#34;&gt;相对位置编码&#xD;&#xA;&lt;/h3&gt;&lt;p&gt;T5 用简化的相对位置编码（relative position bias）：每个注意力头学习一组标量偏置，按 query-key 相对距离查表加到注意力分数上。相比绝对位置编码，它更容易外推到训练时没见过的长度。&lt;/p&gt;&#xA;&lt;h3 id=&#34;预训练任务span-corruption&#34;&gt;预训练任务：Span Corruption&#xD;&#xA;&lt;/h3&gt;&lt;p&gt;T5 不用 BERT 的单 token 遮蔽，而是&lt;strong&gt;遮蔽连续片段&lt;/strong&gt;：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-fallback&#34; data-lang=&#34;fallback&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;原文:  The quick brown fox jumps over the lazy dog&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;遮蔽:  The &amp;lt;X&amp;gt; fox jumps &amp;lt;Y&amp;gt; dog&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;目标:  &amp;lt;X&amp;gt; quick brown &amp;lt;Y&amp;gt; over the lazy&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;每个片段用一个 sentinel token（&lt;code&gt;&amp;lt;X&amp;gt;&lt;/code&gt;、&lt;code&gt;&amp;lt;Y&amp;gt;&lt;/code&gt;）替换，模型需要输出所有被遮蔽的片段。平均片段长度 3，遮蔽 15%。&lt;/p&gt;&#xA;&lt;p&gt;这比单 token 遮蔽更难，也更接近生成任务。&lt;/p&gt;&#xA;&lt;h3 id=&#34;c4-数据集&#34;&gt;C4 数据集&#xD;&#xA;&lt;/h3&gt;&lt;p&gt;T5 专门构建了 &lt;strong&gt;C4&lt;/strong&gt;（Colossal Clean Crawled Corpus，750GB）——从 Common Crawl 清洗出的英文文本。清洗规则包括：只保留以标点结尾的行、去除重复行、过滤脏词页面等。&lt;/p&gt;&#xA;&lt;h3 id=&#34;训练规模&#34;&gt;训练规模&#xD;&#xA;&lt;/h3&gt;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;模型&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;参数量&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;层数&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;d_model&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;T5-Small&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;60M&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;6/6&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;512&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;T5-Base&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;220M&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;12/12&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;768&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;T5-Large&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;770M&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;24/24&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;1024&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;T5-3B&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;3B&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;24/24&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;1024&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;T5-11B&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;11B&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;24/24&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;1024&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;T5 论文最有价值的贡献之一是&lt;strong&gt;系统性的消融实验&lt;/strong&gt;：他们比较了 encoder-decoder vs decoder-only、去噪目标 vs 语言模型目标、C4 vs 其他数据集、预训练数据量等。结论是 encoder-decoder + span corruption 在相同计算预算下最优。&lt;/p&gt;&#xA;&lt;h2 id=&#34;bart去噪自编码器&#34;&gt;BART：去噪自编码器&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;BART（Bidirectional and Auto-Regressive Transformer）的思路不同：&lt;strong&gt;先用任意噪声破坏文本，再让模型重建原文&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;它的结构就是完整的 Transformer encoder-decoder：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;Encoder 用双向注意力（像 BERT）&lt;/li&gt;&#xA;&lt;li&gt;Decoder 用因果注意力（像 GPT），并且对 encoder 输出做交叉注意力&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;h3 id=&#34;五种加噪方式&#34;&gt;五种加噪方式&#xD;&#xA;&lt;/h3&gt;&lt;p&gt;BART 论文测试了多种噪声，其中效果最好的组合是：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&lt;strong&gt;Token Masking&lt;/strong&gt;：随机遮蔽 token（同 BERT）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Token Deletion&lt;/strong&gt;：随机删除 token，模型必须推断位置和内容&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Text Infilling&lt;/strong&gt;：遮蔽连续片段，用单个 mask 替换（同 SpanBERT）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Sentence Permutation&lt;/strong&gt;：打乱句子顺序&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Document Rotation&lt;/strong&gt;：随机旋转文档，让模型找到真正的起点&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;最终配置用 &lt;strong&gt;text infilling + sentence permutation&lt;/strong&gt;：遮蔽 30% 的 token（片段长度服从泊松分布 λ=3），并把句子打乱。&lt;/p&gt;&#xA;&lt;figure&gt;&lt;img src=&#34;/p/t5-bart/t5-vs-bart.svg&#34;&gt;&lt;figcaption&gt;&#xA;&#x9;&#x9;&#x9;&lt;h4&gt;图 1：T5 的 span corruption vs BART 的去噪重建（由 Diagram Design 生成）&lt;/h4&gt;&#xA;&#x9;&#x9;&lt;/figcaption&gt;&#xA;&lt;/figure&gt;&#xA;&#xA;&lt;h3 id=&#34;为什么-bart-适合生成&#34;&gt;为什么 BART 适合生成&#xD;&#xA;&lt;/h3&gt;&lt;p&gt;BART 的 decoder 是自回归的，所以它天生能做摘要、翻译、对话。而 encoder 是双向的，所以它能充分理解输入。这种组合在摘要任务上特别强——BART 在 XSum 上比 T5 更好。&lt;/p&gt;&#xA;&lt;h2 id=&#34;t5-vs-bart-对比&#34;&gt;T5 vs BART 对比&#xD;&#xA;&lt;/h2&gt;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;维度&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;T5&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;BART&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;架构&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Encoder-Decoder&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Encoder-Decoder&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;预训练目标&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Span corruption（预测被遮蔽片段）&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;去噪重建（重建整个原文）&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;加噪方式&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;连续片段替换为 sentinel&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Text infilling + 句子打乱&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;优势任务&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;分类、翻译、多任务统一&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;摘要、生成&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;位置编码&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;相对位置偏置&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;绝对位置编码（学习）&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;参数量&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;60M - 11B&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;140M - 400M&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;&lt;strong&gt;核心差异&lt;/strong&gt;：T5 只预测被破坏的部分，BART 重建整个序列。前者更高效，后者对生成任务更友好。&lt;/p&gt;&#xA;&lt;h2 id=&#34;encoder-decoder-的兴衰&#34;&gt;Encoder-Decoder 的兴衰&#xD;&#xA;&lt;/h2&gt;&lt;p&gt;2020 年后，Decoder-only 逐渐成为主流（GPT-3、LLaMA、DeepSeek 都是 Decoder-only）。为什么？&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&lt;strong&gt;规模效率&lt;/strong&gt;：Decoder-only 没有 encoder-decoder 之间的通信开销，同样参数量下更&amp;quot;深&amp;quot;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;训练简单&lt;/strong&gt;：只需一个语言模型目标，不需要设计噪声策略&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;通用性&lt;/strong&gt;：in-context learning 让&amp;quot;理解&amp;quot;任务也能用生成范式解决&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;但 Encoder-Decoder 没有消失：T5 依然是很多 RAG、翻译、摘要系统的底座，Flan-T5 至今是开源小模型的重要选择。&lt;/p&gt;&#xA;&lt;h2 id=&#34;技术启示&#34;&gt;技术启示&#xD;&#xA;&lt;/h2&gt;&lt;ol&gt;&#xA;&lt;li&gt;&lt;strong&gt;接口统一 &amp;gt; 架构统一&lt;/strong&gt;：T5 的 text-to-text 证明了&amp;quot;统一接口&amp;quot;的价值，这个思想后来被 instruction tuning 继承&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;去噪目标的设计空间很大&lt;/strong&gt;：T5 的 span corruption 和 BART 的 text infilling 都是去噪，但细节决定任务适配性&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;消融实验比架构创新更稀缺&lt;/strong&gt;：T5 论文最有价值的是那张消融表，不是模型本身&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;h2 id=&#34;参考资料&#34;&gt;参考资料&#xD;&#xA;&lt;/h2&gt;&lt;ul&gt;&#xA;&lt;li&gt;Raffel, C., et al. (2019). &lt;em&gt;Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer&lt;/em&gt;. arXiv:1910.10683.&lt;/li&gt;&#xA;&lt;li&gt;Lewis, M., et al. (2019). &lt;em&gt;BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension&lt;/em&gt;. arXiv:1910.13461.&lt;/li&gt;&#xA;&lt;li&gt;Hugging Face T5 文档：https://huggingface.co/docs/transformers/model_doc/t5&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;</description>
        </item></channel>
</rss>
