Transformer in Transformer
- 类型:arxiv
- 标识:2103.00112
- 链接:https://arxiv.org/abs/2103.00112
- 主题:llm-infra
- 主分类:multimodal
- 形态:method
- 被引:2262
- 被引来源:Semantic Scholar
- S2被引:2262
- OpenAlex被引:1017
- 影响力被引:101
- TLDR:It is pointed out that the attention inside these local patches are also essential for building visual transformers with high performance and a new architecture, namely, Transformer iN Transformer (TNT), is explored.
- OpenAlex ID:W3133696297
- OpenAlex DOI:10.48550/arxiv.2103.00112
- DOI:10.48550/arxiv.2103.00112
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/2103.00112
- OpenAlex更新:2026-08-08
- 待LLM分类:否
- 成熟度:research
- 场景:vision-transformer、architecture、image-recognition
- 标题中文:Transformer in Transformer
- TLDR中文:本工作指出,这些局部 patch 内部的注意力同样是构建高性能视觉 Transformer 的关键,并探索了一种新架构,即 Transformer iN Transformer (TNT)。
- 来源文件:
- [OpenAlex discover]
- [S2 enrich]