<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE ArticleSet PUBLIC "-//NLM//DTD PubMed 2.7//EN" "https://dtd.nlm.nih.gov/ncbi/pubmed/in/PubMed.dtd">
<ArticleSet>
<Article>
<Journal>
				<PublisherName>Shahrood University of Technology</PublisherName>
				<JournalTitle>Journal of AI and Data Mining</JournalTitle>
				<Issn>2322-5211</Issn>
				<Volume>12</Volume>
				<Issue>3</Issue>
				<PubDate PubStatus="epublish">
					<Year>2024</Year>
					<Month>07</Month>
					<Day>01</Day>
				</PubDate>
			</Journal>
<ArticleTitle>A Transformer-Based Approach with Contextual Position Encoding for Robust Persian Text Recognition in the wild</ArticleTitle>
<VernacularTitle></VernacularTitle>
			<FirstPage>455</FirstPage>
			<LastPage>464</LastPage>
			<ELocationID EIdType="pii">3343</ELocationID>
			
<ELocationID EIdType="doi">10.22044/jadm.2024.14669.2569</ELocationID>
			
			<Language>EN</Language>
<AuthorList>
<Author>
					<FirstName>Zobeir</FirstName>
					<LastName>Raisi</LastName>
<Affiliation>Electrical Engineering Department, Chabahar Maritime University, Chabahar, Iran.</Affiliation>

</Author>
<Author>
					<FirstName>Vali Mohammad</FirstName>
					<LastName>Nazarzehi</LastName>
<Affiliation>Electrical Engineering Department, Chabahar Maritime University, Chabahar, Iran.</Affiliation>

</Author>
</AuthorList>
				<PublicationType>Journal Article</PublicationType>
			<History>
				<PubDate PubStatus="received">
					<Year>2024</Year>
					<Month>07</Month>
					<Day>15</Day>
				</PubDate>
			</History>
		<Abstract>The Persian language presents unique challenges for scene text recognition due to its distinctive script. Despite advancements in AI, recognition in non-Latin scripts like Persian still faces difficulties. In this paper, we extend the vanilla transformer architecture to recognize arbitrary shapes of Persian text instances. We apply Contextual Position Encoding (CPE) to the baseline transformer architecture to improve the recognition of Persian scripts in wild images, especially for oriented and spaced characters. The CPE utilizes position information to generate contrastive data pairs that help better in capturing Persian characters written in a different direction. Moreover, we evaluate several state-of-the-art deep-learning models using our prepared challenging Persian scene text recognition dataset and develop a transformer-based architecture to enhance recognition accuracy. Our proposed scene text recognition architecture achieves superior word recognition accuracy compared to existing methods on a real-world Persian text dataset.</Abstract>
		<ObjectList>
			<Object Type="keyword">
			<Param Name="value">Scene Text Recognition</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">Persian Scripts</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">Contextual Position Encoding</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">Transformers</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">deep learning</Param>
			</Object>
		</ObjectList>
<ArchiveCopySource DocType="pdf">https://jad.shahroodut.ac.ir/article_3343_19cfbdd82009723fd36922d0d9c0f53b.pdf</ArchiveCopySource>
</Article>
</ArticleSet>
