#include using namespace std; templateistream &operator>>(istream&,pair&); templateistream &operator>>(istream&,tuple&a); templateistream &operator>>(istream&is,vector&a); templateistream &operator>>(istream&is,array&a); template istream &operator>>(istream&is,pair&a){ is>>a.first>>a.second; return is; } template void read_tuple(istream&is,tuple&a){ if constexpr(pos>::value){ is>>get(a); read_tuple(is,a); } } template istream &operator>>(istream&is,tuple&a){ read_tuple<0>(is,a); return is; } template istream &operator>>(istream&is,vector&a){ for(T&x:a)is>>x; return is; } template istream &operator>>(istream&is,array&a){ for(T&x:a)is>>x; return is; } templateostream &operator<<(ostream&os,const pair&); templateostream &operator<<(ostream&os,const tuple&); templateostream &operator<<(ostream&os,const vector&); templateostream &operator<<(ostream&os,priority_queue); templateostream &operator<<(ostream&os,queue); templateostream &operator<<(ostream&os,deque); templateostream &operator<<(ostream&os,stack); templateostream &operator<<(ostream&os,const array&); templateostream &operator<<(ostream&os,const map&); templateostream &operator<<(ostream&os,const unordered_map&); templateostream &operator<<(ostream&os,const set&); templateostream &operator<<(ostream&os,const multiset&); templateostream &operator<<(ostream&os,const unordered_set&); template ostream &operator<<(ostream&os,const pair&a){ os< void write_tuple(ostream&os,const tuple&a){ if constexpr(pos>::value){ if constexpr(pos>0)os<<' '; os<(a); write_tuple(os,a); } } template ostream &operator<<(ostream&os,const tuple&a){ write_tuple<0>(os,a); return os; } template ostream &operator<<(ostream&os,const vector&a){ os<<'{'; for(int i=0;i<(int)a.size();i++){ os< ostream &operator<<(ostream&os,priority_queuea){ os<<'{'; if(!a.empty()){ os< ostream &operator<<(ostream&os,queuea){ os<<'{'; if(!a.empty()){ os< ostream &operator<<(ostream&os,dequea){ os<<'{'; if(!a.empty()){ os< ostream &operator<<(ostream&os,stacka){ os<<'{'; if(!a.empty()){ os< ostream &operator<<(ostream&os,const array&a){ os<<'{'; for(int i=0;i<(int)a.size();i++){ os< ostream &operator<<(ostream&os,const map&a){ if(a.empty()){ os<<"{}"; return os; } auto itr=a.begin(); os<<"{["<first<<","<second<<']'; while(++itr!=a.end())os<<",["<first<<','<second<<']'; os<<'}'; return os; } template ostream &operator<<(ostream&os,const unordered_map&a){ if(a.empty()){ os<<"{}"; return os; } auto itr=a.begin(); os<<"{["<first<<","<second<<']'; while(++itr!=a.end())os<<",["<first<<','<second<<']'; os<<'}'; return os; } template ostream &operator<<(ostream&os,const set&a){ if(a.empty()){ os<<"{}"; return os; } auto itr=a.begin(); os<<'{'<<*itr; while(++itr!=a.end())os<<','<<*itr; os<<'}'; return os; } template ostream &operator<<(ostream&os,const multiset&a){ if(a.empty()){ os<<"{}"; return os; } auto itr=a.begin(); os<<'{'<<*itr; while(++itr!=a.end())os<<','<<*itr; os<<'}'; return os; } template ostream &operator<<(ostream&os,const unordered_set&a){ if(a.empty()){ os<<"{}"; return os; } auto itr=a.begin(); os<<'{'<<*itr; while(++itr!=a.end())os<<','<<*itr; os<<'}'; return os; } using namespace std; using ll=long long; using ull=unsigned long long; using P=pair; templateusing minque=priority_queue,greater>; templatebool chmax(T &a,const T &b){return (abool chmin(T &a,const T &b){return (a>b?(a=b,true):false);} templatevoid operator++(pair&a,int){a.first++,a.second++;} templatevoid operator--(pair&a,int){a.first--,a.second--;} templatevoid operator++(vector&a,int){for(auto &i:a)i++;} templatevoid operator--(vector&a,int){for(auto &i:a)i--;} #define overload3(_1,_2,_3,name,...) name #define rep1(i,n) for(int i=0;i<(int)(n);i++) #define rep2(i,l,r) for(int i=(int)(l);i<(int)(r);i++) #define rep(...) overload3(__VA_ARGS__,rep2,rep1)(__VA_ARGS__) #define reps(i,l,r) rep2(i,l,r) #define all(x) x.begin(),x.end() #define pcnt(x) __builtin_popcountll(x) #define fin(x) return cout<<(x)<<'\n',static_cast(0) #define yn(x) cout<<((x)?"Yes\n":"No\n") #define uniq(x) sort(all(x)),x.erase(unique(all(x)),x.end()) template inline int fkey(vector&z,T key){return lower_bound(z.begin(),z.end(),key)-z.begin();} ll myceil(ll a,ll b){return (a+b-1)/b;} template auto vec(const int (&d)[n],const T &init=T()){ if constexpr (id(d,init)); else return init; } #ifdef LOCAL #include #define SWITCH(a,b) (a) #else #define debug(...) static_cast(0) #define debugg(...) static_cast(0) #define SWITCH(a,b) (b) #endif struct Timer{ clock_t start; Timer(){ start=clock(); ios::sync_with_stdio(false); cin.tie(nullptr); cout<>testcase; for(int i=0;i #include #include constexpr bool isprime_constexpr(unsigned long long n){ if(n==998244353)return true; if(n==1000000007)return true; if(n<64)return 2891462833508853932ll>>n&1; if(n%2==0)return false; unsigned long long d=n-1; int s=0; while(!(d&1))d>>=1,s++; int q=63; while(!(d>>q))q--; unsigned long long r=n; for(int i=0;i<5;i++)r*=2-r*n; auto redc=[&r,&n](__uint128_t x)->unsigned long long { x=(x+__uint128_t((unsigned long long)x*-r)*n)>>64; return x>=n?x-n:x; }; __uint128_t r2=-__uint128_t(n)%n; unsigned long long one=redc(r2); for(unsigned long long base:{2,325,9375,28178,450775,9780504,1795265022}){ if(base%n==0)continue; unsigned long long a=base=redc((base%n)*r2); for(int i=q-1;i>=0;i--){ a=redc(__uint128_t(a)*a); if(d>>i&1)a=redc(__uint128_t(a)*base); } if(a==one)continue; for(int i=1;a!=n-one;i++){ if(i>=s)return false; a=redc(__uint128_t(a)*a); } } return true; } constexpr std::pairext_gcd(long long a,long long b){ if(b==0)return std::make_pair(1,0); auto [x,y]=ext_gcd(b,a%b); std::swap(x,y); return std::make_pair(x,y-a/b*x); } template constexpr std::pair inv_mod(T a,T b){ a%=b; if(a<0)a+=b; if(a==0)return std::make_pair(b,0); T s=b,t=a; T m0=0,m1=1; while(t){ T u=s/t; s-=t*u; m0-=m1*u; std::swap(s,t); std::swap(m0,m1); } if(m0<0)m0+=b/s; return std::make_pair(s,m0); } template struct modint{ static_assert(1<=m&&m<(1ull<<63)); using value_type=std::conditional_t<((m>>31)==0),uint32_t,uint64_t>; using mul_type=std::conditional_t<((m>>31)==0),uint64_t,__uint128_t>; private: value_type v; static constexpr value_type umod=m; constexpr modint sqrt_impl()const{ if(this->val()<=1)return *this; if(umod%8==1){ modint b=2; while(b.pow((umod-1)/2).val()==1)b++; value_type m2=umod-1; int e=0; while(m2%2==0)m2>>=1,e++; modint x=this->pow((m2-1)/2); modint y=(*this)*x*x; x*=*this; modint z=b.pow(m2); while(y.val()!=1){ int j=0; modint t=y; while(t.val()!=1)t*=t,j++; z=z.pow((value_type(1))<<(e-j-1)); x*=z; z*=z; y*=z; e=j; } return x; } else if(umod%8==5){ modint res=this->pow((umod+3)/8); if((res*res).val()==this->val())return res; else return res*modint(2).pow((umod-1)/4); } else return this->pow((umod+1)/4); } template||std::is_same_v,std::nullptr_t> =nullptr> static constexpr value_type take_mod(U x){ if constexpr(std::numeric_limits::max()>61)+(x&umod); if(res>=umod)res-=umod; return res; } if constexpr(umod==(1ull<<61)-(1ull<<24)+1){ value_type high=x>>61,low=x&((1ull<<61)-1); mul_type t=low+(mul_type(high)<<24)-high; high=t>>61,low=t&((1ull<<61)-1); low=low+(mul_type(high)<<24)-high; if(low>=umod)low-=umod; return low; } return x%umod; } public: constexpr modint():v(0){} template||std::is_same_v,std::nullptr_t> =nullptr> constexpr modint(U x){ x%=std::make_signed_t(umod); v=x>=0?x:x+umod; } template||std::is_same_v,std::nullptr_t> =nullptr> constexpr modint(U x):v(take_mod(x)){} static constexpr value_type mod(){return umod;} template static constexpr modint raw(U x){ modint res; res.v=x; return res; } constexpr std::make_signed_t val()const{return v;} constexpr modint &operator+=(const modint&b){ this->v+=b.v; if(this->v>=umod)this->v-=umod; return *this; } constexpr modint &operator-=(const modint&b){ this->v-=b.v; if(this->v>=umod)this->v+=umod; return *this; } constexpr modint &operator*=(const modint&b){ this->v=take_mod(mul_type(this->v)*mul_type(b.v)); return *this; } constexpr modint &operator/=(const modint&b){return *this*=b.inv();} constexpr modint operator+()const{return *this;} constexpr modint operator-()const{return modint()-*this;} friend constexpr modint operator+(const modint&a,const modint&b){return modint(a)+=b;} friend constexpr modint operator-(const modint&a,const modint&b){return modint(a)-=b;} friend constexpr modint operator*(const modint&a,const modint&b){return modint(a)*=b;} friend constexpr modint operator/(const modint&a,const modint&b){return modint(a)/=b;} constexpr auto operator<=>(const modint&)const=default; constexpr modint operator++(int){ modint res=*this; this->v++; if(this->v==umod)this->v=0; return res; } constexpr modint operator--(int){ modint res=*this; if(this->v==0)this->v=umod; this->v--; return res; } template constexpr modint pow(U k)const{ if constexpr(std::is_signed_v){ assert(0<=k); } modint res=1,a(*this); while(k){ if(k&1)res*=a; a*=a; k>>=1; } return res; } constexpr modint inv()const{ if constexpr(isprime_constexpr(umod)){ if(std::is_constant_evaluated()){ if(v==0){ throw "no inverse"; } } else assert(v!=0); return pow(umod-2); } else{ modint res; auto [g,x]=inv_mod>(this->v,umod); if(std::is_constant_evaluated()){ if(g!=1){ throw "no inverse"; } } else assert(g==1); res.v=x; return res; } } std::optionalsqrt()const{ if(this->val()<=1||this->pow((umod-1)/2)==1)return std::make_optional(this->sqrt_impl()); else return std::nullopt; } friend std::istream &operator>>(std::istream&is,modint&b){ long long a; is>>a; b=modint(a); return is; } friend std::ostream &operator<<(std::ostream&os,const modint&b){ os< struct std::hash>{ std::size_t operator()(modintx)const{ return std::hash::value_type>(x.val()); } }; using mint998=modint<998244353>; using mint107=modint<1000000007>; using mint61=modint<2305843009213693951>; using mint6124=modint<2305843009196916737>; #define NTT_SIMD #include constexpr int factorize_constexpr(unsigned long long n,unsigned long long*a){ if(n<=1)return 0; int ptr=0; while(n%2==0){ a[ptr++]=2; n/=2; } while(n>1){ if(isprime_constexpr(n)){ a[ptr++]=n; break; } unsigned long long pf=n; unsigned long long x=0,y=0; int c=1; do{ x=((__uint128_t)x*x+c)%pf; y=((__uint128_t)y*y+c)%pf; y=((__uint128_t)y*y+c)%pf; unsigned long long g=std::gcd(x>y?x-y:y-x,pf); if(g==pf){ c++; x=y=0; continue; } if(g>1)pf=g; }while(!isprime_constexpr(pf)); while(n%pf==0){ a[ptr++]=pf; n/=pf; } } return ptr; } template constexpr std::enable_if_t<(std::numeric_limits::digits<=32),T>pow_mod(T a,T n,T mod){ using u64=unsigned long long; u64 res=1; while(n>0){ if(n&1)res=((u64)res*a)%mod; a=((u64)a*a)%mod; n>>=1; } return T(res); } template constexpr std::enable_if_t<(std::numeric_limits::digits>32),T>pow_mod(T a,T n,T mod){ using u128=__uint128_t; u128 res=1; while(n>0){ if(n&1)res=((u128)res*a)%mod; a=((u128)a*a)%mod; n>>=1; } return T(res); } namespace Random{ constexpr unsigned long long to_seed(const char*s){ unsigned long long h=14695981039346656037ULL; while(*s){ h^=static_cast(*s++); h*=1099511628211ULL; } return h; } constexpr unsigned long long constexpr_random_seed=(to_seed(__TIME__)*0x9e3779b97f4a7c15ULL)^to_seed(__DATE__); constexpr unsigned long long next_value(unsigned long long n){ n^=n<<13; n^=n>>7; n^=n<<17; return n; } } constexpr unsigned long long primitive_root_constexpr(unsigned long long x){ if(!isprime_constexpr(x))throw "not prime"; if(x==167772161)return 3; if(x==469762049)return 3; if(x==754974721)return 11; if(x==880803841)return 26; if(x==998244353)return 3; if(x==2)return 1; unsigned long long a[64]={}; int ptr=factorize_constexpr(x-1,a); for(unsigned long long v=Random::constexpr_random_seed;;){ unsigned long long g=v%(x-1)+1; bool ok=true; for(int i=0;i0&&a[i-1]==a[i])continue; if(pow_mod(g,(x-1)/a[i],x)==1){ ok=false; break; } } if(ok)return g; v=Random::next_value(v); } } #include template constexpr std::enable_if_t::digits<=32,int>msb(T n){return n==0?-1:31-__builtin_clz(n);} template constexpr std::enable_if_t<(std::numeric_limits::digits>32),int>msb(T n){return n==0?-1:63-__builtin_clzll(n);} template constexpr std::enable_if_t::digits<=32,int>lsb(T n){return n==0?-1:__builtin_ctz(n);} template constexpr std::enable_if_t<(std::numeric_limits::digits>32),int>lsb(T n){return n==0?-1:__builtin_ctzll(n);} template constexpr std::enable_if_t,T>floor_pow2(T n){return n==0?0:T(1)< constexpr std::enable_if_t,T>ceil_pow2(T n){return n<=1?1:T(1)<<(msb(n-1)+1);} template constexpr T safe_div(T a,T b){return a/b-(a%b&&(a^b)<0);} template constexpr T safe_ceil(T a,T b){return a/b+(a%b&&(a^b)>0);} template struct ntt_root{ static_assert(1<=m&&m<(1ull<<63)); static_assert(isprime_constexpr(m)); using value_type=std::conditional_t<((m>>31)==0),uint32_t,uint64_t>; using mul_type=std::conditional_t<((m>>31)==0),uint64_t,__uint128_t>; static constexpr int rank2=lsb(m-1); static constexpr value_type g=primitive_root_constexpr(m); std::arrayroot,invroot; std::arrayrate2,invrate2; std::arrayrate3,invrate3; constexpr ntt_root(){ root[rank2]=pow_mod(g,m>>rank2,m); invroot[rank2]=pow_mod(root[rank2],m-2,m); for(int i=rank2-1;i>=0;i--){ root[i]=(mul_type)root[i+1]*root[i+1]%m; invroot[i]=(mul_type)invroot[i+1]*invroot[i+1]%m; } value_type prod=1,invprod=1; for(int i=0;i struct Montgomery{ static_assert(m%2==1); static_assert(m>=3); static_assert(m<(1u<<30)); static constexpr unsigned r=[](){ unsigned res=m; for(int i=0;i<4;i++)res*=2-m*res; return res; }(); static constexpr unsigned r2=-((unsigned long long)m)%m; static constexpr unsigned reduce(unsigned long long x){ return (x+(unsigned long long)((unsigned)x*(unsigned)(-r))*m)>>32; } static constexpr unsigned mod(){return m;} }; template __attribute__((target("avx2"))) inline __m256i add_simd(__m256i x,__m256i y){ x=_mm256_add_epi32(x,y); x=_mm256_sub_epi32(x,_mm256_set1_epi32(MM::mod()*2)); __m256i mask=_mm256_cmpgt_epi32(_mm256_set1_epi32(0),x); x=_mm256_add_epi32(x,_mm256_and_si256(_mm256_set1_epi32(MM::mod()*2),mask)); return x; } template __attribute__((target("avx2"))) inline __m256i sub_simd(__m256i x,__m256i y){ x=_mm256_sub_epi32(x,y); __m256i mask=_mm256_cmpgt_epi32(_mm256_set1_epi32(0),x); x=_mm256_add_epi32(x,_mm256_and_si256(_mm256_set1_epi32(MM::mod()*2),mask)); return x; } template __attribute__((target("avx2"))) inline void mul_simd(__m256i&x,int y){ __m256i x0246=_mm256_mul_epu32(x,_mm256_set1_epi32(y)); __m256i x0246_2=_mm256_mul_epu32(x0246,_mm256_set1_epi32(-MM::r)); x0246_2=_mm256_mul_epu32(x0246_2,_mm256_set1_epi32(MM::mod())); x0246=_mm256_add_epi64(x0246,x0246_2); __m256i x1357=_mm256_mul_epu32(_mm256_srli_epi64(x,32),_mm256_set1_epi32(y)); __m256i x1357_2=_mm256_mul_epu32(x1357,_mm256_set1_epi32(-MM::r)); x1357_2=_mm256_mul_epu32(x1357_2,_mm256_set1_epi32(MM::mod())); x1357=_mm256_add_epi64(x1357,x1357_2); x=_mm256_blend_epi32(_mm256_srli_epi64(x0246,32),x1357,0b10101010); } template __attribute__((target("avx2"))) inline void mul_simd(__m256i&x,const __m256i&y){ __m256i x0246=_mm256_mul_epu32(x,y); __m256i x0246_2=_mm256_mul_epu32(x0246,_mm256_set1_epi32(-MM::r)); x0246_2=_mm256_mul_epu32(x0246_2,_mm256_set1_epi32(MM::mod())); x0246=_mm256_add_epi64(x0246,x0246_2); __m256i x1357=_mm256_mul_epu32(_mm256_srli_epi64(x,32),_mm256_srli_epi64(y,32)); __m256i x1357_2=_mm256_mul_epu32(x1357,_mm256_set1_epi32(-MM::r)); x1357_2=_mm256_mul_epu32(x1357_2,_mm256_set1_epi32(MM::mod())); x1357=_mm256_add_epi64(x1357,x1357_2); x=_mm256_blend_epi32(_mm256_srli_epi64(x0246,32),x1357,0b10101010); } namespace ntt_simd_impl{ alignas(32) unsigned b[1<<24]; template __attribute__((target("avx2"))) void dft_simd(std::vector&a){ using MM=Montgomery; static constexpr ntt_rootr; static constexpr std::arrayrate2_m=[](){ std::arrayres; for(int i=0;i<(int)res.size();i++)res[i]=MM::reduce((unsigned long long)r.rate2[i]*MM::r2); return res; }(); static constexpr std::arrayrate3_m=[](){ std::arrayres; for(int i=0;i<(int)res.size();i++)res[i]=MM::reduce((unsigned long long)r.rate3[i]*MM::r2); return res; }(); alignas(32) static constexpr std::arrayrate4_m=[](){ std::arrayres; unsigned prod=1; for(int i=0;i<=r.rank2-4;i++){ unsigned v=(unsigned long long)r.root[i+4]*prod%MM::mod(); v=MM::reduce((unsigned long long)v*MM::r2); res[i*8]=MM::reduce(MM::r2); for(int j=1;j<8;j++)res[i*8+j]=MM::reduce((unsigned long long)res[i*8+j-1]*v); prod=(unsigned long long)prod*r.invroot[i+4]%MM::mod(); } return res; }(); int h=lsb(a.size()); int len=0; for(int i=0;i<(int)a.size();i++)b[i]=a[i].val(); for(int i=0;i<(int)a.size();i+=8){ __m256i u=_mm256_loadu_si256((__m256i*)(b+i)); mul_simd(u,MM::r2); _mm256_storeu_si256((__m256i*)(b+i),u); } while(len+4(b1,b3); mul_simd(m,imag); __m256i b02=add_simd(b0,b2); __m256i b0n2=sub_simd(b0,b2); __m256i b13=add_simd(b1,b3); _mm256_storeu_si256((__m256i*)(b+i),add_simd(b02,b13)); _mm256_storeu_si256((__m256i*)(b+i+p),sub_simd(b02,b13)); _mm256_storeu_si256((__m256i*)(b+i+p*2),add_simd(b0n2,m)); _mm256_storeu_si256((__m256i*)(b+i+p*3),sub_simd(b0n2,m)); } } for(int s=1;s<(1<(b1,rot); __m256i b2=_mm256_loadu_si256((__m256i*)(b+offset+i+p*2)); mul_simd(b2,rot2); __m256i b3=_mm256_loadu_si256((__m256i*)(b+offset+i+p*3)); mul_simd(b3,rot3); __m256i m=sub_simd(b1,b3); mul_simd(m,imag); __m256i b02=add_simd(b0,b2); __m256i b0n2=sub_simd(b0,b2); __m256i b13=add_simd(b1,b3); _mm256_storeu_si256((__m256i*)(b+offset+i),add_simd(b02,b13)); _mm256_storeu_si256((__m256i*)(b+offset+i+p),sub_simd(b02,b13)); _mm256_storeu_si256((__m256i*)(b+offset+i+p*2),add_simd(b0n2,m)); _mm256_storeu_si256((__m256i*)(b+offset+i+p*3),sub_simd(b0n2,m)); } rot=MM::reduce((unsigned long long)rot*rate3_m[lsb(~(unsigned)s)]); } len+=2; } if(len+4==h){ unsigned rot=MM::reduce(MM::r2); for(int s=0;s<(1<(b1,rot); _mm256_storeu_si256((__m256i*)(b+offset),add_simd(b0,b1)); _mm256_storeu_si256((__m256i*)(b+offset+8),sub_simd(b0,b1)); rot=MM::reduce((unsigned long long)rot*rate2_m[lsb(~(unsigned)s)]); } } unsigned one=MM::reduce(MM::r2); unsigned r2=MM::reduce((unsigned long long)r.root[2]*MM::r2); unsigned r3=MM::reduce((unsigned long long)r.root[3]*MM::r2); unsigned r3_2=MM::reduce((unsigned long long)r3*r3); unsigned r3_3=MM::reduce((unsigned long long)r3_2*r3); __m256i p1=_mm256_set_epi32(r3_3,r3_2,r3,one,one,one,one,one); __m256i p2=_mm256_set_epi32(r2,one,one,one,r2,one,one,one); __m256i rot=_mm256_set1_epi32(one); for(int s=0;s<(int)a.size()/8;s++){ __m256i u=_mm256_loadu_si256((__m256i*)(b+s*8)); mul_simd(u,rot); __m256i v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b11110000); v=_mm256_permute2x128_si256(v,v,0b01); u=add_simd(u,v); mul_simd(u,p1); v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b11001100); v=_mm256_shuffle_epi32(v,0b01001110); u=add_simd(u,v); mul_simd(u,p2); v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b10101010); v=_mm256_shuffle_epi32(v,0b10110001); u=add_simd(u,v); mul_simd(u,1); _mm256_storeu_si256((__m256i*)(b+s*8),u); for(int i=0;i<8;i++){ if(b[s*8+i]>=T::mod())b[s*8+i]-=T::mod(); a[s*8+i]=T::raw(b[s*8+i]); } mul_simd(rot,_mm256_loadu_si256((__m256i*)(rate4_m.data()+8*lsb(~(unsigned)s)))); } } template __attribute__((target("avx2"))) void idft_simd(std::vector&a){ using MM=Montgomery; static constexpr ntt_rootr; static constexpr std::arrayinvrate3_m=[](){ std::arrayres; for(int i=0;i<(int)res.size();i++)res[i]=MM::reduce((unsigned long long)r.invrate3[i]*MM::r2); return res; }(); alignas(32) static constexpr std::arrayinvrate4_m=[](){ std::arrayres; unsigned prod=1; for(int i=0;i<=r.rank2-4;i++){ unsigned v=(unsigned long long)r.invroot[i+4]*prod%MM::mod(); v=MM::reduce((unsigned long long)v*MM::r2); res[i*8]=MM::reduce(MM::r2); for(int j=1;j<8;j++)res[i*8+j]=MM::reduce((unsigned long long)res[i*8+j-1]*v); prod=(unsigned long long)prod*r.root[i+4]%MM::mod(); } return res; }(); int h=lsb(a.size()); int len=h; for(int i=0;i<(int)a.size();i++)b[i]=a[i].val(); unsigned one=MM::reduce(MM::r2); unsigned r2=MM::reduce((unsigned long long)r.invroot[2]*MM::r2); unsigned r3=MM::reduce((unsigned long long)r.invroot[3]*MM::r2); unsigned r3_2=MM::reduce((unsigned long long)r3*r3); unsigned r3_3=MM::reduce((unsigned long long)r3_2*r3); __m256i p1=_mm256_set_epi32(r3_3,r3_2,r3,one,one,one,one,one); __m256i p2=_mm256_set_epi32(r2,one,one,one,r2,one,one,one); __m256i rot=_mm256_set1_epi32(one); for(int s=0;s<(int)a.size()/8;s++){ __m256i u=_mm256_loadu_si256((__m256i*)(b+s*8)); mul_simd(u,MM::r2); __m256i v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b10101010); v=_mm256_shuffle_epi32(v,0b10110001); u=add_simd(u,v); mul_simd(u,p2); v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b11001100); v=_mm256_shuffle_epi32(v,0b01001110); u=add_simd(u,v); mul_simd(u,p1); v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b11110000); v=_mm256_permute2x128_si256(v,v,0b01); u=add_simd(u,v); mul_simd(u,rot); _mm256_storeu_si256((__m256i*)(b+s*8),u); mul_simd(rot,_mm256_loadu_si256((__m256i*)(invrate4_m.data()+8*lsb(~(unsigned)s)))); } len-=3; while(len>=2){ int p=1<<(h-len); unsigned rot=invrate3_m[0],imag=MM::reduce((unsigned long long)r.invroot[2]*MM::r2); { for(int i=0;i(b0,b1); __m256i b0n1=sub_simd(b0,b1); __m256i b23=add_simd(b2,b3); __m256i k=sub_simd(b2,b3); mul_simd(k,imag); _mm256_storeu_si256((__m256i*)(b+i),add_simd(b01,b23)); b1=add_simd(b0n1,k); _mm256_storeu_si256((__m256i*)(b+i+p),b1); b2=sub_simd(b01,b23); _mm256_storeu_si256((__m256i*)(b+i+p*2),b2); b3=sub_simd(b0n1,k); _mm256_storeu_si256((__m256i*)(b+i+p*3),b3); } } for(int s=1;s<(1<<(len-2));s++){ int offset=s<<(h-len+2); unsigned rot2=MM::reduce((unsigned long long)rot*rot); unsigned rot3=MM::reduce((unsigned long long)rot2*rot); for(int i=0;i(b0,b1); __m256i b0n1=sub_simd(b0,b1); __m256i b23=add_simd(b2,b3); __m256i k=sub_simd(b2,b3); mul_simd(k,imag); _mm256_storeu_si256((__m256i*)(b+offset+i),add_simd(b01,b23)); b1=add_simd(b0n1,k); mul_simd(b1,rot); _mm256_storeu_si256((__m256i*)(b+offset+i+p),b1); b2=sub_simd(b01,b23); mul_simd(b2,rot2); _mm256_storeu_si256((__m256i*)(b+offset+i+p*2),b2); b3=sub_simd(b0n1,k); mul_simd(b3,rot3); _mm256_storeu_si256((__m256i*)(b+offset+i+p*3),b3); } rot=MM::reduce((unsigned long long)rot*invrate3_m[lsb(~(unsigned)s)]); } len-=2; } if(len==1){ for(int i=0;i<(1<<(h-1));i+=8){ __m256i u=_mm256_loadu_si256((__m256i*)(b+i)); __m256i v=_mm256_loadu_si256((__m256i*)(b+(1<<(h-1))+i)); _mm256_storeu_si256((__m256i*)(b+i),add_simd(u,v)); _mm256_storeu_si256((__m256i*)(b+(1<<(h-1))+i),sub_simd(u,v)); } } for(int i=0;i<(int)a.size();i+=8){ __m256i u=_mm256_loadu_si256((__m256i*)(b+i)); mul_simd(u,1); _mm256_storeu_si256((__m256i*)(b+i),u); for(int j=0;j<8;j++){ if(b[i+j]>=T::mod())b[i+j]-=T::mod(); a[i+j]=T::raw(b[i+j]); } } } template __attribute__((target("avx2"))) void transposed_dft_simd(std::vector&a){ using MM=Montgomery; static constexpr ntt_rootr; static constexpr std::arrayrate2_m=[](){ std::arrayres; for(int i=0;i<(int)res.size();i++)res[i]=MM::reduce((unsigned long long)r.rate2[i]*MM::r2); return res; }(); static constexpr std::arrayrate3_m=[](){ std::arrayres; for(int i=0;i<(int)res.size();i++)res[i]=MM::reduce((unsigned long long)r.rate3[i]*MM::r2); return res; }(); alignas(32) static constexpr std::arrayrate4_m=[](){ std::arrayres; unsigned prod=1; for(int i=0;i<=r.rank2-4;i++){ unsigned v=(unsigned long long)r.root[i+4]*prod%MM::mod(); v=MM::reduce((unsigned long long)v*MM::r2); res[i*8]=MM::reduce(MM::r2); for(int j=1;j<8;j++)res[i*8+j]=MM::reduce((unsigned long long)res[i*8+j-1]*v); prod=(unsigned long long)prod*r.invroot[i+4]%MM::mod(); } return res; }(); for(int i=0;i<(int)a.size();i++)b[i]=a[i].val(); int h=lsb(a.size()); int len=h; unsigned one=MM::reduce(MM::r2); unsigned r2=MM::reduce((unsigned long long)r.root[2]*MM::r2); unsigned r3=MM::reduce((unsigned long long)r.root[3]*MM::r2); unsigned r3_2=MM::reduce((unsigned long long)r3*r3); unsigned r3_3=MM::reduce((unsigned long long)r3_2*r3); __m256i p1=_mm256_set_epi32(r3_3,r3_2,r3,one,one,one,one,one); __m256i p2=_mm256_set_epi32(r2,one,one,one,r2,one,one,one); __m256i rot=_mm256_set1_epi32(one); for(int s=0;s<(int)a.size()/8;s++){ __m256i u=_mm256_loadu_si256((__m256i*)(b+s*8)); mul_simd(u,MM::r2); __m256i v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b10101010); v=_mm256_shuffle_epi32(v,0b10110001); u=add_simd(u,v); mul_simd(u,p2); v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b11001100); v=_mm256_shuffle_epi32(v,0b01001110); u=add_simd(u,v); mul_simd(u,p1); v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b11110000); v=_mm256_permute2x128_si256(v,v,0b01); u=add_simd(u,v); mul_simd(u,rot); _mm256_storeu_si256((__m256i*)(b+s*8),u); mul_simd(rot,_mm256_loadu_si256((__m256i*)(rate4_m.data()+8*lsb(~(unsigned)s)))); } len-=3; if(len%2!=0){ unsigned rot=one; for(int s=0;s<(1<<(len-1));s++){ int offset=s<<(h-len+1); __m256i b0=_mm256_loadu_si256((__m256i*)(b+offset)); __m256i b1=_mm256_loadu_si256((__m256i*)(b+offset+8)); _mm256_storeu_si256((__m256i*)(b+offset),add_simd(b0,b1)); b0=sub_simd(b0,b1); mul_simd(b0,rot); _mm256_storeu_si256((__m256i*)(b+offset+8),b0); rot=MM::reduce((unsigned long long)rot*rate2_m[lsb(~(unsigned)s)]); } len--; } while(len>0){ int p=1<<(h-len); unsigned rot=one,imag=MM::reduce((unsigned long long)r.root[2]*MM::r2); for(int s=0;s<(1<<(len-2));s++){ const unsigned rot1=rot,rot2=MM::reduce((unsigned long long)rot*rot),rot3=MM::reduce((unsigned long long)rot*rot2); int offset=s<<(h-len+2); for(int i=0;i(a2,a3); mul_simd(k,imag); __m256i a01=add_simd(a0,a1),a23=add_simd(a2,a3); _mm256_storeu_si256((__m256i*)(b+i+offset),add_simd(a01,a23)); a2=sub_simd(a01,a23); mul_simd(a2,rot2); _mm256_storeu_si256((__m256i*)(b+i+offset+p*2),a2); a01=sub_simd(a0,a1); a1=add_simd(a01,k); a3=sub_simd(a01,k); mul_simd(a1,rot1); mul_simd(a3,rot3); _mm256_storeu_si256((__m256i*)(b+i+offset+p),a1); _mm256_storeu_si256((__m256i*)(b+i+offset+p*3),a3); } if(s+1!=1<<(len-2))rot=MM::reduce((unsigned long long)rot*rate3_m[lsb(~(unsigned)s)]); } len-=2; } for(int i=0;i<(int)a.size();i+=8){ __m256i u=_mm256_loadu_si256((__m256i*)(b+i)); mul_simd(u,1); _mm256_storeu_si256((__m256i*)(b+i),u); for(int j=0;j<8;j++){ if(b[i+j]>=T::mod())b[i+j]-=T::mod(); a[i+j]=T::raw(b[i+j]); } } } template __attribute__((target("avx2"))) void transposed_idft_simd(std::vector&a){ using MM=Montgomery; static constexpr ntt_rootr; static constexpr std::arrayinvrate3_m=[](){ std::arrayres; for(int i=0;i<(int)res.size();i++)res[i]=MM::reduce((unsigned long long)r.invrate3[i]*MM::r2); return res; }(); alignas(32) static constexpr std::arrayinvrate4_m=[](){ std::arrayres; unsigned prod=1; for(int i=0;i<=r.rank2-4;i++){ unsigned v=(unsigned long long)r.invroot[i+4]*prod%MM::mod(); v=MM::reduce((unsigned long long)v*MM::r2); res[i*8]=MM::reduce(MM::r2); for(int j=1;j<8;j++)res[i*8+j]=MM::reduce((unsigned long long)res[i*8+j-1]*v); prod=(unsigned long long)prod*r.root[i+4]%MM::mod(); } return res; }(); unsigned one=MM::reduce(MM::r2); for(int i=0;i<(int)a.size();i++)b[i]=MM::reduce((unsigned long long)a[i].val()*MM::r2); int h=lsb(a.size()); int len=0; if(h%2==0){ for(int i=0;i<(1<<(h-1));i+=8){ __m256i u=_mm256_loadu_si256((__m256i*)(b+i)); __m256i v=_mm256_loadu_si256((__m256i*)(b+(1<<(h-1))+i)); _mm256_storeu_si256((__m256i*)(b+i),add_simd(u,v)); _mm256_storeu_si256((__m256i*)(b+(1<<(h-1))+i),sub_simd(u,v)); } len++; } while(len+3(a1,rot1); __m256i a2=_mm256_loadu_si256((__m256i*)(b+i+offset+p*2)); mul_simd(a2,rot2); __m256i a3=_mm256_loadu_si256((__m256i*)(b+i+offset+p*3)); mul_simd(a3,rot3); __m256i k=sub_simd(a1,a3); mul_simd(k,imag); __m256i a02=add_simd(a0,a2),a13=add_simd(a1,a3); _mm256_storeu_si256((__m256i*)(b+i+offset),add_simd(a02,a13)); _mm256_storeu_si256((__m256i*)(b+i+offset+p),sub_simd(a02,a13)); a02=sub_simd(a0,a2); _mm256_storeu_si256((__m256i*)(b+i+offset+p*2),add_simd(a02,k)); _mm256_storeu_si256((__m256i*)(b+i+offset+p*3),sub_simd(a02,k)); } if(s+1!=1<(u,rot); __m256i v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b11110000); v=_mm256_permute2x128_si256(v,v,0b01); u=add_simd(u,v); mul_simd(u,p1); v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b11001100); v=_mm256_shuffle_epi32(v,0b01001110); u=add_simd(u,v); mul_simd(u,p2); v=u; u=_mm256_blend_epi32(u,sub_simd(_mm256_setzero_si256(),u),0b10101010); v=_mm256_shuffle_epi32(v,0b10110001); u=add_simd(u,v); mul_simd(u,1); _mm256_storeu_si256((__m256i*)(b+s*8),u); for(int j=0;j<8;j++){ if(b[s*8+j]>=T::mod())b[s*8+j]-=T::mod(); a[s*8+j]=T::raw(b[s*8+j]); } mul_simd(rot,_mm256_loadu_si256((__m256i*)(invrate4_m.data()+8*lsb(~(unsigned)s)))); } } } using ntt_simd_impl::dft_simd; using ntt_simd_impl::idft_simd; using ntt_simd_impl::transposed_dft_simd; using ntt_simd_impl::transposed_idft_simd; template void dft(std::vector&a){ using value_type=typename T::value_type; using mul_type=typename T::mul_type; #ifdef NTT_SIMD if constexpr(std::numeric_limits::digits<=32){ if((int)a.size()>=32){ dft_simd(a); return; } } #endif static constexpr ntt_rootr; static constexpr mul_type mod2=(mul_type)T::mod()*T::mod(); int n=a.size(); int h=lsb(n); int len=0; while(len void idft(std::vector&a){ using value_type=typename T::value_type; using mul_type=typename T::mul_type; #ifdef NTT_SIMD if constexpr(std::numeric_limits::digits<=32){ if((int)a.size()>=32){ idft_simd(a); return; } } #endif static constexpr ntt_rootr; int n=a.size(); int h=lsb(n); int len=h; while(len){ if(len==1){ int p=1<<(h-1); for(int i=0;i std::vectorntt_convolution(std::vector a,std::vector b){ int n=a.size(),m=b.size(),s=n+m-1; if(std::min(n,m)<60){ if(n==0||m==0)return {}; std::vectorret(s,0); if(nc(z); for(int i=0;i; void SOLVE(){ int x,y,z; cin>>x>>y>>z; swap(x,z); vector>s(x*2,vector(y*2,string(z*2,'?'))); rep(i,x)rep(j,y){ cin>>s[i][j]; s[i][j].resize(z*2); } rep(i,x)rep(j,y)rep(k,z){ rep(bit,1,8){ s[i+(bit&1)*x][j+(bit>>1&1)*y][k+(bit>>2&1)*z]=s[i][j][k]; } } debug(s); vector>t(x,vector(y)); rep(i,x)rep(j,y)cin>>t[i][j]; int ans=1e9; vector>>val(x,vector>(y,vector(z))); { vectorf(18*x*y*z),g(9*x*y*z); rep(i,x*2)rep(j,y*2)rep(k,z*2){ if(s[i][j][k]=='B'){ f[i*(y*z*9)+j*(z*3)+k]=1; } } rep(i,x)rep(j,y)rep(k,z){ if(t[i][j][k]=='W'){ g[(x-i-1)*(y*z*9)+(y-j-1)*(z*3)+z-k-1]=1; } } f=ntt_convolution(f,g); rep(i,x)rep(j,y)rep(k,z){ val[i][j][k]+=f[(x-1+i)*y*z*9+(y-1+j)*z*3+(z-1+k)].val(); } } { vectorf(18*x*y*z),g(9*x*y*z); rep(i,x*2)rep(j,y*2)rep(k,z*2){ if(s[i][j][k]=='W'){ f[i*(y*z*9)+j*(z*3)+k]=1; } } rep(i,x)rep(j,y)rep(k,z){ if(t[i][j][k]=='B'){ g[(x-i-1)*(y*z*9)+(y-j-1)*(z*3)+z-k-1]=1; } } f=ntt_convolution(f,g); rep(i,x)rep(j,y)rep(k,z){ val[i][j][k]+=f[(x-1+i)*y*z*9+(y-1+j)*z*3+(z-1+k)].val(); } } rep(i,x)rep(j,y)rep(k,z){ int cnt=0; cnt=val[i][j][k]; // rep(i2,x)rep(j2,y)rep(k2,z){ // if(s[i+i2][j+j2][k+k2]=='B'&&t[i2][j2][k2]=='W')cnt++; // if(s[i+i2][j+j2][k+k2]=='W'&&t[i2][j2][k2]=='B')cnt++; // } chmin(ans,cnt); } cout<