72#define DEBUG_TYPE "si-load-store-opt"
80 S_BUFFER_LOAD_SGPR_IMM,
99 unsigned char NumVAddrs = 0;
102 bool SOffset =
false;
110const unsigned MaxAddressRegs = 12 + 1 + 1;
112class SILoadStoreOptimizer {
121 InstClassEnum InstClass;
125 int AddrIdx[MaxAddressRegs];
127 unsigned NumAddresses;
130 bool hasSameBaseAddress(
const CombineInfo &CI) {
131 if (NumAddresses != CI.NumAddresses)
135 for (
unsigned i = 0; i < NumAddresses; i++) {
138 if (AddrReg[i]->isImm() || AddrRegNext.
isImm()) {
139 if (AddrReg[i]->isImm() != AddrRegNext.
isImm() ||
157 for (
unsigned i = 0; i < NumAddresses; ++i) {
166 if (!AddrOp->
isReg())
172 AddrOp->
getReg() != AMDGPU::SGPR_NULL)
191 struct BaseRegisters {
195 unsigned LoSubReg = 0;
196 unsigned HiSubReg = 0;
198 bool UseV64Pattern =
false;
220 static bool dmasksCanBeCombined(
const CombineInfo &CI,
222 const CombineInfo &Paired);
223 static bool offsetsCanBeCombined(CombineInfo &CI,
const GCNSubtarget &STI,
224 CombineInfo &Paired,
bool Modify =
false);
225 static bool widthsFit(
const GCNSubtarget &STI,
const CombineInfo &CI,
226 const CombineInfo &Paired);
227 unsigned getNewOpcode(
const CombineInfo &CI,
const CombineInfo &Paired);
228 static std::pair<unsigned, unsigned> getSubRegIdxs(
const CombineInfo &CI,
229 const CombineInfo &Paired);
231 getTargetRegisterClass(
const CombineInfo &CI,
232 const CombineInfo &Paired)
const;
235 CombineInfo *checkAndPrepareMerge(CombineInfo &CI, CombineInfo &Paired);
237 void copyToDestRegs(CombineInfo &CI, CombineInfo &Paired,
241 Register copyFromSrcRegs(CombineInfo &CI, CombineInfo &Paired,
245 unsigned read2Opcode(
unsigned EltSize)
const;
246 unsigned read2ST64Opcode(
unsigned EltSize)
const;
248 mergeRead2Pair(CombineInfo &CI, CombineInfo &Paired,
251 unsigned write2Opcode(
unsigned EltSize)
const;
252 unsigned write2ST64Opcode(
unsigned EltSize)
const;
253 unsigned getWrite2Opcode(
const CombineInfo &CI)
const;
256 mergeWrite2Pair(CombineInfo &CI, CombineInfo &Paired,
259 mergeImagePair(CombineInfo &CI, CombineInfo &Paired,
262 mergeSMemLoadImmPair(CombineInfo &CI, CombineInfo &Paired,
265 mergeBufferLoadPair(CombineInfo &CI, CombineInfo &Paired,
268 mergeBufferStorePair(CombineInfo &CI, CombineInfo &Paired,
271 mergeTBufferLoadPair(CombineInfo &CI, CombineInfo &Paired,
274 mergeTBufferStorePair(CombineInfo &CI, CombineInfo &Paired,
277 mergeFlatLoadPair(CombineInfo &CI, CombineInfo &Paired,
280 mergeFlatStorePair(CombineInfo &CI, CombineInfo &Paired,
284 int32_t NewOffset)
const;
285 void updateAsyncLDSAddress(
MachineInstr &
MI, int32_t OffsetDiff)
const;
290 MemAddress &Addr)
const;
299 std::list<std::list<CombineInfo> > &MergeableInsts)
const;
304 std::list<std::list<CombineInfo>> &MergeableInsts)
const;
307 const CombineInfo &Paired);
309 static InstClassEnum getCommonInstClass(
const CombineInfo &CI,
310 const CombineInfo &Paired);
312 bool optimizeInstsWithSameBaseAddr(std::list<CombineInfo> &MergeList,
313 bool &OptimizeListAgain);
314 bool optimizeBlock(std::list<std::list<CombineInfo> > &MergeableInsts);
329 StringRef getPassName()
const override {
return "SI Load Store Optimizer"; }
344 const unsigned Opc =
MI.getOpcode();
350 if (
TII.isImage(
MI)) {
352 TII.getNamedOperand(
MI, AMDGPU::OpName::dmask)->getImm();
360 case AMDGPU::S_BUFFER_LOAD_DWORD_IMM:
361 case AMDGPU::S_BUFFER_LOAD_DWORD_SGPR_IMM:
362 case AMDGPU::S_LOAD_DWORD_IMM:
363 case AMDGPU::GLOBAL_LOAD_DWORD:
364 case AMDGPU::GLOBAL_LOAD_DWORD_SADDR:
365 case AMDGPU::GLOBAL_STORE_DWORD:
366 case AMDGPU::GLOBAL_STORE_DWORD_SADDR:
367 case AMDGPU::FLAT_LOAD_DWORD:
368 case AMDGPU::FLAT_STORE_DWORD:
369 case AMDGPU::FLAT_LOAD_DWORD_SADDR:
370 case AMDGPU::FLAT_STORE_DWORD_SADDR:
372 case AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM:
373 case AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM:
374 case AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM_ec:
375 case AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM_ec:
376 case AMDGPU::S_LOAD_DWORDX2_IMM:
377 case AMDGPU::S_LOAD_DWORDX2_IMM_ec:
378 case AMDGPU::GLOBAL_LOAD_DWORDX2:
379 case AMDGPU::GLOBAL_LOAD_DWORDX2_SADDR:
380 case AMDGPU::GLOBAL_STORE_DWORDX2:
381 case AMDGPU::GLOBAL_STORE_DWORDX2_SADDR:
382 case AMDGPU::FLAT_LOAD_DWORDX2:
383 case AMDGPU::FLAT_STORE_DWORDX2:
384 case AMDGPU::FLAT_LOAD_DWORDX2_SADDR:
385 case AMDGPU::FLAT_STORE_DWORDX2_SADDR:
387 case AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM:
388 case AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM:
389 case AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM_ec:
390 case AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM_ec:
391 case AMDGPU::S_LOAD_DWORDX3_IMM:
392 case AMDGPU::S_LOAD_DWORDX3_IMM_ec:
393 case AMDGPU::GLOBAL_LOAD_DWORDX3:
394 case AMDGPU::GLOBAL_LOAD_DWORDX3_SADDR:
395 case AMDGPU::GLOBAL_STORE_DWORDX3:
396 case AMDGPU::GLOBAL_STORE_DWORDX3_SADDR:
397 case AMDGPU::FLAT_LOAD_DWORDX3:
398 case AMDGPU::FLAT_STORE_DWORDX3:
399 case AMDGPU::FLAT_LOAD_DWORDX3_SADDR:
400 case AMDGPU::FLAT_STORE_DWORDX3_SADDR:
402 case AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM:
403 case AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM:
404 case AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM_ec:
405 case AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM_ec:
406 case AMDGPU::S_LOAD_DWORDX4_IMM:
407 case AMDGPU::S_LOAD_DWORDX4_IMM_ec:
408 case AMDGPU::GLOBAL_LOAD_DWORDX4:
409 case AMDGPU::GLOBAL_LOAD_DWORDX4_SADDR:
410 case AMDGPU::GLOBAL_STORE_DWORDX4:
411 case AMDGPU::GLOBAL_STORE_DWORDX4_SADDR:
412 case AMDGPU::FLAT_LOAD_DWORDX4:
413 case AMDGPU::FLAT_STORE_DWORDX4:
414 case AMDGPU::FLAT_LOAD_DWORDX4_SADDR:
415 case AMDGPU::FLAT_STORE_DWORDX4_SADDR:
417 case AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM:
418 case AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM:
419 case AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM_ec:
420 case AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM_ec:
421 case AMDGPU::S_LOAD_DWORDX8_IMM:
422 case AMDGPU::S_LOAD_DWORDX8_IMM_ec:
424 case AMDGPU::DS_READ_B32:
425 case AMDGPU::DS_READ_B32_gfx9:
426 case AMDGPU::DS_WRITE_B32:
427 case AMDGPU::DS_WRITE_B32_gfx9:
429 case AMDGPU::DS_READ_B64:
430 case AMDGPU::DS_READ_B64_gfx9:
431 case AMDGPU::DS_WRITE_B64:
432 case AMDGPU::DS_WRITE_B64_gfx9:
447 case AMDGPU::BUFFER_LOAD_DWORD_BOTHEN:
448 case AMDGPU::BUFFER_LOAD_DWORD_BOTHEN_exact:
449 case AMDGPU::BUFFER_LOAD_DWORD_IDXEN:
450 case AMDGPU::BUFFER_LOAD_DWORD_IDXEN_exact:
451 case AMDGPU::BUFFER_LOAD_DWORD_OFFEN:
452 case AMDGPU::BUFFER_LOAD_DWORD_OFFEN_exact:
453 case AMDGPU::BUFFER_LOAD_DWORD_OFFSET:
454 case AMDGPU::BUFFER_LOAD_DWORD_OFFSET_exact:
455 case AMDGPU::BUFFER_LOAD_DWORD_VBUFFER_BOTHEN:
456 case AMDGPU::BUFFER_LOAD_DWORD_VBUFFER_BOTHEN_exact:
457 case AMDGPU::BUFFER_LOAD_DWORD_VBUFFER_IDXEN:
458 case AMDGPU::BUFFER_LOAD_DWORD_VBUFFER_IDXEN_exact:
459 case AMDGPU::BUFFER_LOAD_DWORD_VBUFFER_OFFEN:
460 case AMDGPU::BUFFER_LOAD_DWORD_VBUFFER_OFFEN_exact:
461 case AMDGPU::BUFFER_LOAD_DWORD_VBUFFER_OFFSET:
462 case AMDGPU::BUFFER_LOAD_DWORD_VBUFFER_OFFSET_exact:
464 case AMDGPU::BUFFER_STORE_DWORD_BOTHEN:
465 case AMDGPU::BUFFER_STORE_DWORD_BOTHEN_exact:
466 case AMDGPU::BUFFER_STORE_DWORD_IDXEN:
467 case AMDGPU::BUFFER_STORE_DWORD_IDXEN_exact:
468 case AMDGPU::BUFFER_STORE_DWORD_OFFEN:
469 case AMDGPU::BUFFER_STORE_DWORD_OFFEN_exact:
470 case AMDGPU::BUFFER_STORE_DWORD_OFFSET:
471 case AMDGPU::BUFFER_STORE_DWORD_OFFSET_exact:
472 case AMDGPU::BUFFER_STORE_DWORD_VBUFFER_BOTHEN:
473 case AMDGPU::BUFFER_STORE_DWORD_VBUFFER_BOTHEN_exact:
474 case AMDGPU::BUFFER_STORE_DWORD_VBUFFER_IDXEN:
475 case AMDGPU::BUFFER_STORE_DWORD_VBUFFER_IDXEN_exact:
476 case AMDGPU::BUFFER_STORE_DWORD_VBUFFER_OFFEN:
477 case AMDGPU::BUFFER_STORE_DWORD_VBUFFER_OFFEN_exact:
478 case AMDGPU::BUFFER_STORE_DWORD_VBUFFER_OFFSET:
479 case AMDGPU::BUFFER_STORE_DWORD_VBUFFER_OFFSET_exact:
492 if (
TII.get(
Opc).mayStore() || !
TII.get(
Opc).mayLoad() ||
501 case AMDGPU::TBUFFER_LOAD_FORMAT_X_BOTHEN:
502 case AMDGPU::TBUFFER_LOAD_FORMAT_X_BOTHEN_exact:
503 case AMDGPU::TBUFFER_LOAD_FORMAT_X_IDXEN:
504 case AMDGPU::TBUFFER_LOAD_FORMAT_X_IDXEN_exact:
505 case AMDGPU::TBUFFER_LOAD_FORMAT_X_OFFEN:
506 case AMDGPU::TBUFFER_LOAD_FORMAT_X_OFFEN_exact:
507 case AMDGPU::TBUFFER_LOAD_FORMAT_X_OFFSET:
508 case AMDGPU::TBUFFER_LOAD_FORMAT_X_OFFSET_exact:
509 case AMDGPU::TBUFFER_LOAD_FORMAT_X_VBUFFER_BOTHEN:
510 case AMDGPU::TBUFFER_LOAD_FORMAT_X_VBUFFER_BOTHEN_exact:
511 case AMDGPU::TBUFFER_LOAD_FORMAT_X_VBUFFER_IDXEN:
512 case AMDGPU::TBUFFER_LOAD_FORMAT_X_VBUFFER_IDXEN_exact:
513 case AMDGPU::TBUFFER_LOAD_FORMAT_X_VBUFFER_OFFEN:
514 case AMDGPU::TBUFFER_LOAD_FORMAT_X_VBUFFER_OFFEN_exact:
515 case AMDGPU::TBUFFER_LOAD_FORMAT_X_VBUFFER_OFFSET:
516 case AMDGPU::TBUFFER_LOAD_FORMAT_X_VBUFFER_OFFSET_exact:
518 case AMDGPU::TBUFFER_STORE_FORMAT_X_OFFEN:
519 case AMDGPU::TBUFFER_STORE_FORMAT_X_OFFEN_exact:
520 case AMDGPU::TBUFFER_STORE_FORMAT_X_OFFSET:
521 case AMDGPU::TBUFFER_STORE_FORMAT_X_OFFSET_exact:
522 case AMDGPU::TBUFFER_STORE_FORMAT_X_VBUFFER_OFFEN:
523 case AMDGPU::TBUFFER_STORE_FORMAT_X_VBUFFER_OFFEN_exact:
524 case AMDGPU::TBUFFER_STORE_FORMAT_X_VBUFFER_OFFSET:
525 case AMDGPU::TBUFFER_STORE_FORMAT_X_VBUFFER_OFFSET_exact:
526 return TBUFFER_STORE;
530 case AMDGPU::S_BUFFER_LOAD_DWORD_IMM:
531 case AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM:
532 case AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM:
533 case AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM:
534 case AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM:
535 case AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM_ec:
536 case AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM_ec:
537 case AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM_ec:
538 case AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM_ec:
539 return S_BUFFER_LOAD_IMM;
540 case AMDGPU::S_BUFFER_LOAD_DWORD_SGPR_IMM:
541 case AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM:
542 case AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM:
543 case AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM:
544 case AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM:
545 case AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM_ec:
546 case AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM_ec:
547 case AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM_ec:
548 case AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM_ec:
549 return S_BUFFER_LOAD_SGPR_IMM;
550 case AMDGPU::S_LOAD_DWORD_IMM:
551 case AMDGPU::S_LOAD_DWORDX2_IMM:
552 case AMDGPU::S_LOAD_DWORDX3_IMM:
553 case AMDGPU::S_LOAD_DWORDX4_IMM:
554 case AMDGPU::S_LOAD_DWORDX8_IMM:
555 case AMDGPU::S_LOAD_DWORDX2_IMM_ec:
556 case AMDGPU::S_LOAD_DWORDX3_IMM_ec:
557 case AMDGPU::S_LOAD_DWORDX4_IMM_ec:
558 case AMDGPU::S_LOAD_DWORDX8_IMM_ec:
560 case AMDGPU::DS_READ_B32:
561 case AMDGPU::DS_READ_B32_gfx9:
562 case AMDGPU::DS_READ_B64:
563 case AMDGPU::DS_READ_B64_gfx9:
565 case AMDGPU::DS_WRITE_B32:
566 case AMDGPU::DS_WRITE_B32_gfx9:
567 case AMDGPU::DS_WRITE_B64:
568 case AMDGPU::DS_WRITE_B64_gfx9:
570 case AMDGPU::GLOBAL_LOAD_DWORD:
571 case AMDGPU::GLOBAL_LOAD_DWORDX2:
572 case AMDGPU::GLOBAL_LOAD_DWORDX3:
573 case AMDGPU::GLOBAL_LOAD_DWORDX4:
574 case AMDGPU::FLAT_LOAD_DWORD:
575 case AMDGPU::FLAT_LOAD_DWORDX2:
576 case AMDGPU::FLAT_LOAD_DWORDX3:
577 case AMDGPU::FLAT_LOAD_DWORDX4:
579 case AMDGPU::GLOBAL_LOAD_DWORD_SADDR:
580 case AMDGPU::GLOBAL_LOAD_DWORDX2_SADDR:
581 case AMDGPU::GLOBAL_LOAD_DWORDX3_SADDR:
582 case AMDGPU::GLOBAL_LOAD_DWORDX4_SADDR:
583 return GLOBAL_LOAD_SADDR;
584 case AMDGPU::GLOBAL_STORE_DWORD:
585 case AMDGPU::GLOBAL_STORE_DWORDX2:
586 case AMDGPU::GLOBAL_STORE_DWORDX3:
587 case AMDGPU::GLOBAL_STORE_DWORDX4:
588 case AMDGPU::FLAT_STORE_DWORD:
589 case AMDGPU::FLAT_STORE_DWORDX2:
590 case AMDGPU::FLAT_STORE_DWORDX3:
591 case AMDGPU::FLAT_STORE_DWORDX4:
593 case AMDGPU::GLOBAL_STORE_DWORD_SADDR:
594 case AMDGPU::GLOBAL_STORE_DWORDX2_SADDR:
595 case AMDGPU::GLOBAL_STORE_DWORDX3_SADDR:
596 case AMDGPU::GLOBAL_STORE_DWORDX4_SADDR:
597 return GLOBAL_STORE_SADDR;
598 case AMDGPU::FLAT_LOAD_DWORD_SADDR:
599 case AMDGPU::FLAT_LOAD_DWORDX2_SADDR:
600 case AMDGPU::FLAT_LOAD_DWORDX3_SADDR:
601 case AMDGPU::FLAT_LOAD_DWORDX4_SADDR:
602 return FLAT_LOAD_SADDR;
603 case AMDGPU::FLAT_STORE_DWORD_SADDR:
604 case AMDGPU::FLAT_STORE_DWORDX2_SADDR:
605 case AMDGPU::FLAT_STORE_DWORDX3_SADDR:
606 case AMDGPU::FLAT_STORE_DWORDX4_SADDR:
607 return FLAT_STORE_SADDR;
622 return Info->BaseOpcode;
627 case AMDGPU::DS_READ_B32:
628 case AMDGPU::DS_READ_B32_gfx9:
629 case AMDGPU::DS_READ_B64:
630 case AMDGPU::DS_READ_B64_gfx9:
631 case AMDGPU::DS_WRITE_B32:
632 case AMDGPU::DS_WRITE_B32_gfx9:
633 case AMDGPU::DS_WRITE_B64:
634 case AMDGPU::DS_WRITE_B64_gfx9:
636 case AMDGPU::S_BUFFER_LOAD_DWORD_IMM:
637 case AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM:
638 case AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM:
639 case AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM:
640 case AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM:
641 case AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM_ec:
642 case AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM_ec:
643 case AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM_ec:
644 case AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM_ec:
645 return AMDGPU::S_BUFFER_LOAD_DWORD_IMM;
646 case AMDGPU::S_BUFFER_LOAD_DWORD_SGPR_IMM:
647 case AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM:
648 case AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM:
649 case AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM:
650 case AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM:
651 case AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM_ec:
652 case AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM_ec:
653 case AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM_ec:
654 case AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM_ec:
655 return AMDGPU::S_BUFFER_LOAD_DWORD_SGPR_IMM;
656 case AMDGPU::S_LOAD_DWORD_IMM:
657 case AMDGPU::S_LOAD_DWORDX2_IMM:
658 case AMDGPU::S_LOAD_DWORDX3_IMM:
659 case AMDGPU::S_LOAD_DWORDX4_IMM:
660 case AMDGPU::S_LOAD_DWORDX8_IMM:
661 case AMDGPU::S_LOAD_DWORDX2_IMM_ec:
662 case AMDGPU::S_LOAD_DWORDX3_IMM_ec:
663 case AMDGPU::S_LOAD_DWORDX4_IMM_ec:
664 case AMDGPU::S_LOAD_DWORDX8_IMM_ec:
665 return AMDGPU::S_LOAD_DWORD_IMM;
666 case AMDGPU::GLOBAL_LOAD_DWORD:
667 case AMDGPU::GLOBAL_LOAD_DWORDX2:
668 case AMDGPU::GLOBAL_LOAD_DWORDX3:
669 case AMDGPU::GLOBAL_LOAD_DWORDX4:
670 case AMDGPU::FLAT_LOAD_DWORD:
671 case AMDGPU::FLAT_LOAD_DWORDX2:
672 case AMDGPU::FLAT_LOAD_DWORDX3:
673 case AMDGPU::FLAT_LOAD_DWORDX4:
674 return AMDGPU::FLAT_LOAD_DWORD;
675 case AMDGPU::GLOBAL_LOAD_DWORD_SADDR:
676 case AMDGPU::GLOBAL_LOAD_DWORDX2_SADDR:
677 case AMDGPU::GLOBAL_LOAD_DWORDX3_SADDR:
678 case AMDGPU::GLOBAL_LOAD_DWORDX4_SADDR:
679 return AMDGPU::GLOBAL_LOAD_DWORD_SADDR;
680 case AMDGPU::GLOBAL_STORE_DWORD:
681 case AMDGPU::GLOBAL_STORE_DWORDX2:
682 case AMDGPU::GLOBAL_STORE_DWORDX3:
683 case AMDGPU::GLOBAL_STORE_DWORDX4:
684 case AMDGPU::FLAT_STORE_DWORD:
685 case AMDGPU::FLAT_STORE_DWORDX2:
686 case AMDGPU::FLAT_STORE_DWORDX3:
687 case AMDGPU::FLAT_STORE_DWORDX4:
688 return AMDGPU::FLAT_STORE_DWORD;
689 case AMDGPU::GLOBAL_STORE_DWORD_SADDR:
690 case AMDGPU::GLOBAL_STORE_DWORDX2_SADDR:
691 case AMDGPU::GLOBAL_STORE_DWORDX3_SADDR:
692 case AMDGPU::GLOBAL_STORE_DWORDX4_SADDR:
693 return AMDGPU::GLOBAL_STORE_DWORD_SADDR;
694 case AMDGPU::FLAT_LOAD_DWORD_SADDR:
695 case AMDGPU::FLAT_LOAD_DWORDX2_SADDR:
696 case AMDGPU::FLAT_LOAD_DWORDX3_SADDR:
697 case AMDGPU::FLAT_LOAD_DWORDX4_SADDR:
698 return AMDGPU::FLAT_LOAD_DWORD_SADDR;
699 case AMDGPU::FLAT_STORE_DWORD_SADDR:
700 case AMDGPU::FLAT_STORE_DWORDX2_SADDR:
701 case AMDGPU::FLAT_STORE_DWORDX3_SADDR:
702 case AMDGPU::FLAT_STORE_DWORDX4_SADDR:
703 return AMDGPU::FLAT_STORE_DWORD_SADDR;
714SILoadStoreOptimizer::getCommonInstClass(
const CombineInfo &CI,
715 const CombineInfo &Paired) {
716 assert(CI.InstClass == Paired.InstClass);
718 if ((CI.InstClass == FLAT_LOAD || CI.InstClass == FLAT_STORE) &&
720 return (CI.InstClass == FLAT_STORE) ? GLOBAL_STORE : GLOBAL_LOAD;
734 Result.SOffset =
true;
740 int VAddr0Idx = AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::vaddr0);
741 if (VAddr0Idx >= 0) {
742 AMDGPU::OpName RsrcName =
743 TII.isMIMG(
Opc) ? AMDGPU::OpName::srsrc : AMDGPU::OpName::rsrc;
744 int RsrcIdx = AMDGPU::getNamedOperandIdx(
Opc, RsrcName);
745 Result.NumVAddrs = RsrcIdx - VAddr0Idx;
762 Result.SOffset =
true;
770 case AMDGPU::S_BUFFER_LOAD_DWORD_SGPR_IMM:
771 case AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM:
772 case AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM:
773 case AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM:
774 case AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM:
775 case AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM_ec:
776 case AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM_ec:
777 case AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM_ec:
778 case AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM_ec:
779 Result.SOffset =
true;
781 case AMDGPU::S_BUFFER_LOAD_DWORD_IMM:
782 case AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM:
783 case AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM:
784 case AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM:
785 case AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM:
786 case AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM_ec:
787 case AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM_ec:
788 case AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM_ec:
789 case AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM_ec:
790 case AMDGPU::S_LOAD_DWORD_IMM:
791 case AMDGPU::S_LOAD_DWORDX2_IMM:
792 case AMDGPU::S_LOAD_DWORDX3_IMM:
793 case AMDGPU::S_LOAD_DWORDX4_IMM:
794 case AMDGPU::S_LOAD_DWORDX8_IMM:
795 case AMDGPU::S_LOAD_DWORDX2_IMM_ec:
796 case AMDGPU::S_LOAD_DWORDX3_IMM_ec:
797 case AMDGPU::S_LOAD_DWORDX4_IMM_ec:
798 case AMDGPU::S_LOAD_DWORDX8_IMM_ec:
801 case AMDGPU::DS_READ_B32:
802 case AMDGPU::DS_READ_B64:
803 case AMDGPU::DS_READ_B32_gfx9:
804 case AMDGPU::DS_READ_B64_gfx9:
805 case AMDGPU::DS_WRITE_B32:
806 case AMDGPU::DS_WRITE_B64:
807 case AMDGPU::DS_WRITE_B32_gfx9:
808 case AMDGPU::DS_WRITE_B64_gfx9:
811 case AMDGPU::GLOBAL_LOAD_DWORD_SADDR:
812 case AMDGPU::GLOBAL_LOAD_DWORDX2_SADDR:
813 case AMDGPU::GLOBAL_LOAD_DWORDX3_SADDR:
814 case AMDGPU::GLOBAL_LOAD_DWORDX4_SADDR:
815 case AMDGPU::GLOBAL_STORE_DWORD_SADDR:
816 case AMDGPU::GLOBAL_STORE_DWORDX2_SADDR:
817 case AMDGPU::GLOBAL_STORE_DWORDX3_SADDR:
818 case AMDGPU::GLOBAL_STORE_DWORDX4_SADDR:
819 case AMDGPU::FLAT_LOAD_DWORD_SADDR:
820 case AMDGPU::FLAT_LOAD_DWORDX2_SADDR:
821 case AMDGPU::FLAT_LOAD_DWORDX3_SADDR:
822 case AMDGPU::FLAT_LOAD_DWORDX4_SADDR:
823 case AMDGPU::FLAT_STORE_DWORD_SADDR:
824 case AMDGPU::FLAT_STORE_DWORDX2_SADDR:
825 case AMDGPU::FLAT_STORE_DWORDX3_SADDR:
826 case AMDGPU::FLAT_STORE_DWORDX4_SADDR:
829 case AMDGPU::GLOBAL_LOAD_DWORD:
830 case AMDGPU::GLOBAL_LOAD_DWORDX2:
831 case AMDGPU::GLOBAL_LOAD_DWORDX3:
832 case AMDGPU::GLOBAL_LOAD_DWORDX4:
833 case AMDGPU::GLOBAL_STORE_DWORD:
834 case AMDGPU::GLOBAL_STORE_DWORDX2:
835 case AMDGPU::GLOBAL_STORE_DWORDX3:
836 case AMDGPU::GLOBAL_STORE_DWORDX4:
837 case AMDGPU::FLAT_LOAD_DWORD:
838 case AMDGPU::FLAT_LOAD_DWORDX2:
839 case AMDGPU::FLAT_LOAD_DWORDX3:
840 case AMDGPU::FLAT_LOAD_DWORDX4:
841 case AMDGPU::FLAT_STORE_DWORD:
842 case AMDGPU::FLAT_STORE_DWORDX2:
843 case AMDGPU::FLAT_STORE_DWORDX3:
844 case AMDGPU::FLAT_STORE_DWORDX4:
851 const SILoadStoreOptimizer &LSO) {
853 unsigned Opc =
MI->getOpcode();
854 InstClass = getInstClass(
Opc, *LSO.TII);
856 if (InstClass == UNKNOWN)
859 DataRC = LSO.getDataRegClass(*
MI);
864 (
Opc == AMDGPU::DS_READ_B64 ||
Opc == AMDGPU::DS_READ_B64_gfx9) ? 8
869 (
Opc == AMDGPU::DS_WRITE_B64 ||
Opc == AMDGPU::DS_WRITE_B64_gfx9) ? 8
872 case S_BUFFER_LOAD_IMM:
873 case S_BUFFER_LOAD_SGPR_IMM:
882 if (InstClass == MIMG) {
887 int OffsetIdx = AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::offset);
888 Offset =
I->getOperand(OffsetIdx).getImm();
891 if (InstClass == TBUFFER_LOAD || InstClass == TBUFFER_STORE) {
895 EltSize = Info->BitsPerComp / 8;
898 Width = getOpcodeWidth(*
I, *LSO.TII);
900 if ((InstClass == DS_READ) || (InstClass == DS_WRITE)) {
902 }
else if (InstClass != MIMG) {
906 AddressRegs Regs = getRegs(
Opc, *LSO.TII);
910 for (
unsigned J = 0; J < Regs.NumVAddrs; J++)
911 AddrIdx[NumAddresses++] =
912 AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::vaddr0) + J;
914 AddrIdx[NumAddresses++] =
915 AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::addr);
917 AddrIdx[NumAddresses++] =
918 AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::sbase);
920 AddrIdx[NumAddresses++] = AMDGPU::getNamedOperandIdx(
921 Opc, isVIMAGEorVSAMPLE ? AMDGPU::OpName::rsrc : AMDGPU::OpName::srsrc);
923 AddrIdx[NumAddresses++] =
924 AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::soffset);
926 AddrIdx[NumAddresses++] =
927 AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::saddr);
929 AddrIdx[NumAddresses++] =
930 AMDGPU::getNamedOperandIdx(
Opc, AMDGPU::OpName::vaddr);
932 AddrIdx[NumAddresses++] = AMDGPU::getNamedOperandIdx(
933 Opc, isVIMAGEorVSAMPLE ? AMDGPU::OpName::samp : AMDGPU::OpName::ssamp);
934 assert(NumAddresses <= MaxAddressRegs);
936 for (
unsigned J = 0; J < NumAddresses; J++)
937 AddrReg[J] = &
I->getOperand(AddrIdx[J]);
943 "SI Load Store Optimizer",
false,
false)
948char SILoadStoreOptimizerLegacy::ID = 0;
953 return new SILoadStoreOptimizerLegacy();
959 for (
const auto &
Op :
MI.operands()) {
969bool SILoadStoreOptimizer::canSwapInstructions(
970 const DenseSet<Register> &ARegDefs,
const DenseSet<Register> &ARegUses,
971 const MachineInstr &
A,
const MachineInstr &
B)
const {
972 if (
A.mayLoadOrStore() &&
B.mayLoadOrStore() &&
973 (
A.mayStore() ||
B.mayStore()) &&
A.mayAlias(AA,
B,
true))
975 for (
const auto &BOp :
B.operands()) {
978 if ((BOp.isDef() || BOp.readsReg()) && ARegDefs.
contains(BOp.getReg()))
980 if (BOp.isDef() && ARegUses.
contains(BOp.getReg()))
989SILoadStoreOptimizer::combineKnownAdjacentMMOs(
const CombineInfo &CI,
990 const CombineInfo &Paired) {
991 const MachineMemOperand *MMOa = *CI.I->memoperands_begin();
992 const MachineMemOperand *MMOb = *Paired.I->memoperands_begin();
1010bool SILoadStoreOptimizer::dmasksCanBeCombined(
const CombineInfo &CI,
1011 const SIInstrInfo &
TII,
1012 const CombineInfo &Paired) {
1013 assert(CI.InstClass == MIMG);
1016 const auto *TFEOp =
TII.getNamedOperand(*CI.I, AMDGPU::OpName::tfe);
1017 const auto *LWEOp =
TII.getNamedOperand(*CI.I, AMDGPU::OpName::lwe);
1019 if ((TFEOp && TFEOp->getImm()) || (LWEOp && LWEOp->getImm()))
1023 AMDGPU::OpName OperandsToMatch[] = {
1024 AMDGPU::OpName::cpol, AMDGPU::OpName::d16, AMDGPU::OpName::unorm,
1025 AMDGPU::OpName::da, AMDGPU::OpName::r128, AMDGPU::OpName::a16};
1027 for (AMDGPU::OpName
op : OperandsToMatch) {
1028 int Idx = AMDGPU::getNamedOperandIdx(CI.I->getOpcode(),
op);
1029 if (AMDGPU::getNamedOperandIdx(Paired.I->getOpcode(),
op) != Idx)
1032 CI.I->getOperand(Idx).getImm() != Paired.I->getOperand(Idx).getImm())
1037 unsigned MaxMask = std::max(CI.DMask, Paired.DMask);
1038 unsigned MinMask = std::min(CI.DMask, Paired.DMask);
1044 if ((1u << AllowedBitsForMin) <= MinMask)
1051 unsigned ComponentCount,
1053 if (ComponentCount > 4)
1072 return NewFormatInfo->
Format;
1085bool SILoadStoreOptimizer::offsetsCanBeCombined(CombineInfo &CI,
1086 const GCNSubtarget &STI,
1087 CombineInfo &Paired,
1089 assert(CI.InstClass != MIMG);
1093 if (CI.Offset == Paired.Offset)
1097 if ((CI.Offset % CI.EltSize != 0) || (Paired.Offset % CI.EltSize != 0))
1100 if (CI.InstClass == TBUFFER_LOAD || CI.InstClass == TBUFFER_STORE) {
1102 const llvm::AMDGPU::GcnBufferFormatInfo *Info0 =
1104 const llvm::AMDGPU::GcnBufferFormatInfo *Info1 =
1116 unsigned NumCombinedComponents = CI.Width + Paired.Width;
1117 if (NumCombinedComponents == 3 && CI.EltSize <= 2)
1118 NumCombinedComponents = 4;
1126 unsigned ElemIndex0 = CI.Offset / CI.EltSize;
1127 unsigned ElemIndex1 = Paired.Offset / Paired.EltSize;
1128 if (ElemIndex0 + CI.Width != ElemIndex1 &&
1129 ElemIndex1 + Paired.Width != ElemIndex0)
1135 unsigned MergedBytes = CI.EltSize * NumCombinedComponents;
1136 unsigned RequiredAlign = std::min(MergedBytes, 4u);
1137 unsigned MinOff = std::min(CI.Offset, Paired.Offset);
1138 if (MinOff % RequiredAlign != 0)
1144 uint32_t EltOffset0 = CI.Offset / CI.EltSize;
1145 uint32_t EltOffset1 = Paired.Offset / CI.EltSize;
1150 if ((CI.InstClass != DS_READ) && (CI.InstClass != DS_WRITE)) {
1151 if (EltOffset0 + CI.Width != EltOffset1 &&
1152 EltOffset1 + Paired.Width != EltOffset0)
1158 if (CI.InstClass == S_LOAD_IMM || CI.InstClass == S_BUFFER_LOAD_IMM ||
1159 CI.InstClass == S_BUFFER_LOAD_SGPR_IMM) {
1165 if (CI.Width != Paired.Width &&
1166 (CI.Width < Paired.Width) == (CI.Offset < Paired.Offset))
1174 if ((EltOffset0 % 64 == 0) && (EltOffset1 % 64) == 0 &&
1177 CI.Offset = EltOffset0 / 64;
1178 Paired.Offset = EltOffset1 / 64;
1187 CI.Offset = EltOffset0;
1188 Paired.Offset = EltOffset1;
1194 uint32_t Min = std::min(EltOffset0, EltOffset1);
1195 uint32_t
Max = std::max(EltOffset0, EltOffset1);
1198 if (((Max - Min) & ~Mask) == 0) {
1207 CI.BaseOff = BaseOff * CI.EltSize;
1208 CI.Offset = (EltOffset0 - BaseOff) / 64;
1209 Paired.Offset = (EltOffset1 - BaseOff) / 64;
1221 CI.BaseOff = BaseOff * CI.EltSize;
1222 CI.Offset = EltOffset0 - BaseOff;
1223 Paired.Offset = EltOffset1 - BaseOff;
1231bool SILoadStoreOptimizer::widthsFit(
const GCNSubtarget &STM,
1232 const CombineInfo &CI,
1233 const CombineInfo &Paired) {
1234 const unsigned Width = (CI.Width + Paired.Width);
1235 switch (CI.InstClass) {
1238 case S_BUFFER_LOAD_IMM:
1239 case S_BUFFER_LOAD_SGPR_IMM:
1249 return STM.hasScalarDwordx3Loads();
1255SILoadStoreOptimizer::getDataRegClass(
const MachineInstr &
MI)
const {
1256 if (
const auto *Dst =
TII->getNamedOperand(
MI, AMDGPU::OpName::vdst)) {
1257 return TRI->getRegClassForReg(*MRI, Dst->getReg());
1259 if (
const auto *Src =
TII->getNamedOperand(
MI, AMDGPU::OpName::vdata)) {
1260 return TRI->getRegClassForReg(*MRI, Src->getReg());
1262 if (
const auto *Src =
TII->getNamedOperand(
MI, AMDGPU::OpName::data0)) {
1263 return TRI->getRegClassForReg(*MRI, Src->getReg());
1265 if (
const auto *Dst =
TII->getNamedOperand(
MI, AMDGPU::OpName::sdst)) {
1266 return TRI->getRegClassForReg(*MRI, Dst->getReg());
1268 if (
const auto *Src =
TII->getNamedOperand(
MI, AMDGPU::OpName::sdata)) {
1269 return TRI->getRegClassForReg(*MRI, Src->getReg());
1276SILoadStoreOptimizer::CombineInfo *
1277SILoadStoreOptimizer::checkAndPrepareMerge(CombineInfo &CI,
1278 CombineInfo &Paired) {
1281 if (CI.InstClass == UNKNOWN || Paired.InstClass == UNKNOWN)
1283 assert(CI.InstClass == Paired.InstClass);
1285 if (getInstSubclass(CI.I->getOpcode(), *
TII) !=
1286 getInstSubclass(Paired.I->getOpcode(), *
TII))
1291 if (CI.InstClass == MIMG) {
1292 if (!dmasksCanBeCombined(CI, *
TII, Paired))
1295 if (!widthsFit(*STM, CI, Paired) || !offsetsCanBeCombined(CI, *STM, Paired))
1299 DenseSet<Register> RegDefs;
1300 DenseSet<Register> RegUses;
1302 if (CI.I->mayLoad()) {
1306 if (!canSwapInstructions(RegDefs, RegUses, *Paired.I, *
MBBI))
1314 if (!canSwapInstructions(RegDefs, RegUses, *CI.I, *
MBBI))
1324 if (CI.InstClass == DS_READ || CI.InstClass == DS_WRITE) {
1325 if (STM->hasNeedsAligned2addrDS() &&
1326 (CI.I->memoperands_empty() ||
1327 (*CI.I->memoperands_begin())->getAlign().value() < CI.Width * 4))
1329 offsetsCanBeCombined(CI, *STM, Paired,
true);
1332 if (CI.InstClass == DS_WRITE) {
1340 const MachineOperand *Data0 =
1341 TII->getNamedOperand(*CI.I, AMDGPU::OpName::data0);
1342 const MachineOperand *Data1 =
1343 TII->getNamedOperand(*Paired.I, AMDGPU::OpName::data0);
1345 const MCInstrDesc &Write2Opc =
TII->get(getWrite2Opcode(CI));
1346 int Data0Idx = AMDGPU::getNamedOperandIdx(Write2Opc.
getOpcode(),
1347 AMDGPU::OpName::data0);
1348 int Data1Idx = AMDGPU::getNamedOperandIdx(Write2Opc.
getOpcode(),
1349 AMDGPU::OpName::data1);
1355 if (
unsigned SubReg = Data0->
getSubReg()) {
1360 if (
unsigned SubReg = Data1->
getSubReg()) {
1378void SILoadStoreOptimizer::copyToDestRegs(
1379 CombineInfo &CI, CombineInfo &Paired,
1381 AMDGPU::OpName OpName,
Register DestReg)
const {
1382 MachineBasicBlock *
MBB = CI.I->getParent();
1384 auto [SubRegIdx0, SubRegIdx1] = getSubRegIdxs(CI, Paired);
1387 const MCInstrDesc &CopyDesc =
TII->get(TargetOpcode::COPY);
1388 auto *Dest0 =
TII->getNamedOperand(*CI.I, OpName);
1389 auto *Dest1 =
TII->getNamedOperand(*Paired.I, OpName);
1394 Dest0->setIsEarlyClobber(
false);
1395 Dest1->setIsEarlyClobber(
false);
1399 .
addReg(DestReg, {}, SubRegIdx0);
1402 .
addReg(DestReg, RegState::Kill, SubRegIdx1);
1408SILoadStoreOptimizer::copyFromSrcRegs(CombineInfo &CI, CombineInfo &Paired,
1411 AMDGPU::OpName OpName)
const {
1412 MachineBasicBlock *
MBB = CI.I->getParent();
1414 auto [SubRegIdx0, SubRegIdx1] = getSubRegIdxs(CI, Paired);
1420 const auto *Src0 =
TII->getNamedOperand(*CI.I, OpName);
1421 const auto *Src1 =
TII->getNamedOperand(*Paired.I, OpName);
1423 BuildMI(*
MBB, InsertBefore,
DL,
TII->get(AMDGPU::REG_SEQUENCE), SrcReg)
1432unsigned SILoadStoreOptimizer::read2Opcode(
unsigned EltSize)
const {
1434 return (EltSize == 4) ? AMDGPU::DS_READ2_B32 : AMDGPU::DS_READ2_B64;
1435 return (EltSize == 4) ? AMDGPU::DS_READ2_B32_gfx9 : AMDGPU::DS_READ2_B64_gfx9;
1438unsigned SILoadStoreOptimizer::read2ST64Opcode(
unsigned EltSize)
const {
1440 return (EltSize == 4) ? AMDGPU::DS_READ2ST64_B32 : AMDGPU::DS_READ2ST64_B64;
1442 return (EltSize == 4) ? AMDGPU::DS_READ2ST64_B32_gfx9
1443 : AMDGPU::DS_READ2ST64_B64_gfx9;
1447SILoadStoreOptimizer::mergeRead2Pair(CombineInfo &CI, CombineInfo &Paired,
1449 MachineBasicBlock *
MBB = CI.I->getParent();
1453 const auto *AddrReg =
TII->getNamedOperand(*CI.I, AMDGPU::OpName::addr);
1455 unsigned NewOffset0 = std::min(CI.Offset, Paired.Offset);
1456 unsigned NewOffset1 = std::max(CI.Offset, Paired.Offset);
1458 CI.UseST64 ? read2ST64Opcode(CI.EltSize) : read2Opcode(CI.EltSize);
1461 (NewOffset0 != NewOffset1) &&
"Computed offset doesn't fit");
1463 const MCInstrDesc &Read2Desc =
TII->get(
Opc);
1472 unsigned BaseSubReg = AddrReg->getSubReg();
1480 BaseRegFlags = RegState::Kill;
1482 TII->getAddNoCarry(*
MBB, InsertBefore,
DL, BaseReg)
1484 .addReg(AddrReg->getReg(), {}, BaseSubReg)
1489 MachineInstrBuilder Read2 =
1491 .
addReg(BaseReg, BaseRegFlags, BaseSubReg)
1497 copyToDestRegs(CI, Paired, InsertBefore,
DL, AMDGPU::OpName::vdst, DestReg);
1499 CI.I->eraseFromParent();
1500 Paired.I->eraseFromParent();
1506unsigned SILoadStoreOptimizer::write2Opcode(
unsigned EltSize)
const {
1508 return (EltSize == 4) ? AMDGPU::DS_WRITE2_B32 : AMDGPU::DS_WRITE2_B64;
1509 return (EltSize == 4) ? AMDGPU::DS_WRITE2_B32_gfx9
1510 : AMDGPU::DS_WRITE2_B64_gfx9;
1513unsigned SILoadStoreOptimizer::write2ST64Opcode(
unsigned EltSize)
const {
1515 return (EltSize == 4) ? AMDGPU::DS_WRITE2ST64_B32
1516 : AMDGPU::DS_WRITE2ST64_B64;
1518 return (EltSize == 4) ? AMDGPU::DS_WRITE2ST64_B32_gfx9
1519 : AMDGPU::DS_WRITE2ST64_B64_gfx9;
1522unsigned SILoadStoreOptimizer::getWrite2Opcode(
const CombineInfo &CI)
const {
1523 return CI.UseST64 ? write2ST64Opcode(CI.EltSize) : write2Opcode(CI.EltSize);
1527 CombineInfo &CI, CombineInfo &Paired,
1529 MachineBasicBlock *
MBB = CI.I->getParent();
1533 const MachineOperand *AddrReg =
1534 TII->getNamedOperand(*CI.I, AMDGPU::OpName::addr);
1535 const MachineOperand *Data0 =
1536 TII->getNamedOperand(*CI.I, AMDGPU::OpName::data0);
1537 const MachineOperand *Data1 =
1538 TII->getNamedOperand(*Paired.I, AMDGPU::OpName::data0);
1540 unsigned NewOffset0 = CI.Offset;
1541 unsigned NewOffset1 = Paired.Offset;
1542 unsigned Opc = getWrite2Opcode(CI);
1544 if (NewOffset0 > NewOffset1) {
1551 (NewOffset0 != NewOffset1) &&
"Computed offset doesn't fit");
1553 const MCInstrDesc &Write2Desc =
TII->get(
Opc);
1558 unsigned BaseSubReg = AddrReg->
getSubReg();
1566 BaseRegFlags = RegState::Kill;
1568 TII->getAddNoCarry(*
MBB, InsertBefore,
DL, BaseReg)
1570 .addReg(AddrReg->
getReg(), {}, BaseSubReg)
1575 MachineInstrBuilder Write2 =
1577 .
addReg(BaseReg, BaseRegFlags, BaseSubReg)
1585 CI.I->eraseFromParent();
1586 Paired.I->eraseFromParent();
1588 LLVM_DEBUG(
dbgs() <<
"Inserted write2 inst: " << *Write2 <<
'\n');
1593SILoadStoreOptimizer::mergeImagePair(CombineInfo &CI, CombineInfo &Paired,
1595 MachineBasicBlock *
MBB = CI.I->getParent();
1599 const unsigned Opcode = getNewOpcode(CI, Paired);
1604 unsigned MergedDMask = CI.DMask | Paired.DMask;
1606 AMDGPU::getNamedOperandIdx(CI.I->getOpcode(), AMDGPU::OpName::dmask);
1608 auto MIB =
BuildMI(*
MBB, InsertBefore,
DL,
TII->get(Opcode), DestReg);
1609 for (
unsigned I = 1,
E = (*CI.I).getNumOperands();
I !=
E; ++
I) {
1611 MIB.addImm(MergedDMask);
1613 MIB.add((*CI.I).getOperand(
I));
1619 assert(CI.I->hasOneMemOperand() && Paired.I->hasOneMemOperand());
1621 MachineInstr *
New = MIB.addMemOperand(combineKnownAdjacentMMOs(CI, Paired));
1623 copyToDestRegs(CI, Paired, InsertBefore,
DL, AMDGPU::OpName::vdata, DestReg);
1625 CI.I->eraseFromParent();
1626 Paired.I->eraseFromParent();
1631 CombineInfo &CI, CombineInfo &Paired,
1633 MachineBasicBlock *
MBB = CI.I->getParent();
1637 const unsigned Opcode = getNewOpcode(CI, Paired);
1642 unsigned MergedOffset = std::min(CI.Offset, Paired.Offset);
1647 assert(CI.I->hasOneMemOperand() && Paired.I->hasOneMemOperand());
1649 MachineInstrBuilder
New =
1651 .
add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::sbase));
1652 if (CI.InstClass == S_BUFFER_LOAD_SGPR_IMM)
1653 New.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::soffset));
1654 New.addImm(MergedOffset);
1655 New.addImm(CI.CPol).addMemOperand(combineKnownAdjacentMMOs(CI, Paired));
1657 copyToDestRegs(CI, Paired, InsertBefore,
DL, AMDGPU::OpName::sdst, DestReg);
1659 CI.I->eraseFromParent();
1660 Paired.I->eraseFromParent();
1665 CombineInfo &CI, CombineInfo &Paired,
1667 MachineBasicBlock *
MBB = CI.I->getParent();
1672 const unsigned Opcode = getNewOpcode(CI, Paired);
1678 unsigned MergedOffset = std::min(CI.Offset, Paired.Offset);
1680 auto MIB =
BuildMI(*
MBB, InsertBefore,
DL,
TII->get(Opcode), DestReg);
1682 AddressRegs Regs = getRegs(Opcode, *
TII);
1685 MIB.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::vaddr));
1690 assert(CI.I->hasOneMemOperand() && Paired.I->hasOneMemOperand());
1693 MIB.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::srsrc))
1694 .add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::soffset))
1695 .addImm(MergedOffset)
1698 .addMemOperand(combineKnownAdjacentMMOs(CI, Paired));
1700 copyToDestRegs(CI, Paired, InsertBefore,
DL, AMDGPU::OpName::vdata, DestReg);
1702 CI.I->eraseFromParent();
1703 Paired.I->eraseFromParent();
1708 CombineInfo &CI, CombineInfo &Paired,
1710 MachineBasicBlock *
MBB = CI.I->getParent();
1715 const unsigned Opcode = getNewOpcode(CI, Paired);
1721 unsigned MergedOffset = std::min(CI.Offset, Paired.Offset);
1723 auto MIB =
BuildMI(*
MBB, InsertBefore,
DL,
TII->get(Opcode), DestReg);
1725 AddressRegs Regs = getRegs(Opcode, *
TII);
1728 MIB.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::vaddr));
1733 unsigned NumCombinedComponents = CI.Width + Paired.Width;
1734 if (NumCombinedComponents == 3 && CI.EltSize <= 2)
1735 NumCombinedComponents = 4;
1736 unsigned JoinedFormat =
1742 assert(CI.I->hasOneMemOperand() && Paired.I->hasOneMemOperand());
1745 MIB.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::srsrc))
1746 .add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::soffset))
1747 .addImm(MergedOffset)
1748 .addImm(JoinedFormat)
1751 .addMemOperand(combineKnownAdjacentMMOs(CI, Paired));
1753 copyToDestRegs(CI, Paired, InsertBefore,
DL, AMDGPU::OpName::vdata, DestReg);
1755 CI.I->eraseFromParent();
1756 Paired.I->eraseFromParent();
1761 CombineInfo &CI, CombineInfo &Paired,
1763 MachineBasicBlock *
MBB = CI.I->getParent();
1767 const unsigned Opcode = getNewOpcode(CI, Paired);
1770 copyFromSrcRegs(CI, Paired, InsertBefore,
DL, AMDGPU::OpName::vdata);
1773 .
addReg(SrcReg, RegState::Kill);
1775 AddressRegs Regs = getRegs(Opcode, *
TII);
1778 MIB.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::vaddr));
1783 unsigned NumCombinedComponents = CI.Width + Paired.Width;
1784 if (NumCombinedComponents == 3 && CI.EltSize <= 2)
1785 NumCombinedComponents = 4;
1786 unsigned JoinedFormat =
1792 assert(CI.I->hasOneMemOperand() && Paired.I->hasOneMemOperand());
1795 MIB.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::srsrc))
1796 .add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::soffset))
1797 .addImm(std::min(CI.Offset, Paired.Offset))
1798 .addImm(JoinedFormat)
1801 .addMemOperand(combineKnownAdjacentMMOs(CI, Paired));
1803 CI.I->eraseFromParent();
1804 Paired.I->eraseFromParent();
1809 CombineInfo &CI, CombineInfo &Paired,
1811 MachineBasicBlock *
MBB = CI.I->getParent();
1816 const unsigned Opcode = getNewOpcode(CI, Paired);
1821 auto MIB =
BuildMI(*
MBB, InsertBefore,
DL,
TII->get(Opcode), DestReg);
1823 if (
auto *SAddr =
TII->getNamedOperand(*CI.I, AMDGPU::OpName::saddr))
1827 MIB.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::vaddr))
1828 .addImm(std::min(CI.Offset, Paired.Offset))
1830 .addMemOperand(combineKnownAdjacentMMOs(CI, Paired));
1832 copyToDestRegs(CI, Paired, InsertBefore,
DL, AMDGPU::OpName::vdst, DestReg);
1834 CI.I->eraseFromParent();
1835 Paired.I->eraseFromParent();
1840 CombineInfo &CI, CombineInfo &Paired,
1842 MachineBasicBlock *
MBB = CI.I->getParent();
1847 const unsigned Opcode = getNewOpcode(CI, Paired);
1850 copyFromSrcRegs(CI, Paired, InsertBefore,
DL, AMDGPU::OpName::vdata);
1853 .
add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::vaddr))
1854 .
addReg(SrcReg, RegState::Kill);
1856 if (
auto *SAddr =
TII->getNamedOperand(*CI.I, AMDGPU::OpName::saddr))
1860 MIB.addImm(std::min(CI.Offset, Paired.Offset))
1862 .addMemOperand(combineKnownAdjacentMMOs(CI, Paired));
1864 CI.I->eraseFromParent();
1865 Paired.I->eraseFromParent();
1874 (MMOs.
size() != 1 || MMOs[0]->
getAlign().value() < Width * 4);
1877unsigned SILoadStoreOptimizer::getNewOpcode(
const CombineInfo &CI,
1878 const CombineInfo &Paired) {
1879 const unsigned Width = CI.Width + Paired.Width;
1880 const CombineInfo &Leading = Paired < CI ? Paired : CI;
1883 const bool NeedsConstrainedOpc =
1886 switch (getCommonInstClass(CI, Paired)) {
1888 assert(CI.InstClass == BUFFER_LOAD || CI.InstClass == BUFFER_STORE);
1899 case S_BUFFER_LOAD_IMM: {
1904 return NeedsConstrainedOpc ? AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM_ec
1905 : AMDGPU::S_BUFFER_LOAD_DWORDX2_IMM;
1907 return NeedsConstrainedOpc ? AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM_ec
1908 : AMDGPU::S_BUFFER_LOAD_DWORDX3_IMM;
1910 return NeedsConstrainedOpc ? AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM_ec
1911 : AMDGPU::S_BUFFER_LOAD_DWORDX4_IMM;
1913 return NeedsConstrainedOpc ? AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM_ec
1914 : AMDGPU::S_BUFFER_LOAD_DWORDX8_IMM;
1917 case S_BUFFER_LOAD_SGPR_IMM: {
1922 return NeedsConstrainedOpc ? AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM_ec
1923 : AMDGPU::S_BUFFER_LOAD_DWORDX2_SGPR_IMM;
1925 return NeedsConstrainedOpc ? AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM_ec
1926 : AMDGPU::S_BUFFER_LOAD_DWORDX3_SGPR_IMM;
1928 return NeedsConstrainedOpc ? AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM_ec
1929 : AMDGPU::S_BUFFER_LOAD_DWORDX4_SGPR_IMM;
1931 return NeedsConstrainedOpc ? AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM_ec
1932 : AMDGPU::S_BUFFER_LOAD_DWORDX8_SGPR_IMM;
1940 return NeedsConstrainedOpc ? AMDGPU::S_LOAD_DWORDX2_IMM_ec
1941 : AMDGPU::S_LOAD_DWORDX2_IMM;
1943 return NeedsConstrainedOpc ? AMDGPU::S_LOAD_DWORDX3_IMM_ec
1944 : AMDGPU::S_LOAD_DWORDX3_IMM;
1946 return NeedsConstrainedOpc ? AMDGPU::S_LOAD_DWORDX4_IMM_ec
1947 : AMDGPU::S_LOAD_DWORDX4_IMM;
1949 return NeedsConstrainedOpc ? AMDGPU::S_LOAD_DWORDX8_IMM_ec
1950 : AMDGPU::S_LOAD_DWORDX8_IMM;
1958 return AMDGPU::GLOBAL_LOAD_DWORDX2;
1960 return AMDGPU::GLOBAL_LOAD_DWORDX3;
1962 return AMDGPU::GLOBAL_LOAD_DWORDX4;
1964 case GLOBAL_LOAD_SADDR:
1969 return AMDGPU::GLOBAL_LOAD_DWORDX2_SADDR;
1971 return AMDGPU::GLOBAL_LOAD_DWORDX3_SADDR;
1973 return AMDGPU::GLOBAL_LOAD_DWORDX4_SADDR;
1980 return AMDGPU::GLOBAL_STORE_DWORDX2;
1982 return AMDGPU::GLOBAL_STORE_DWORDX3;
1984 return AMDGPU::GLOBAL_STORE_DWORDX4;
1986 case GLOBAL_STORE_SADDR:
1991 return AMDGPU::GLOBAL_STORE_DWORDX2_SADDR;
1993 return AMDGPU::GLOBAL_STORE_DWORDX3_SADDR;
1995 return AMDGPU::GLOBAL_STORE_DWORDX4_SADDR;
2002 return AMDGPU::FLAT_LOAD_DWORDX2;
2004 return AMDGPU::FLAT_LOAD_DWORDX3;
2006 return AMDGPU::FLAT_LOAD_DWORDX4;
2013 return AMDGPU::FLAT_STORE_DWORDX2;
2015 return AMDGPU::FLAT_STORE_DWORDX3;
2017 return AMDGPU::FLAT_STORE_DWORDX4;
2019 case FLAT_LOAD_SADDR:
2024 return AMDGPU::FLAT_LOAD_DWORDX2_SADDR;
2026 return AMDGPU::FLAT_LOAD_DWORDX3_SADDR;
2028 return AMDGPU::FLAT_LOAD_DWORDX4_SADDR;
2030 case FLAT_STORE_SADDR:
2035 return AMDGPU::FLAT_STORE_DWORDX2_SADDR;
2037 return AMDGPU::FLAT_STORE_DWORDX3_SADDR;
2039 return AMDGPU::FLAT_STORE_DWORDX4_SADDR;
2048std::pair<unsigned, unsigned>
2049SILoadStoreOptimizer::getSubRegIdxs(
const CombineInfo &CI,
2050 const CombineInfo &Paired) {
2051 assert((CI.InstClass != MIMG ||
2053 CI.Width + Paired.Width)) &&
2059 static const unsigned Idxs[5][4] = {
2060 {AMDGPU::sub0, AMDGPU::sub0_sub1, AMDGPU::sub0_sub1_sub2, AMDGPU::sub0_sub1_sub2_sub3},
2061 {AMDGPU::sub1, AMDGPU::sub1_sub2, AMDGPU::sub1_sub2_sub3, AMDGPU::sub1_sub2_sub3_sub4},
2062 {AMDGPU::sub2, AMDGPU::sub2_sub3, AMDGPU::sub2_sub3_sub4, AMDGPU::sub2_sub3_sub4_sub5},
2063 {AMDGPU::sub3, AMDGPU::sub3_sub4, AMDGPU::sub3_sub4_sub5, AMDGPU::sub3_sub4_sub5_sub6},
2064 {AMDGPU::sub4, AMDGPU::sub4_sub5, AMDGPU::sub4_sub5_sub6, AMDGPU::sub4_sub5_sub6_sub7},
2067 assert(CI.Width >= 1 && CI.Width <= 4);
2068 assert(Paired.Width >= 1 && Paired.Width <= 4);
2071 Idx1 = Idxs[0][Paired.Width - 1];
2072 Idx0 = Idxs[Paired.Width][CI.Width - 1];
2074 Idx0 = Idxs[0][CI.Width - 1];
2075 Idx1 = Idxs[CI.Width][Paired.Width - 1];
2078 return {Idx0, Idx1};
2082SILoadStoreOptimizer::getTargetRegisterClass(
const CombineInfo &CI,
2083 const CombineInfo &Paired)
const {
2084 if (CI.InstClass == S_BUFFER_LOAD_IMM ||
2085 CI.InstClass == S_BUFFER_LOAD_SGPR_IMM || CI.InstClass == S_LOAD_IMM) {
2086 switch (CI.Width + Paired.Width) {
2090 return &AMDGPU::SReg_64_XEXECRegClass;
2092 return &AMDGPU::SGPR_96RegClass;
2094 return &AMDGPU::SGPR_128RegClass;
2096 return &AMDGPU::SGPR_256RegClass;
2098 return &AMDGPU::SGPR_512RegClass;
2104 unsigned BitWidth = 32 * (CI.Width + Paired.Width);
2105 return TRI->isAGPRClass(getDataRegClass(*CI.I))
2111 CombineInfo &CI, CombineInfo &Paired,
2113 MachineBasicBlock *
MBB = CI.I->getParent();
2117 const unsigned Opcode = getNewOpcode(CI, Paired);
2120 copyFromSrcRegs(CI, Paired, InsertBefore,
DL, AMDGPU::OpName::vdata);
2123 .
addReg(SrcReg, RegState::Kill);
2125 AddressRegs Regs = getRegs(Opcode, *
TII);
2128 MIB.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::vaddr));
2134 assert(CI.I->hasOneMemOperand() && Paired.I->hasOneMemOperand());
2137 MIB.add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::srsrc))
2138 .add(*
TII->getNamedOperand(*CI.I, AMDGPU::OpName::soffset))
2139 .addImm(std::min(CI.Offset, Paired.Offset))
2142 .addMemOperand(combineKnownAdjacentMMOs(CI, Paired));
2144 CI.I->eraseFromParent();
2145 Paired.I->eraseFromParent();
2150SILoadStoreOptimizer::createRegOrImm(int32_t Val, MachineInstr &
MI)
const {
2151 APInt
V(32, Val,
true);
2152 if (
TII->isInlineConstant(V))
2157 BuildMI(*
MI.getParent(),
MI.getIterator(),
MI.getDebugLoc(),
2158 TII->get(AMDGPU::S_MOV_B32),
Reg)
2166Register SILoadStoreOptimizer::computeBase(MachineInstr &
MI,
2167 const MemAddress &Addr)
const {
2175 if (Addr.Base.UseV64Pattern) {
2177 TII->getRegClass(
TII->get(AMDGPU::V_ADD_U64_e64), 0));
2181 MachineInstr *MovOffset =
2185 MachineInstr *
Add64 =
2188 .
addReg(OffsetReg, RegState::Kill)
2199 assert((
TRI->getRegSizeInBits(Addr.Base.LoReg, *MRI) == 32 ||
2200 Addr.Base.LoSubReg) &&
2201 "Expected 32-bit Base-Register-Low!!");
2203 assert((
TRI->getRegSizeInBits(Addr.Base.HiReg, *MRI) == 32 ||
2204 Addr.Base.HiSubReg) &&
2205 "Expected 32-bit Base-Register-Hi!!");
2207 MachineOperand OffsetLo = createRegOrImm(
static_cast<int32_t
>(Addr.Offset),
MI);
2208 MachineOperand OffsetHi =
2209 createRegOrImm(
static_cast<int32_t
>(Addr.Offset >> 32),
MI);
2211 const auto *CarryRC =
TRI->getWaveMaskRegClass();
2217 MachineInstr *LoHalf =
2219 .
addReg(CarryReg, RegState::Define)
2220 .
addReg(Addr.Base.LoReg, {}, Addr.Base.LoSubReg)
2224 MachineInstr *HiHalf =
2226 .
addReg(DeadCarryReg, RegState::Define | RegState::Dead)
2227 .
addReg(Addr.Base.HiReg, {}, Addr.Base.HiSubReg)
2229 .
addReg(CarryReg, RegState::Kill)
2233 MachineInstr *FullBase =
2244 dbgs() <<
" " << *HiHalf <<
"\n";
2245 dbgs() <<
" " << *FullBase <<
"\n\n";);
2251void SILoadStoreOptimizer::updateBaseAndOffset(MachineInstr &
MI,
2253 int32_t NewOffset)
const {
2254 auto *
Base =
TII->getNamedOperand(
MI, AMDGPU::OpName::vaddr);
2255 Base->setReg(NewBase);
2256 Base->setIsKill(
false);
2257 TII->getNamedOperand(
MI, AMDGPU::OpName::offset)->setImm(NewOffset);
2263bool SILoadStoreOptimizer::processBaseWithConstOffset64(
2264 MachineInstr *AddDef,
const MachineOperand &
Base, MemAddress &Addr)
const {
2268 MachineOperand *Src0 =
TII->getNamedOperand(*AddDef, AMDGPU::OpName::src0);
2269 MachineOperand *Src1 =
TII->getNamedOperand(*AddDef, AMDGPU::OpName::src1);
2271 const MachineOperand *BaseOp =
nullptr;
2273 auto Offset =
TII->getImmOrMaterializedImm(*MRI, *Src1);
2284 Addr.Base.LoReg = BaseOp->
getReg();
2285 Addr.Base.UseV64Pattern =
true;
2303void SILoadStoreOptimizer::processBaseWithConstOffset(
const MachineOperand &
Base,
2304 MemAddress &Addr)
const {
2313 if (
Def->getOpcode() == AMDGPU::V_ADD_U64_e64) {
2314 if (processBaseWithConstOffset64(Def,
Base, Addr))
2319 if (
Def->getOpcode() != AMDGPU::REG_SEQUENCE ||
Def->getNumOperands() != 5)
2322 MachineOperand BaseLo =
Def->getOperand(1);
2323 MachineOperand BaseHi =
Def->getOperand(3);
2330 if (!BaseLoDef || BaseLoDef->
getOpcode() != AMDGPU::V_ADD_CO_U32_e64 ||
2331 !BaseHiDef || BaseHiDef->
getOpcode() != AMDGPU::V_ADDC_U32_e64)
2334 MachineOperand *Src0 =
TII->getNamedOperand(*BaseLoDef, AMDGPU::OpName::src0);
2335 MachineOperand *Src1 =
TII->getNamedOperand(*BaseLoDef, AMDGPU::OpName::src1);
2337 auto Offset0P =
TII->getImmOrMaterializedImm(*MRI, *Src0);
2341 if (!(Offset0P =
TII->getImmOrMaterializedImm(*MRI, *Src1)))
2346 if (!BaseLo.
isReg())
2349 Src0 =
TII->getNamedOperand(*BaseHiDef, AMDGPU::OpName::src0);
2350 Src1 =
TII->getNamedOperand(*BaseHiDef, AMDGPU::OpName::src1);
2361 if (!BaseHi.
isReg())
2364 Addr.Base.LoReg = BaseLo.
getReg();
2365 Addr.Base.HiReg = BaseHi.
getReg();
2366 Addr.Base.LoSubReg = BaseLo.
getSubReg();
2367 Addr.Base.HiSubReg = BaseHi.
getSubReg();
2368 Addr.Offset = (*Offset0P & 0x00000000ffffffff) | (Offset1 << 32);
2375void SILoadStoreOptimizer::updateAsyncLDSAddress(MachineInstr &
MI,
2376 int32_t OffsetDiff)
const {
2377 if (!
TII->usesASYNC_CNT(
MI) || OffsetDiff == 0)
2380 MachineOperand *LDSAddr =
TII->getNamedOperand(
MI, AMDGPU::OpName::vdst);
2382 LDSAddr =
TII->getNamedOperand(
MI, AMDGPU::OpName::vdata);
2397bool SILoadStoreOptimizer::promoteConstantOffsetToImm(
2399 MemInfoMap &Visited,
2400 SmallPtrSet<MachineInstr *, 4> &
AnchorList)
const {
2413 ? AMDGPU::FlatAddrSpace::FlatGlobal
2414 : AMDGPU::FlatAddrSpace::FLAT;
2415 bool AllowNegativeOffset =
2416 TII->allowNegativeFlatOffset(FlatVariant) && !
TII->usesASYNC_CNT(
MI);
2420 bool IsOffsetU16 =
TII->usesASYNC_CNT(
MI);
2427 if (
TII->getNamedOperand(
MI, AMDGPU::OpName::offset)->getImm()) {
2433 MachineOperand &
Base = *
TII->getNamedOperand(
MI, AMDGPU::OpName::vaddr);
2434 auto [It,
Inserted] = Visited.try_emplace(&
MI);
2437 processBaseWithConstOffset(
Base, MAddr);
2442 if (MAddr.Offset == 0) {
2443 LLVM_DEBUG(
dbgs() <<
" Failed to extract constant-offset or there are no"
2444 " constant offsets that can be promoted.\n";);
2450 <<
"} Offset: " << MAddr.Offset <<
"\n\n";);
2477 MachineInstr *AnchorInst =
nullptr;
2478 MemAddress AnchorAddr;
2479 uint32_t MaxDist = std::numeric_limits<uint32_t>::min();
2481 bool MIIsAnchor =
false;
2490 MachineInstr &MINext = *
MBBI;
2494 TII->getNamedOperand(MINext, AMDGPU::OpName::offset)->getImm())
2497 const MachineOperand &BaseNext =
2498 *
TII->getNamedOperand(MINext, AMDGPU::OpName::vaddr);
2499 MemAddress MAddrNext;
2500 auto [It,
Inserted] = Visited.try_emplace(&MINext);
2502 processBaseWithConstOffset(BaseNext, MAddrNext);
2503 It->second = MAddrNext;
2505 MAddrNext = It->second;
2507 if (MAddrNext.Base.LoReg != MAddr.Base.LoReg ||
2508 MAddrNext.Base.HiReg != MAddr.Base.HiReg ||
2509 MAddrNext.Base.LoSubReg != MAddr.Base.LoSubReg ||
2510 MAddrNext.Base.HiSubReg != MAddr.Base.HiSubReg)
2513 InstsWCommonBase.
emplace_back(&MINext, MAddrNext.Offset);
2515 if (AllowNegativeOffset) {
2516 int64_t Dist = MAddr.Offset - MAddrNext.Offset;
2517 TargetLoweringBase::AddrMode AM;
2521 (uint32_t)std::abs(Dist) > MaxDist) {
2522 MaxDist = std::abs(Dist);
2524 AnchorAddr = MAddrNext;
2525 AnchorInst = &MINext;
2533 if (!AllowNegativeOffset && !InstsWCommonBase.
empty()) {
2534 for (
auto &[Inst,
Offset] : InstsWCommonBase) {
2535 int64_t Dist = MAddr.Offset -
Offset;
2536 TargetLoweringBase::AddrMode AM;
2541 (!AnchorInst ||
Offset < AnchorAddr.Offset)) {
2542 AnchorAddr = Visited[Inst];
2551 LLVM_DEBUG(
dbgs() <<
" Anchor-Inst(with max-distance from Offset): ";
2552 AnchorInst->
dump());
2554 << AnchorAddr.Offset <<
"\n\n");
2559 int32_t OffsetDiff = MAddr.Offset - AnchorAddr.Offset;
2560 updateBaseAndOffset(
MI,
Base, OffsetDiff);
2561 updateAsyncLDSAddress(
MI, OffsetDiff);
2564 for (
auto [OtherMI, OtherOffset] : InstsWCommonBase) {
2565 TargetLoweringBase::AddrMode AM;
2567 AM.
BaseOffs = OtherOffset - AnchorAddr.Offset;
2570 (AllowNegativeOffset || AM.
BaseOffs >= 0) &&
2574 int32_t OtherOffsetDiff = OtherOffset - AnchorAddr.Offset;
2575 updateBaseAndOffset(*OtherMI,
Base, OtherOffsetDiff);
2576 updateAsyncLDSAddress(*OtherMI, OtherOffsetDiff);
2585 LLVM_DEBUG(
dbgs() <<
" MI is anchor (smallest offset); promoting "
2586 "candidates relative to MI's base.\n");
2589 bool AnyPromoted =
false;
2591 for (
auto [OtherMI, OtherOffset] : InstsWCommonBase) {
2592 int64_t Dist = OtherOffset - MAddr.Offset;
2593 TargetLoweringBase::AddrMode AM;
2600 updateBaseAndOffset(*OtherMI,
Base, Dist);
2601 updateAsyncLDSAddress(*OtherMI, Dist);
2608 TII->getNamedOperand(
MI, AMDGPU::OpName::vaddr)->setIsKill(
false);
2617void SILoadStoreOptimizer::addInstToMergeableList(
const CombineInfo &CI,
2618 std::list<std::list<CombineInfo> > &MergeableInsts)
const {
2619 for (std::list<CombineInfo> &AddrList : MergeableInsts) {
2620 if (AddrList.front().InstClass == CI.InstClass &&
2621 AddrList.front().hasSameBaseAddress(CI)) {
2622 AddrList.emplace_back(CI);
2628 MergeableInsts.emplace_back(1, CI);
2631std::pair<MachineBasicBlock::iterator, bool>
2632SILoadStoreOptimizer::collectMergeableInsts(
2634 MemInfoMap &Visited, SmallPtrSet<MachineInstr *, 4> &
AnchorList,
2635 std::list<std::list<CombineInfo>> &MergeableInsts)
const {
2641 for (; BlockI != End; ++BlockI) {
2642 MachineInstr &
MI = *BlockI;
2646 if (promoteConstantOffsetToImm(
MI, Visited,
AnchorList))
2651 if (
MI.hasOrderedMemoryRef() ||
MI.hasUnmodeledSideEffects()) {
2659 const InstClassEnum InstClass = getInstClass(
MI.getOpcode(), *
TII);
2660 if (InstClass == UNKNOWN)
2665 AMDGPU::getNamedOperandIdx(
MI.getOpcode(), AMDGPU::OpName::swz);
2666 if (Swizzled != -1 &&
MI.getOperand(Swizzled).getImm())
2669 if (InstClass == TBUFFER_LOAD || InstClass == TBUFFER_STORE) {
2672 dbgs() <<
"Skip tbuffer combine: relaxed OOB mode not enabled\n");
2676 const MachineOperand *Fmt =
2677 TII->getNamedOperand(
MI, AMDGPU::OpName::format);
2682 }
else if (InstClass == MIMG) {
2685 const auto *TFEOp =
TII->getNamedOperand(
MI, AMDGPU::OpName::tfe);
2686 if (TFEOp && TFEOp->getImm())
2689 const auto *LWEOp =
TII->getNamedOperand(
MI, AMDGPU::OpName::lwe);
2690 if (LWEOp && LWEOp->getImm())
2695 CI.setMI(
MI, *
this);
2698 if (!CI.hasMergeableAddress(*MRI))
2713 for (std::list<std::list<CombineInfo>>::iterator
I = MergeableInsts.begin(),
2714 E = MergeableInsts.end();
I !=
E;) {
2716 std::list<CombineInfo> &MergeList = *
I;
2717 if (MergeList.size() <= 1) {
2721 I = MergeableInsts.erase(
I);
2729 [] (
const CombineInfo &
A,
const CombineInfo &
B) {
2730 return A.Offset <
B.Offset;
2741bool SILoadStoreOptimizer::optimizeBlock(
2742 std::list<std::list<CombineInfo> > &MergeableInsts) {
2745 for (std::list<std::list<CombineInfo>>::iterator
I = MergeableInsts.begin(),
2746 E = MergeableInsts.end();
I !=
E;) {
2747 std::list<CombineInfo> &MergeList = *
I;
2749 bool OptimizeListAgain =
false;
2750 if (!optimizeInstsWithSameBaseAddr(MergeList, OptimizeListAgain)) {
2754 I = MergeableInsts.erase(
I);
2762 if (!OptimizeListAgain) {
2763 I = MergeableInsts.erase(
I);
2766 OptimizeAgain =
true;
2772SILoadStoreOptimizer::optimizeInstsWithSameBaseAddr(
2773 std::list<CombineInfo> &MergeList,
2774 bool &OptimizeListAgain) {
2775 if (MergeList.empty())
2780 for (
auto I = MergeList.begin(),
Next = std::next(
I);
Next != MergeList.end();
2781 Next = std::next(
I)) {
2786 if ((*First).Order > (*Second).Order)
2788 CombineInfo &CI = *
First;
2789 CombineInfo &Paired = *Second;
2791 CombineInfo *Where = checkAndPrepareMerge(CI, Paired);
2799 LLVM_DEBUG(
dbgs() <<
"Merging: " << *CI.I <<
" with: " << *Paired.I);
2802 switch (CI.InstClass) {
2807 NewMI = mergeRead2Pair(CI, Paired, Where->I);
2810 NewMI = mergeWrite2Pair(CI, Paired, Where->I);
2812 case S_BUFFER_LOAD_IMM:
2813 case S_BUFFER_LOAD_SGPR_IMM:
2815 NewMI = mergeSMemLoadImmPair(CI, Paired, Where->I);
2816 OptimizeListAgain |= CI.Width + Paired.Width < 8;
2819 NewMI = mergeBufferLoadPair(CI, Paired, Where->I);
2820 OptimizeListAgain |= CI.Width + Paired.Width < 4;
2823 NewMI = mergeBufferStorePair(CI, Paired, Where->I);
2824 OptimizeListAgain |= CI.Width + Paired.Width < 4;
2827 NewMI = mergeImagePair(CI, Paired, Where->I);
2828 OptimizeListAgain |= CI.Width + Paired.Width < 4;
2831 NewMI = mergeTBufferLoadPair(CI, Paired, Where->I);
2832 OptimizeListAgain |= CI.Width + Paired.Width < 4;
2835 NewMI = mergeTBufferStorePair(CI, Paired, Where->I);
2836 OptimizeListAgain |= CI.Width + Paired.Width < 4;
2839 case FLAT_LOAD_SADDR:
2841 case GLOBAL_LOAD_SADDR:
2842 NewMI = mergeFlatLoadPair(CI, Paired, Where->I);
2843 OptimizeListAgain |= CI.Width + Paired.Width < 4;
2846 case FLAT_STORE_SADDR:
2848 case GLOBAL_STORE_SADDR:
2849 NewMI = mergeFlatStorePair(CI, Paired, Where->I);
2850 OptimizeListAgain |= CI.Width + Paired.Width < 4;
2853 CI.setMI(NewMI, *
this);
2854 CI.Order = Where->Order;
2858 MergeList.erase(Second);
2864bool SILoadStoreOptimizerLegacy::runOnMachineFunction(
MachineFunction &MF) {
2867 return SILoadStoreOptimizer(
2868 &getAnalysis<AAResultsWrapperPass>().getAAResults())
2892 for (MachineBasicBlock &
MBB : MF) {
2896 bool CollectModified;
2897 std::list<std::list<CombineInfo>> MergeableInsts;
2901 std::tie(SectionEnd, CollectModified) =
2907 OptimizeAgain =
false;
2909 }
while (OptimizeAgain);
2931 bool Changed = SILoadStoreOptimizer(&
AA).run(MF);
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
INITIALIZE_PASS(AMDGPUImageIntrinsicOptimizer, DEBUG_TYPE, "AMDGPU Image Intrinsic Optimizer", false, false) char AMDGPUImageIntrinsicOptimizer void addInstToMergeableList(IntrinsicInst *II, SmallVector< SmallVector< IntrinsicInst *, 4 > > &MergeableInsts, const AMDGPU::ImageDimIntrinsicInfo *ImageDimIntr)
BasicBlock::iterator collectMergeableInsts(BasicBlock::iterator I, BasicBlock::iterator E, SmallVector< SmallVector< IntrinsicInst *, 4 > > &MergeableInsts)
Provides AMDGPU specific target descriptions.
MachineBasicBlock MachineBasicBlock::iterator DebugLoc DL
MachineBasicBlock MachineBasicBlock::iterator MBBI
static GCRegistry::Add< ErlangGC > A("erlang", "erlang-compatible garbage collector")
static GCRegistry::Add< CoreCLRGC > E("coreclr", "CoreCLR-compatible GC")
static GCRegistry::Add< OcamlGC > B("ocaml", "ocaml 3.10-compatible GC")
AMD GCN specific subclass of TargetSubtarget.
const HexagonInstrInfo * TII
static MaybeAlign getAlign(Value *Ptr)
Register const TargetRegisterInfo * TRI
Promote Memory to Register
static MCRegister getReg(const MCDisassembler *D, unsigned RC, unsigned RegNo)
FunctionAnalysisManager FAM
#define INITIALIZE_PASS_DEPENDENCY(depName)
#define INITIALIZE_PASS_END(passName, arg, name, cfg, analysis)
#define INITIALIZE_PASS_BEGIN(passName, arg, name, cfg, analysis)
static uint32_t mostAlignedValueInRange(uint32_t Lo, uint32_t Hi)
static bool needsConstrainedOpcode(const GCNSubtarget &STM, ArrayRef< MachineMemOperand * > MMOs, unsigned Width)
static void addDefsUsesToList(const MachineInstr &MI, DenseSet< Register > &RegDefs, DenseSet< Register > &RegUses)
static unsigned getBufferFormatWithCompCount(unsigned OldFormat, unsigned ComponentCount, const GCNSubtarget &STI)
static bool optimizeBlock(BasicBlock &BB, bool &ModifiedDT, const TargetTransformInfo &TTI, const DataLayout &DL, bool HasBranchDivergence, DomTreeUpdater *DTU)
A manager for alias analyses.
A wrapper pass to provide the legacy pass manager access to a suitably prepared AAResults object.
PassT::Result & getResult(IRUnitT &IR, ExtraArgTs... ExtraArgs)
Get the result of an analysis pass for a given IR unit.
Represent the analysis usage information of a pass.
AnalysisUsage & addRequired()
LLVM_ABI void setPreservesCFG()
This function should be called by the pass, iff they do not:
Represent a constant reference to an array (0 or more elements consecutively in memory),...
size_t size() const
Get the array size.
Represents analyses that only rely on functions' control flow.
static LLVM_ABI DebugLoc getMergedLocation(DebugLoc LocA, DebugLoc LocB)
When two instructions are combined into a single instruction we also need to combine the original loc...
Implements a dense probed hash-table based set.
FunctionPass class - This class is used to implement most global optimizations.
bool hasOptNone() const
Do not optimize this function (-O0).
bool loadStoreOptEnabled() const
const SIInstrInfo * getInstrInfo() const override
bool hasDwordx3LoadStores() const
const SITargetLowering * getTargetLowering() const override
bool hasRelaxedTBufferOOBMode() const
bool ldsRequiresM0Init() const
Return if most LDS instructions have an m0 use that require m0 to be initialized.
bool isXNACKEnabled() const
const HexagonRegisterInfo & getRegisterInfo() const
TypeSize getValue() const
unsigned getOpcode() const
Return the opcode number for this descriptor.
An RAII based helper class to modify MachineFunctionProperties when running pass.
const MachineFunction * getParent() const
Return the MachineFunction containing this basic block.
MachineInstrBundleIterator< MachineInstr > iterator
MachineFunctionPass - This class adapts the FunctionPass interface to allow convenient creation of pa...
void getAnalysisUsage(AnalysisUsage &AU) const override
getAnalysisUsage - Subclasses that override getAnalysisUsage must call this.
Properties which a MachineFunction may have at a given point in time.
const TargetSubtargetInfo & getSubtarget() const
getSubtarget - Return the subtarget for which this machine code is being compiled.
MachineRegisterInfo & getRegInfo()
getRegInfo - Return information about the registers currently in use.
Function & getFunction()
Return the LLVM function that this machine code represents.
MachineMemOperand * getMachineMemOperand(MachinePointerInfo PtrInfo, MachineMemOperand::Flags F, LLT MemTy, Align BaseAlignment, const MMOMetadata &Metadata=MMOMetadata(), SyncScope::ID SSID=SyncScope::System, AtomicOrdering Ordering=AtomicOrdering::NotAtomic, AtomicOrdering FailureOrdering=AtomicOrdering::NotAtomic)
getMachineMemOperand - Allocate a new MachineMemOperand.
const MachineInstrBuilder & cloneMergedMemRefs(ArrayRef< const MachineInstr * > OtherMIs) const
const MachineInstrBuilder & addReg(Register RegNo, RegState Flags={}, unsigned SubReg=0) const
Add a new virtual register operand.
const MachineInstrBuilder & addImm(int64_t Val) const
Add a new immediate operand.
const MachineInstrBuilder & add(const MachineOperand &MO) const
Representation of each machine instruction.
unsigned getOpcode() const
Returns the opcode of this MachineInstr.
LLVM_ABI void dump() const
A description of a memory reference used in the backend.
LocationSize getSize() const
Return the size in bytes of the memory reference.
unsigned getAddrSpace() const
const MachinePointerInfo & getPointerInfo() const
MachineOperand class - Representation of each machine instruction operand.
unsigned getSubReg() const
bool isReg() const
isReg - Tests if this is a MO_Register operand.
LLVM_ABI void setReg(Register Reg)
Change the register this operand corresponds to.
bool isImm() const
isImm - Tests if this is a MO_Immediate operand.
static MachineOperand CreateImm(int64_t Val)
Register getReg() const
getReg - Returns the register number.
static MachineOperand CreateReg(Register Reg, bool isDef, bool isImp=false, bool isKill=false, bool isDead=false, bool isUndef=false, bool isEarlyClobber=false, unsigned SubReg=0, bool isDebug=false, bool isInternalRead=false, bool isRenamable=false)
MachineRegisterInfo - Keep track of information for virtual and physical registers,...
LLVM_ABI bool hasOneNonDBGUse(Register RegNo) const
hasOneNonDBGUse - Return true if there is exactly one non-Debug use of the specified register.
const TargetRegisterClass * getRegClass(Register Reg) const
Return the register class of the specified virtual register.
LLVM_ABI Register createVirtualRegister(const TargetRegisterClass *RegClass, StringRef Name="")
createVirtualRegister - Create and return a new virtual register in the function with the specified r...
LLVM_ABI const TargetRegisterClass * constrainRegClass(Register Reg, const TargetRegisterClass *RC, unsigned MinNumRegs=0)
constrainRegClass - Constrain the register class of the specified virtual register to be a common sub...
LLVM_ABI LLVM_READONLY MachineInstr * getUniqueVRegDef(Register Reg) const
getUniqueVRegDef - Return the unique machine instr that defines the specified virtual register or nul...
A set of analyses that are preserved following a run of a transformation pass.
static PreservedAnalyses all()
Construct a special preserved set that preserves all passes.
PreservedAnalyses & preserveSet()
Mark an analysis set as preserved.
Wrapper class representing virtual and physical registers.
constexpr bool isPhysical() const
Return true if the specified register number is in the physical register namespace.
static bool isFLATScratch(const MachineInstr &MI)
static bool isVIMAGE(const MachineInstr &MI)
static bool isFLATGlobal(const MachineInstr &MI)
static bool isVSAMPLE(const MachineInstr &MI)
static bool isFLAT(const MachineInstr &MI)
LLVM_READONLY MachineOperand * getNamedOperand(MachineInstr &MI, AMDGPU::OpName OperandName) const
Returns the operand named Op.
PreservedAnalyses run(MachineFunction &MF, MachineFunctionAnalysisManager &MFAM)
bool isLegalFlatAddressingMode(const AddrMode &AM, unsigned AddrSpace) const
SmallPtrSet - This class implements a set which is optimized for holding SmallSize or less elements.
reference emplace_back(ArgTypes &&... Args)
Represent a constant reference to a string, i.e.
std::pair< iterator, bool > insert(const ValueT &V)
bool contains(const_arg_type_t< ValueT > V) const
Check if the set contains the given element.
self_iterator getIterator()
#define llvm_unreachable(msg)
Marks that the current location is not supposed to be reachable.
Abstract Attribute helper functions.
@ FLAT_ADDRESS
Address space for flat memory.
@ GLOBAL_ADDRESS
Address space for global memory (RAT0, VTX0).
LLVM_READONLY const MIMGInfo * getMIMGInfo(unsigned Opc)
uint64_t convertSMRDOffsetUnits(const MCSubtargetInfo &ST, uint64_t ByteOffset)
Convert ByteOffset to dwords if the subtarget uses dword SMRD immediate offsets.
bool getMTBUFHasSrsrc(unsigned Opc)
int getMTBUFElements(unsigned Opc)
bool getMTBUFHasSoffset(unsigned Opc)
int getMUBUFOpcode(unsigned BaseOpc, unsigned Elements)
int getMUBUFBaseOpcode(unsigned Opc)
LLVM_READONLY bool hasNamedOperand(uint64_t Opcode, OpName NamedIdx)
int getMTBUFBaseOpcode(unsigned Opc)
bool getMUBUFHasVAddr(unsigned Opc)
int getMTBUFOpcode(unsigned BaseOpc, unsigned Elements)
bool getMUBUFHasSoffset(unsigned Opc)
const MIMGBaseOpcodeInfo * getMIMGBaseOpcode(unsigned Opc)
LLVM_READONLY const MIMGBaseOpcodeInfo * getMIMGBaseOpcodeInfo(unsigned BaseOpcode)
int getMaskedMIMGOp(unsigned Opc, unsigned NewChannels)
bool getMTBUFHasVAddr(unsigned Opc)
int getMUBUFElements(unsigned Opc)
const GcnBufferFormatInfo * getGcnBufferFormatInfo(uint8_t BitsPerComp, uint8_t NumComponents, uint8_t NumFormat, const MCSubtargetInfo &STI)
bool getMUBUFHasSrsrc(unsigned Opc)
constexpr std::underlying_type_t< E > Mask()
Get a bitmask with 1s in all places up to the high-order bit of E's largest value.
@ Add64
64 bits label addition
NodeAddr< DefNode * > Def
BaseReg
Stack frame base register. Bit 0 of FREInfo.Info.
This is an optimization pass for GlobalISel generic memory operations.
bool operator<(int64_t V1, const APSInt &V2)
MachineInstrBuilder BuildMI(MachineFunction &MF, const MIMetadata &MIMD, const MCInstrDesc &MCID)
Builder interface. Specify how to create the initial instruction itself.
RegState
Flags to represent properties of register accesses.
constexpr T maskLeadingOnes(unsigned N)
Create a bitmask with the N left-most bits set to 1, and all other bits set to 0.
FunctionPass * createSILoadStoreOptimizerLegacyPass()
AnalysisManager< MachineFunction > MachineFunctionAnalysisManager
char & SILoadStoreOptimizerLegacyID
constexpr int popcount(T Value) noexcept
Count the number of set bits in a value.
int countr_zero(T Val)
Count number of 0's from the least significant bit to the most stopping at the first 1.
LLVM_ABI PreservedAnalyses getMachineFunctionPassPreservedAnalyses()
Returns the minimum set of Analyses that all machine function passes must preserve.
int countl_zero(T Val)
Count number of 0's from the most significant bit to the least stopping at the first 1.
LLVM_ABI raw_ostream & dbgs()
dbgs() - This returns a reference to a raw_ostream for debugging messages.
constexpr bool isUInt(uint64_t x)
Checks if an unsigned integer fits into the given bit width.
class LLVM_GSL_OWNER SmallVector
Forward declaration of SmallVector so that calculateSmallVectorDefaultInlinedElements can reference s...
@ First
Helpers to iterate all locations in the MemoryEffectsBase class.
DWARFExpression::Operation Op
std::vector< std::pair< LineLocation, FunctionId > > AnchorList
constexpr unsigned BitWidth
RelativeUniformCounterPtr ValuesPtrExpr VTableAddr Next
constexpr T maskTrailingOnes(unsigned N)
Create a bitmask with the N right-most bits set to 1, and all other bits set to 0.
AAResults AliasAnalysis
Temporary typedef for legacy code that uses a generic AliasAnalysis pointer or reference.
LLVM_ABI Printable printReg(Register Reg, const TargetRegisterInfo *TRI=nullptr, unsigned SubIdx=0, const MachineRegisterInfo *MRI=nullptr)
Prints virtual and physical registers with or without a TRI instance.
MCRegisterClass TargetRegisterClass
void swap(llvm::BitVector &LHS, llvm::BitVector &RHS)
Implement std::swap in terms of BitVector swap.