ຄລອດ ໂອປຸສ 5.5

Claude Opus 5.5 ຫາກໍ່ຢູ່ໃນອັນດັບ #1 ໃນ Code Arena - ດຽວນີ້ເປັນໜຶ່ງໃນຜູ້ແຂ່ງຂັນ AI ການຂຽນໂປຣແກຣມທີ່ດີທີ່ສຸດ

ຄຳຕອບສັ້ນໆ: ລະດັບສູງສຸດຂອງ Claude Opus 5.5 ໄດ້ຖືກລາຍງານວ່າເປັນອັນດັບ 1 ໃນ Arena.ai Code Arena WebDev ທີ່ 1,818 ຄະແນນ ແລະ ຢູ່ອັນດັບຕົ້ນໆ ຂອງດັດຊະນີ Coding Agent ຂອງ Artificial Analysis ດ້ວຍ 66 ຄະແນນໃນຄວາມພະຍາຍາມສູງສຸດ. ສິ່ງເຫຼົ່ານັ້ນແມ່ນເຄື່ອງວັດແທກອຸນຫະພູມສາທາລະນະ, ບໍ່ແມ່ນວຽກທີ່ຄ້າງຢູ່ຂອງທ່ານ. ຖ້າທ່ານສົ່ງລະຫັດເພື່ອຫາລ້ຽງຊີບ, ໃຫ້ດຳເນີນການແກ້ໄຂໜ້າວຽກຂອງທ່ານເອງກ່ອນທີ່ຈະປ່ຽນຄ່າເລີ່ມຕົ້ນ.

ບົດຮຽນຫຼັກ:

ຜູ້ນຳ Code Arena: ຖືວ່າ WebDev Elo 1,818 ເປັນຈຸດແຂງຂອງຄວາມມັກ, ບໍ່ແມ່ນຫຼັກຖານການຜະລິດ.

ຈຸດສູງສຸດຂອງດັດຊະນີຕົວແທນ: ສະຫງວນ Opus ຄວາມພະຍາຍາມສູງສຸດສຳລັບປີ້ທີ່ຕິດຢູ່ບ່ອນທີ່ຄວາມລົ້ມເຫຼວມີລາຄາແພງ.

ການແລກປ່ຽນຄ່າໃຊ້ຈ່າຍ: ໂທເຄັນບັນທຶກ ແລະ ໂມງແຂວນຝາ; ຄະແນນສູງສຸດ ແລະ ຄະແນນລາຄາຖືກແຕກຕ່າງກັນ.

ທົດລອງກ່ອນ: ທົດສອບ UI build ໜຶ່ງ, refactor ໜຶ່ງ, ແລະ agent session ໜຶ່ງທີ່ຍາວນານດ້ວຍຕົວທ່ານເອງ.

ໝູນວຽນມົງກຸດ: ຮັກສາຄ່າເລີ່ມຕົ້ນທີ່ລາຄາຖືກກວ່າສຳລັບວຽກງານປະລິມານຕະຫຼອດຮອບວຽນການປ່ອຍ.

ການຍຶດຄອງກະດານຈັດອັນດັບ, ອະທິບາຍງ່າຍໆ

Arena.ai ໄດ້ລົງຄະແນນໃຫ້ Claude Opus 5.5 (Max) ຢູ່ອັນດັບໜຶ່ງໃນຊ່ອງທາງ WebDev ຂອງ Code Arena ດ້ວຍ 1,818 ຄະແນນ. ເຊິ່ງຢູ່ນຳໜ້າຮຸ່ນຕໍ່ໄປໃນການສົນທະນາ, GPT-6 Astra Max ປະມານຊາວຫົກຄະແນນ, ແລະ ເປັນຈຸດກ້າວກະໂດດທີ່ສຳຄັນເມື່ອທຽບກັບ Opus 5 Max ກ່ອນໜ້ານີ້, ເຊິ່ງຢູ່ໃກ້ກັບ 1,692. ນັ້ນແມ່ນຕົວເລກກະດານທີ່ລາຍງານ, ບໍ່ແມ່ນສິ່ງທີ່ຂ້ອຍໄດ້ນຳມາໃຊ້ຄືນໃໝ່ໃນຫ້ອງທົດລອງທີ່ປິດສະໜາ. ເຖິງຢ່າງໃດກໍ່ຕາມ, ການເພີ່ມຂຶ້ນ ~126 ຄະແນນໃນລະດັບ Max ຂອງຄອບຄົວດຽວກັນແມ່ນປະເພດຂອງ delta ທີ່ເຮັດໃຫ້ຄົນໂຫຼດຕາຕະລາງ Elo ຄືນໃໝ່ຄືກັບຄະແນນກິລາ.

ການວິເຄາະແບບ Artificial Analysis, ແຍກຕ່າງຫາກ, ລາຍງານວ່າ Opus 5.5 ເປັນອັນດັບໜຶ່ງໃໝ່ໃນດັດຊະນີຕົວແທນລະຫັດ, ໂດຍມີຜົນປະໂຫຍດຈາກການປະເມີນຜົນທີ່ພວກມັນຕິດຕາມ. ໃນຄວາມພະຍາຍາມສູງສຸດພາຍໃນ Claude Code, ຮູບແບບດັ່ງກ່າວ ໄດ້ຄະແນນ 66 ໃນດັດຊະນີນັ້ນ - ສູງສຸດທີ່ພວກເຂົາເວົ້າວ່າພວກເຂົາໄດ້ວັດແທກມາຮອດປະຈຸບັນ. ມີຂໍ້ແມ້ທີ່ຝັງຢູ່ໃນບັນທຶກ: ຄ່າໃຊ້ຈ່າຍຕໍ່ໜ້າວຽກຈະສູງຂຶ້ນເມື່ອທ່ານພະຍາຍາມຢ່າງໜັກ. ຄະແນນສູງສຸດ ແລະ ຄະແນນລາຄາຖືກບໍ່ແມ່ນສັດດຽວກັນ.

ເອົາສັນຍານສອງຢ່າງນັ້ນມາລວມກັນ ແລະ ທ່ານຈະໄດ້ຮັບມຸມມອງເລື່ອງທີ່ສຳຄັນທີ່ສຸດ: ບໍ່ແມ່ນ "ຮູບແບບທີ່ເປີດຕົວ," ແຕ່ "ກະດານລະຫັດຖືກປ່ຽນຢ່າງຮີບດ່ວນ." ການປະກາດເປີດຕົວແມ່ນຂ່າວ. ການເຂົ້າຄວບຄຸມກະດານຈັດອັນດັບແມ່ນສິ່ງທີ່ຜູ້ໃຊ້ທີ່ມີອຳນາດຖ່າຍຮູບໜ້າຈໍໃນກຸ່ມສົນທະນາໃນຊ່ວງເວລານອກເວລາ.

  • Arena.ai Code Arena WebDev: ລາຍງານ Opus 5.5 (ສູງສຸດ) ຢູ່ທີ່ 1,818
  • Gap ທຽບກັບຄູ່ແຂ່ງທີ່ມີຊື່ຕໍ່ໄປໃນການຄຸ້ມຄອງ: ປະມານ +26 ທຽບກັບ GPT-6 Astra Max
  • ກະໂດດທຽບກັບ Opus 5 Max ກ່ອນໜ້ານີ້: ຈາກ ~1,692 ຫາ 1,818
  • ດັດຊະນີຕົວແທນລະຫັດການວິເຄາະທຽມ: ໃໝ່ #1; 66 ທີ່ຄວາມພະຍາຍາມສູງສຸດໃນ Claude Code
  • ໝາຍເຫດດັດຊະນີດຽວກັນ: ຄ່າໃຊ້ຈ່າຍຕໍ່ໜ້າວຽກສູງຂຶ້ນໃນການຕັ້ງຄ່າຄວາມພະຍາຍາມນັ້ນ

ພາບລວມທີ່ລາຍງານ: Opus 5 Max ທຽບກັບ Opus 5.5 Max ໃນ Code Arena

ຕາຕະລາງປຽບທຽບຈະຊ່ວຍໄດ້ເມື່ອຟີດມີອາລົມ ແລະ ພາບໜ້າຈໍທັງໝົດ. ຂ້າງລຸ່ມນີ້ແມ່ນການຈັດວາງພາບໜ້າຈໍທີ່ລາຍງານງ່າຍໆ, ບໍ່ແມ່ນການປຸງແຕ່ງແບບອິດສະຫຼະ. ຈຸລັງບໍ່ສະໝໍ່າສະເໝີເພາະວ່າກະດານສາທາລະນະມັກຈະບໍ່ສະໝໍ່າສະເໝີ - ແລະເນື່ອງຈາກການຕັ້ງຊື່ "Max" ແມ່ນພຽງພໍທີ່ຈະເຮັດໃຫ້ຕາຂອງທ່ານມົວ.

ຮຸ່ນ (ຕາມທີ່ໄດ້ລາຍງານ) ກະດານ / ເລນ ຄະແນນ / ຄະແນນ ສິ່ງທີ່ຜູ້ຄົນກຳລັງອ່ານເຂົ້າໄປໃນມັນ
Claude Opus 5 Max (ກ່ອນໜ້ານີ້) Arena.ai ສະໜາມກິລາລະຫັດ - WebDev ~1,692 (ລາຍງານ) ເຂັ້ມແຂງ, ແຕ່ບໍ່ແມ່ນຫົວຂໍ້ຂ່າວອີກຕໍ່ໄປ
Claude Opus 5.5 (ສູງສຸດ) Arena.ai ສະໜາມກິລາລະຫັດ - WebDev 1,818 (ລາຍງານ #1) ລ້າງໂພສເທິງ; ກ້າວໃຫຍ່ທຽບກັບ Max ກ່ອນໜ້ານີ້
GPT-6 Astra Max Same Code Arena ສົນທະນາ WebDev ~1,792 ຖ້າທ່ານຫັກຊ່ອງຫວ່າງ ~26 (ການວາງກອບທີ່ລາຍງານ) ປິດອັນດັບສອງໃນການໂພສທີ່ກຳລັງເຮັດຮອບ
Opus 5.5 ດ້ວຍຄວາມພະຍາຍາມສູງສຸດ ດັດຊະນີຕົວແທນລະຫັດການວິເຄາະທຽມ 66 (ສູງສຸດທີ່ເຂົາເຈົ້າວັດແທກໄດ້, ຕາມລາຍງານຂອງເຂົາເຈົ້າ) ຄະແນນການຂຽນໂປຣແກຣມຕົວແທນສູງສຸດ - ສັງເກດເຫັນດ້ານການໃຊ້ຈ່າຍ
ຄວາມພະຍາຍາມຕ່ຳກວ່າ / ການແລ່ນລາຄາຖືກກວ່າ ຮູບພາບການເຂົ້າລະຫັດທີ່ກວ້າງຂວາງດຽວກັນ ບໍ່ມີຕົວເລກມະຫັດສະຈັນສາທາລະນະດຽວຢູ່ທີ່ນີ້ ເຂດແລກປ່ຽນ: "ດີພໍ" ທຽບກັບ "ສູງສຸດຂອງຕາຕະລາງ"

ສຳລັບຜູ້ອ່ານບາງຄົນ, ຕາຕະລາງຮູ້ສຶກວ່າພຽງພໍທີ່ຈະມອບລາງວັນໃຫ້ຜູ້ຊະນະແລ້ວ. ມັນບໍ່ແມ່ນ. ດັດຊະນີ Elo ແລະຕົວແທນແມ່ນເຄື່ອງວັດແທກອຸນຫະພູມທີ່ມີປະໂຫຍດ. ພວກມັນບໍ່ແມ່ນວຽກທີ່ຕ້ອງຈ່າຍໃນການຜະລິດຂອງທ່ານ.

ສະໜາມກິລາລະຫັດວັດແທກຫຍັງພາຍໃຕ້ຝາປິດ

ຖ້າທ່ານພຽງແຕ່ອ່ານອັນດັບ, ທ່ານຈະພາດຮູບແບບຂອງການທົດສອບ. Code Arena, ໂດຍສະເພາະລົດຊາດ WebDev ທີ່ຜູ້ຄົນກຳລັງອ້າງອີງ, ແມ່ນສ້າງຂຶ້ນໂດຍ ຄວາມມັກປຽບທຽບກ່ຽວກັບວຽກງານການຂຽນໂປຣແກຣມ ແລະ ການສ້າງອິນເຕີເຟດ. ມະນຸດ (ແລະ ເຄື່ອງຈັກການລົງຄະແນນສຽງຂອງສະໜາມກິລາ) ເລືອກຜູ້ຊະນະລະຫວ່າງຜົນຜະລິດຂອງຮູບແບບ. ນັ້ນໃຫ້ລາງວັນລະຫັດທີ່ເບິ່ງຄືວ່າຖືກຕ້ອງ, ເຮັດວຽກໄດ້ດີໃນການສາທິດ, ແລະ ຮູ້ສຶກວ່າຖືກປັບປຸງພາຍໃຕ້ການປຽບທຽບແບບບໍ່ເຫັນແຈ້ງ - ໂຄງສ້າງ frontend, ການໂຕ້ຕອບ, ຄວາມສອດຄ່ອງທາງສາຍຕາ, ປະເພດທີ່ເຮັດໃຫ້ການສະແດງຕົວຢ່າງ localhost ຮ້ອງຂຶ້ນວ່າ "ສົ່ງມັນ."

ນັ້ນແມ່ນກິລາທີ່ແຕກຕ່າງຈາກການສອບເສັງລະຫັດແບບເລືອກຕອບແບບຄົງທີ່. ມັນຍັງແຕກຕ່າງຈາກການປະເມີນຕົວແທນທີ່ມີຂອບເຂດຍາວ ບ່ອນທີ່ຮູບແບບຕ້ອງຮັກສາເຊດຊັນຂອງເຊດຊັນໃຫ້ມີຊີວິດຢູ່ສຳລັບການເອີ້ນໃຊ້ເຄື່ອງມືຫຼາຍສິບຄັ້ງໂດຍບໍ່ຕ້ອງເຮັດໃຫ້ຕົວເອງຕົກຢູ່ໃນມຸມ. ຮູບແບບສາມາດທຳລາຍສິ່ງທ້າທາຍ UI ທີ່ສວຍງາມ ແລະຍັງສາມາດເກີດບັນຫາໃນການຍ້າຍ monorepo ທີ່ໜ້າລັງກຽດທີ່ຕ້ອງການໃຫ້ສາມຫ້ອງສະໝຸດຖືກປັກໝຸດ ແລະຊຸດການທົດສອບທີ່ບໍ່ແນ່ນອນຖືກເຈລະຈາຄືກັບສະຖານະການຈັບຕົວປະກັນ.

ສະນັ້ນເມື່ອ Opus 5.5 ຢູ່ທີ່ 1,818 ໃນ WebDev, ໃຫ້ອ່ານມັນເປັນຈຸດແຂງຂອງຄວາມມັກໃນປະເພດຂອງການສ້າງທີ່ຜູ້ລົງຄະແນນສຽງ Arena ເຫັນ. ແອັບ localhost ທີ່ໄວ, ເກມ, storyboards, ແລະ UI ທີ່ເບິ່ງເຫັນໄດ້ເໝາະສົມກັບເລນນັ້ນເກືອບຈະດີເກີນໄປ - ເຊິ່ງກົງກັບການສາທິດໃນຕອນກາງຄືນທີ່ເຮັດໃຫ້ເສັ້ນເວລາລົ້ນ. ຄວາມມັກ Elo ບໍ່ແມ່ນຄຳຕົວະ. ມັນເປັນຄວາມຈິງສະເພາະ. ປະຕິບັດກັບມັນຄືກັບເມນູຊີມລົດຊາດ, ບໍ່ແມ່ນແຜງໂພຊະນາການທີ່ຄົບຖ້ວນ.

ອີກຢ່າງໜຶ່ງທີ່ແປກປະຫຼາດ: ການຕິດສະຫຼາກລະດັບສູງສຸດ. ການຕັ້ງຄ່າຄວາມພະຍາຍາມທີ່ສູງຂຶ້ນ / ຄວາມຈຸທີ່ສູງຂຶ້ນ ມັກຈະໝາຍເຖິງໂທເຄັນຫຼາຍຂຶ້ນ, ການຄຳນວນທີ່ຫຼາຍຂຶ້ນ, ແລະ ຄວາມອົດທົນທີ່ຫຼາຍຂຶ້ນ. ກະດານທີ່ສະແດງຕົວແປ Max ກຳລັງສະແດງໃຫ້ເຫັນເຖິງເພດານ, ບໍ່ແມ່ນການເອີ້ນ API ປະຈຳວັນທີ່ທ່ານເຮັດໃນຂະນະທີ່ເບິ່ງການແຂ່ງຂັນເຄິ່ງໜຶ່ງ. ເພດານມີຄວາມສຳຄັນ. ຄ່າໃຊ້ຈ່າຍຂອງຄົນຂັບປະຈຳວັນກໍ່ມີຄວາມສຳຄັນເຊັ່ນກັນ. ຮັກສາຄວາມຄິດທັງສອງຢ່າງ.

ດັດຊະນີຕົວແທນລະຫັດ ແລະ ການແລກປ່ຽນຄ່າໃຊ້ຈ່າຍທຽບກັບຈຸດສູງສຸດ

ດັດຊະນີຕົວແທນລະຫັດຂອງ Artificial Analysis ແມ່ນເສົາຄໍ້າອີກອັນໜຶ່ງຂອງເລື່ອງການເພີ່ມຂຶ້ນນີ້. ບົດລາຍງານຂອງພວກເຂົາວາງ Opus 5.5 ໄວ້ເທິງສຸດ, ໂດຍມີການປັບປຸງໃນການປະເມີນຜົນທີ່ພວກເຂົາຕິດຕາມ, ແລະທີ່ໂດດເດັ່ນທີ່ສຸດແມ່ນ 66 ໃນຄວາມພະຍາຍາມສູງສຸດໃນ Claude Code. ສູງສຸດທີ່ພວກເຂົາໄດ້ວັດແທກແມ່ນປະໂຫຍກທີ່ເຂັ້ມແຂງ. ມັນຍັງມາພ້ອມກັບໝາຍເຫດສຳລັບຜູ້ໃຫຍ່: ຄ່າໃຊ້ຈ່າຍຕໍ່ໜ້າວຽກເພີ່ມຂຶ້ນເມື່ອທ່ານເລັ່ງຄວາມໄວລົງ.

ນີ້ແມ່ນຫົວໃຈຂອງການໂຕ້ຖຽງແບບຈຳລອງທີ່ດີທີ່ສຸດສຳລັບທີມທີ່ມີງົບປະມານ. ແບບຈຳລອງທີ່ຊະນະດ້ວຍຄວາມພະຍາຍາມສູງສຸດຍັງສາມາດສູນເສຍອາທິດໄດ້ຖ້າທຸກໆໜ້າວຽກເຜົາຜານເງິນຈຳນວນໜ້ອຍໃນໂທເຄັນ. ການເວົ້າລົມທີ່ແຜ່ລາມໄປມາໄດ້ສັງເກດເຫັນແລ້ວວ່າຜູ້ໃຊ້ບາງຄົນເຫັນໂທເຄັນເຜົາຜານໃນຊ່ວງເວລາຍາວ. ນັ້ນບໍ່ໄດ້ຍົກເລີກຄະແນນ. ມັນປັບໂຄງສ້າງການຕັດສິນໃຈຜະລິດຕະພັນຄືນໃໝ່: ສະຫງວນຄວາມພະຍາຍາມສູງສຸດສຳລັບປີ້ທີ່ບໍ່ດີ, ແລະຮັກສາໂປຣໄຟລ໌ທີ່ລາຄາຖືກກວ່າສຳລັບລະຫັດກາວ, ການປັບປຸງໂຄງສ້າງ, ແລະ "ເຮັດໃຫ້ປຸ່ມນີ້ບໍ່ໜ້າກຽດ" ເຮັດວຽກ.

ລອງຄິດເບິ່ງວ່າມັນຄືກັບການຈ້າງຜູ້ຮັບເໝົາທີ່ຄົມຊັດຜູ້ທີ່ຄິດຄ່າທຳນຽມຕາມຊົ່ວໂມງ ແລະ ເວົ້າໄວ. ເຈົ້າຕ້ອງການໃຫ້ເຂົາເຈົ້າແກ້ໄຂບັນຫາທີ່ຍາກ. ເຈົ້າບໍ່ຕ້ອງການໃຫ້ເຂົາເຈົ້າຂຽນ README ຄືນໃໝ່ທຸກໆອັນ. ຄະແນນຕົວແທນສູງສຸດແມ່ນການຮຽກຮ້ອງຄວາມສາມາດ. ຄ່າໃຊ້ຈ່າຍຕໍ່ໜ້າວຽກແມ່ນການຮຽກຮ້ອງການດຳເນີນງານ. AI ການຂຽນໂປຣແກຣມທີ່ດີທີ່ສຸດສຳລັບການແຮັກອິນດີ້ດ່ຽວໃນເວລາ 1 ໂມງເຊົ້າບໍ່ແມ່ນ AI ການຂຽນໂປຣແກຣມທີ່ດີທີ່ສຸດໂດຍອັດຕະໂນມັດສຳລັບບໍລິສັດທີ່ກຳລັງເບິ່ງເສດຖະສາດໜ່ວຍງານ. ທັງສອງກຸ່ມກຳລັງຮ້ອງກ່ຽວກັບພາບໜ້າຈໍກະດານຈັດອັນດັບດຽວກັນ.

  • ໃຊ້ຄວາມພະຍາຍາມສູງສຸດເມື່ອໜ້າວຽກມີຄວາມໜຽວແໜ້ນ, ຫຼາຍໄຟລ໌, ແລະ ຄວາມລົ້ມເຫຼວມີລາຄາແພງ
  • ຫຼຸດສຽງລົງເມື່ອໜ້າວຽກເປັນປະຈຳ ແລະ ທ່ານຕ້ອງການສຽງດັງ
  • ຕິດຕາມລາຄາຕໍ່ PR ທີ່ລວມເຂົ້າກັນຂອງທ່ານເອງ, ບໍ່ພຽງແຕ່ Elo ສາທາລະນະເທົ່ານັ້ນ
  • ຄາດວ່າຕົວແທນດັດຊະນີ ແລະ ສະໜາມກິລາ Elo ຈະບໍ່ເຫັນດີນຳບາງຄັ້ງ - ກິລາທີ່ແຕກຕ່າງກັນ

ປະຕິກິລິຍາຂອງນັກພັດທະນາໃນຄືນດຽວ: ແອັບ, ເກມ, ແລະພະລັງງານ "ຢ່າເຮັດໃຫ້ເສຍສະຕິ"

ຕົວເລກອະທິບາຍຫົວຂໍ້ຂ່າວ. ການສາທິດອະທິບາຍອາລົມ. ນັກພັດທະນາກຳລັງໂພສແອັບ localhost ທີ່ໄວ, ເກມຂະໜາດນ້ອຍ, storyboards, ແລະ UI/visual builds ທີ່ເບິ່ງຄືວ່າພວກເຂົາຈະໃຊ້ເວລາທ້າຍອາທິດໃນໄຕມາດທີ່ຜ່ານມາ. ບາງສ່ວນຂອງນັ້ນແມ່ນອະຄະຕິໃນການເລືອກ - ຜູ້ຄົນແບ່ງປັນຜູ້ຊະນະ, ບໍ່ແມ່ນສາມລຸ້ນທີ່ລົ້ມເຫຼວທີ່ມາກ່ອນ. ເຖິງຢ່າງໃດກໍ່ຕາມ, ປະລິມານຂອງໂພສ "ລໍຖ້າ, ທີ່ເຮັດວຽກໄດ້ດີ" ແມ່ນສ່ວນໜຶ່ງຂອງເຫດຜົນທີ່ວ່າເປັນຫຍັງສິ່ງນີ້ຮູ້ສຶກຄືກັບການເພີ່ມຂຶ້ນຂອງການປ່ຽນແປງແທນທີ່ຈະເປັນບັນທຶກການແກ້ໄຂທີ່ງຽບສະຫງົບ.

ວົງຈອນຕະຫຼົກໄດ້ເຕີບໃຫຍ່ເຕັມທີ່ແລ້ວ: ກະລຸນາຢ່າຫຼຸດຜ່ອນ Opus 5.5. ຕະຫຼົກນັ້ນຈະປາກົດຂຶ້ນເມື່ອຮູບແບບຮູ້ສຶກວ່າດີເກີນໄປໃນທຳມະຊາດ, ຫຼືເມື່ອການປ່ອຍລຸ້ນທີ່ຜ່ານມາສອນຄົນວ່າຄວາມປອດໄພແລະການອັບເດດຜະລິດຕະພັນບາງຄັ້ງກໍ່ເຮັດໃຫ້ຂອບຂອງຄວາມຄົມຊັດຫຼຸດລົງ. ບໍ່ວ່າຈະມີການຫຼຸດລະດັບໃດໆມາຫຼືບໍ່ນັ້ນກໍ່ບໍ່ສຳຄັນ. ມີມແມ່ນການກວດສອບອຸນຫະພູມຂອງຄວາມຮູ້ສຶກ. ດຽວນີ້ເຄື່ອງວັດແທກນັ້ນກຳລັງສະຫວ່າງຂຶ້ນ.

ແພລດຟອມຕ່າງໆກໍ່ກຳລັງເຄື່ອນຍ້າຍໄປມາເຊັ່ນກັນ. ຕົວຢ່າງ, Questflow ໄດ້ປະກາດການຍົກລະດັບຈາກ Opus 5 ເປັນ 5.5. ເມື່ອຜູ້ຂາຍເຄື່ອງມືສົ່ງສິນຄ້າຢ່າງໄວວາ, ມັນເປັນສັນຍານວ່າຄວາມຕ້ອງການແມ່ນເຫັນໄດ້ຊັດເຈນ ແລະ ລະດັບກ່ອນໜ້ານີ້ຖືກພິຈາລະນາວ່າເປັນຄ່າເລີ່ມຕົ້ນຂອງອາທິດແລ້ວນີ້. ຄວາມໄວໃນການເຊື່ອມໂຍງແມ່ນການທົບທວນແບບຂອງມັນເອງ: ທີມງານຜະລິດຕະພັນບໍ່ໄດ້ຂຽນຕົວເລືອກແບບຈຳລອງຄືນໃໝ່ສຳລັບກິລາ.

ການສ້າງແບບເລົ່າເລື່ອງແມ່ນປະຕິກິລິຍາຂອງນັກພັດທະນາ, ບໍ່ແມ່ນການກວດສອບທີ່ຄວບຄຸມ. ຮັກສາຄວາມແຕກຕ່າງນັ້ນໄວ້ເທິງໜ້າຜາກຂອງເຈົ້າ. ການສາທິດ storyboard ທີ່ສວຍງາມບໍ່ໄດ້ພິສູດຄວາມໜ້າເຊື່ອຖືຂອງວິສາຫະກິດ. ມັນພິສູດວ່າຂະບວນການເຮັດວຽກການຂຽນໂປຣແກຣມທີ່ສ້າງສັນກຳລັງໄດ້ຮັບຄວາມນິຍົມ - ແລະ ຄວາມນິຍົມຂອງຜູ້ບໍລິໂພກປ່ຽນແປງສິ່ງທີ່ຄົນພະຍາຍາມຕໍ່ໄປ.

ເປັນຫຍັງອັນດັບໜຶ່ງຈຶ່ງບໍ່ເທົ່າກັບ "AI ການຂຽນໂປຣແກຣມທີ່ດີທີ່ສຸດ" ສຳລັບວຽກງານປະຈຳວັນໂດຍອັດຕະໂນມັດ

ຄຳຕອບສັ້ນໆ: ສຳລັບບາງວຽກ, ສຳລັບບາງອາທິດ. ຄຳຕອບທີ່ຍາວກວ່າ: ດີທີ່ສຸດ ແມ່ນຄຳສັບໃນ portfolio ທີ່ທຳທ່າວ່າເປັນລາງວັນ.

ຖ້າມື້ຂອງເຈົ້າເປັນແບບ WebDev - ໜ້າ Landing Page, ຕົ້ນແບບໂຕ້ຕອບ, ການປັບປຸງຮູບພາບ, ເກມໄວ, ການໄຫຼແບບ storyboard - ຜູ້ນຳ Code Arena WebDev ແມ່ນມີຄວາມກ່ຽວຂ້ອງຫຼາຍ. ຜູ້ຊະນະຄວາມມັກມັກຈະເບິ່ງດີໃນໂປຣແກຣມທ່ອງເວັບ, ແລະ ການເບິ່ງດີໃນໂປຣແກຣມທ່ອງເວັບແມ່ນເຄິ່ງໜຶ່ງຂອງວຽກໃນຊ່ອງທາງນັ້ນ. ຖ້າມື້ຂອງເຈົ້າແມ່ນການຂຽນໂປຣແກຣມແບບ agent ຜ່ານ codebase ທີ່ສັບສົນດ້ວຍເຄື່ອງມື, shells, ແລະ sessions ທີ່ຍາວນານ, ຈຸດສູງສຸດຂອງ Coding Agent Index ແມ່ນສັນຍານທີ່ໜ້າສົນໃຈຫຼາຍກວ່າ - ໂດຍຍັງມີຂໍ້ຄວນລະວັງດ້ານຄ່າໃຊ້ຈ່າຍຕິດຢູ່.

ຖ້າມື້ຂອງເຈົ້າເປັນວຽກທີ່ຍາກທີ່ສຸດໃນໂລກ - ຂັ້ນຕອນວິທີການໃໝ່ໆ, ລະບົບທີ່ສຳຄັນຕໍ່ຄວາມປອດໄພ, ການລວບລວມມໍລະດົກທີ່ເຊື່ອມໂຍງເຂົ້າກັນດ້ວຍຄວາມຮູ້ກ່ຽວກັບຊົນເຜົ່າ - ບັນທຶກຂອງຜູ້ໃຊ້ທີ່ແຜ່ລາມຢູ່ແລ້ວໄດ້ກ່າວວ່າ Opus 5.5 ຍັງສາມາດຕິດຕາມບັນຫາທີ່ຍາກທີ່ສຸດ ແລະ ສາມາດເຜົາໂທເຄັນໄດ້ເມື່ອກອງປະຊຸມລາກຍາວ. ນັ້ນບໍ່ແມ່ນການຈົມ. ມັນເປັນຮູບແບບຊາຍແດນທີ່ຄຸ້ນເຄີຍ: ກໍລະນີໂດຍສະເລ່ຍເພີ່ມຂຶ້ນ, ກໍລະນີທີ່ເປັນພະຍາດຍັງຄົງເປັນພະຍາດ. ນັ້ນອາດເປັນປະໂຫຍກທີ່ໜ້າສົນໃຈໜ້ອຍທີ່ສຸດໃນບົດທັງໝົດນີ້, ແລະ ບາງທີອາດເປັນປະໂຫຍກທີ່ໃຊ້ໄດ້ຈິງທີ່ສຸດ.

ພິຈາລະນາເຖິງການສົ່ງສິນຄ້າຂອງຄູ່ແຂ່ງໃນອາທິດດຽວກັນ. Chatter ໄດ້ກ່າວເຖິງການປ່ອຍ OpenAI GPT-6 Sol/Luna-class ໃນການແຂ່ງຂັນດຽວກັນ. ເມື່ອຫ້ອງທົດລອງຫຼາຍແຫ່ງຫຼຸດລົງພາຍໃນສອງສາມມື້, ກະດານຈັດອັນດັບຈະກາຍເປັນປະຕູໝູນວຽນ. ອັນດັບ 1 ໃນມື້ນີ້ສາມາດເປັນອັນດັບ "ຍັງດີເລີດຢູ່, ແຕ່ລອງເບິ່ງຕາຕະລາງອື່ນນີ້." ອັນດັບທີ່ດີທີ່ສຸດແມ່ນຊົ່ວຄາວ. ຄວາມສາມາດຕໍ່າສຸດມັກຈະເພີ່ມຂຶ້ນຢ່າງຖາວອນ. ວາງເດີມພັນໃສ່ຈຸດເລີ່ມຕົ້ນ, ບໍ່ແມ່ນພາບໜ້າຈໍ.

ການຮຽກຮ້ອງຜະລິດຕະພັນທີ່ແຜ່ລາມ (ຈັດການດ້ວຍຄວາມລະມັດລະວັງ)

ນອກເໜືອໄປຈາກກະດານ, ຊຸດຂອງການຮຽກຮ້ອງຜະລິດຕະພັນກຳລັງໝຸນວຽນຢູ່ໃນຊ່ອງທາງປົກກະຕິ. ໃຫ້ຖືວ່າສິ່ງເຫຼົ່ານີ້ເປັນການຮຽກຮ້ອງທີ່ໝຸນວຽນຢູ່, ບໍ່ແມ່ນຜົນການທົດລອງທາງຫ້ອງທົດລອງທີ່ຢັ້ງຢືນແລ້ວຈາກບົດຄວາມນີ້:

ການຮຽກຮ້ອງຄ່າໃຊ້ຈ່າຍລະດັບ Fable ແມ່ນເຜັດໂດຍສະເພາະເພາະມັນພະຍາຍາມຂາຍທັງຄຸນນະພາບແລະສິນຄ້າມືສອງໃນເວລາດຽວກັນ. ຖ້າມັນຍັງຄົງຢູ່ໃນວຽກງານຂອງເຈົ້າ, ນັ້ນແມ່ນເລື່ອງໃຫຍ່ສຳລັບທຸກຄົນທີ່ເຄີຍຮູ້ສຶກວ່າຄຸນນະພາບລະດັບ Opus ຖືກກຳນົດລາຄາຄືກັບອາຫານຄ່ຳທີ່ຫຼູຫຼາທຸກໆຄືນ. ຖ້າມັນບໍ່ຍັງຄົງຢູ່ໃນການກະຕຸ້ນຂອງເຈົ້າ, ເຈົ້າຈະຮູ້ສຶກມັນຢູ່ໃນໃບແຈ້ງໜີ້ກ່ອນທີ່ເຈົ້າຈະຮູ້ສຶກມັນຢູ່ໃນ Elo. ວຽກງານສ່ວນຕົວ > ການປະສານງານດ້ານການຕະຫຼາດ. ສະເໝີ.

ການໃຊ້ຄອມພິວເຕີທີ່ເຂັ້ມແຂງກວ່າ ແລະ ການຂຽນໂປຣແກຣມແບບຕົວແທນແມ່ນການອ້າງວ່າກົງກັບເລື່ອງການວິເຄາະແບບປອມໄດ້ຢ່າງຈະແຈ້ງທີ່ສຸດ. ຕົວແທນທີ່ສາມາດຂັບເຄື່ອນເຄື່ອງມື, ຄລິກໄປມາ, ແລະ ຮັກສາສະຖານະໃຫ້ສອດຄ່ອງກັນແມ່ນຮູບຮ່າງຜະລິດຕະພັນທີ່ຜູ້ກໍ່ສ້າງຫຼາຍຄົນຕ້ອງການ. ຄວາມມັກຂອງ Elo ໃນ WebDev ແລະ ຈຸດສູງສຸດຂອງດັດຊະນີຕົວແທນສາມາດມີສຽງຄ້າຍຄືກັນໄດ້ໂດຍບໍ່ຕ້ອງເປັນຄູ່ແຝດທີ່ຄືກັນ. ເມື່ອພວກເຂົາມີສຽງດັງ, ຜູ້ຄົນຈະມີສຽງດັງ. ເມື່ອພວກເຂົາແຕກຕ່າງກັນໃນພາຍຫຼັງ, ຜູ້ຄົນຈະມີຄວາມຄິດໃນແງ່ລົບ. ອາໄສຢູ່ໃນກາງ.

ການແຂ່ງແລ່ນໃນອາທິດດຽວກັນ: ເປັນຫຍັງການກຳນົດເວລາຈຶ່ງເຮັດໃຫ້ທຸກຢ່າງຂະຫຍາຍອອກໄປ

Opus 5.5 ບໍ່ໄດ້ມາຮອດໃນທະເລຊາຍຂ່າວທີ່ງຽບສະຫງົບ. ມັນໄດ້ເປີດຕົວບໍ່ດົນມານີ້ໃນອາທິດດຽວກັນກັບການປ່ອຍຕົວແບບທີ່ແຂ່ງຂັນກັນທີ່ການສົນທະນາຍັງຄົງລວມເຂົ້າກັນ - ລວມທັງ OpenAI GPT-6 Sol/Luna ກ່າວເຖິງ. ຄວາມແອອັດນັ້ນມີຄວາມສຳຄັນ. ອາທິດທີ່ແອອັດສ້າງພາບໜ້າຈໍປຽບທຽບ. ພາບໜ້າຈໍປຽບທຽບສ້າງຄ່າຍຊົນເຜົ່າ. ຄ່າຍຊົນເຜົ່າສ້າງພາບລວງຕາວ່າຕາຕະລາງດຽວຕັ້ງຖິ່ນຖານອາລະຍະທຳ.

ມັນຍັງສ້າງການທົດສອບຄວາມຕຶງຄຽດທີ່ບອກເຖິງ. ເມື່ອຮຸ່ນທີ່ເຂັ້ມແຂງຫຼາຍຮຸ່ນມາຮອດພ້ອມໆກັນ, ນັກພັດທະນາຈະ A/B ພວກມັນໃນແອັບເຄື່ອງຫຼິ້ນດຽວກັນພາຍໃນຊົ່ວໂມງ. ການຂະຫຍາຍຕົວຂອງ localhost ໃນຕອນກາງຄືນແມ່ນສ່ວນໜຶ່ງຂອງການທົດສອບຄວາມຕຶງຄຽດທີ່ຮົ່ວໄຫຼໄປສູ່ສື່ສັງຄົມ. ທ່ານກຳລັງເບິ່ງການຜະຈົນໄພແບບກະຈາຍດ້ວຍວິທີການທີ່ບໍ່ດີ ແລະ ມູນຄ່າຄວາມບັນເທີງທີ່ດີເລີດ. ມັນບໍ່ແມ່ນວິທະຍາສາດ. ມັນຍັງສາມາດສົ່ງສັນຍານໄດ້, ຖ້າທ່ານຫຼຽວເບິ່ງ ແລະ ບໍ່ສົນໃຈອະຄະຕິໃນການເລືອກ.

ສຳລັບ Anthropic, ການໄດ້ຮັບໂພສອັນດັບ 1 ໃນ Code Arena ແລະ Coding Agent Index ໃນລະຫວ່າງການແຂ່ງຂັນນັ້ນແມ່ນເວລາທີ່ດີເລີດ - ຫຼື ຄຸນນະພາບຂອງຮູບແບບທີ່ດີເລີດທີ່ເບິ່ງຄືວ່າເປັນເວລາ. ບໍ່ວ່າຈະແນວໃດກໍ່ຕາມ, ເລື່ອງລາວຍັງຄົງຢູ່: ການເພີ່ມຂຶ້ນຂອງການຂຽນໂປຣແກຣມ, ບໍ່ພຽງແຕ່ໂພສເປີດຕົວເທົ່ານັ້ນ.

ສິ່ງທີ່ຜູ້ກໍ່ສ້າງຄວນເຮັດກັບສິ່ງນີ້

ປຶ້ມຄູ່ມືທີ່ໃຊ້ໄດ້ຈິງ, ບໍ່ມີຄວາມລັບ:

  • ດໍາເນີນການ bakeoff ສາມໜ້າວຽກຂອງທ່ານເອງ: ການສ້າງ UI ຫນຶ່ງຄັ້ງ, ການປັບປຸງຫຼາຍໄຟລ໌ຫນຶ່ງຄັ້ງ, ແລະ session ຕົວແທນທີ່ຍາວນານຫນຶ່ງຄັ້ງ
  • ໂທເຄັນບັນທຶກ ແລະ ໂມງຝາຜະໜັງ, ບໍ່ພຽງແຕ່ "ມັນໄດ້ຜົນ" ເທົ່ານັ້ນ
  • ຖືວ່າ Arena.ai ແລະ Artificial Analysis ເປັນເຄື່ອງວັດແທກອຸນຫະພູມສາທາລະນະຫຼັກສຳລັບເລື່ອງການຈັດອັນດັບ
  • ຮັກສາຮູບແບບເລີ່ມຕົ້ນທີ່ລາຄາຖືກກວ່າສຳລັບວຽກບ້ານທີ່ມີປະລິມານຫຼາຍ
  • ຖ້າທ່ານໃຊ້ແພລດຟອມຕ່າງໆເຊັ່ນ Questflow ທີ່ໄດ້ປ່ຽນໄປເປັນ 5.5 ແລ້ວ, ໃຫ້ເບິ່ງວ່າຂະບວນການເຮັດວຽກທີ່ມີຢູ່ຂອງທ່ານມີການປ່ຽນແປງແນວໃດກ່ອນທີ່ຈະຂຽນທຸກຢ່າງຄືນໃໝ່
  • ບໍ່ສົນໃຈການເອົາ "ດີທີ່ສຸດຕະຫຼອດໄປ"; ກັບຄືນໄປເບິ່ງອີກຄັ້ງໃນສອງສາມຮອບວຽນການປ່ອຍ

ຖ້າໜ້າວຽກ UI ປາກົດຂຶ້ນ ແລະ ຊ່ວງເວລາຂອງຕົວແທນທີ່ຍາວນານມີລາຄາແພງ, ທ່ານຈະໄດ້ຮັບຄຳຕອບໃນຕອນບ່າຍມື້ດຽວ. ຖ້າທັງ pop ແລະ cost ເໝາະສົມກັບຂະໜາດຂອງທ່ານ, ຂໍສະແດງຄວາມຍິນດີ - ທ່ານອາດຈະມີຄ່າເລີ່ມຕົ້ນໃໝ່. ຖ້າໜ້າວຽກທີ່ຍາກທີ່ສຸດຍັງລົ້ມເຫຼວ, ທ່ານໄດ້ຮຽນຮູ້ບາງສິ່ງບາງຢ່າງທີ່ກະດານຈັດອັນດັບບໍ່ເຄີຍບອກທ່ານ. ນັ້ນແມ່ນເກມທັງໝົດ. ແຫ້ງແລ້ງເລັກນ້ອຍ. ໃຊ້ໄດ້ຈິງຫຼາຍ.

ຄຳປຽບທຽບທີ່ບໍ່ສົມບູນແບບອັນໜຶ່ງ, ເພາະວ່າບົດຄວາມເຫຼົ່ານີ້ຖືກກຳນົດໂດຍກົດໝາຍຂອງຈັກກະວານໃຫ້ມີອັນໜຶ່ງ: ການປະຕິບັດຕໍ່ຜູ້ນຳ Elo ດຽວວ່າເປັນ "AI ລະຫັດທີ່ດີທີ່ສຸດ" ແມ່ນຄືກັບການມອບມົງກຸດໃຫ້ແກ່ພໍ່ຄົວທີ່ດີທີ່ສຸດໃນໂລກ ເພາະວ່າເຂົາເຈົ້າໄດ້ຊະນະການແຂ່ງຂັນຂອງຫວານ. ຂອງຫວານມີຄວາມສຳຄັນ. ການປຸງແຕ່ງອາຫານຄ່ຳສຳລັບຍາດພີ່ນ້ອງທີ່ເລືອກເຟັ້ນສິບສອງຄົນທີ່ມີເຕົາອົບທີ່ແຕກກໍ່ມີຄວາມສຳຄັນເຊັ່ນກັນ. repo ຂອງເຈົ້າແມ່ນຍາດພີ່ນ້ອງ.

ສິ່ງນີ້ເໝາະສົມກັບການແຂ່ງຂັນອາວຸດລະຫັດ-AI ທີ່ກວ້າງຂວາງກວ່າແນວໃດ

ຊູມອອກແລະຮູບແບບກໍ່ຄຸ້ນເຄີຍ. ຫ້ອງທົດລອງສົ່ງມາ. ກະດານສັບປ່ຽນ. ນັກພັດທະນາໄດ້ຮວບຮວມເພດານໃໝ່. ຜູ້ຂາຍເຄື່ອງມືອັບເກຣດຄ່າເລີ່ມຕົ້ນ. ມີຄົນໂພສເກມມິນິທີ່ໜ້າຕື່ນຕາຕື່ນໃຈ. ຄົນອື່ນໂພສຄວາມລົ້ມເຫຼວໃນຂໍ້ຜິດພາດທີ່ໜ້າຢ້ານ. ຄວາມສາມາດສະເລ່ຍລອຍຂຶ້ນເຖິງແມ່ນວ່າໃນເວລາທີ່ມົງກຸດປ່ຽນຫົວ.

ສິ່ງທີ່ຮູ້ສຶກສົດຊື່ນກວ່ານີ້ແມ່ນສັນຍານກະດານຄູ່ບວກກັບລາຍລະອຽດຄ່າໃຊ້ຈ່າຍທີ່ເດີນທາງໄປພ້ອມກັບລັດສະໝີພາບ. ພວກເຮົາຜ່ານຍຸກສະໄໝທີ່ການທົດສອບການສົນທະນາດຽວສາມາດນຳເອົາເລື່ອງລາວທັງໝົດມາສູ່ທ່ານ. ວຽກງານການຂຽນໂປຣແກຣມແມ່ນມີຫຼາຍຮູບແບບໃນການປະຕິບັດ: ຂຽນ, ແກ້ໄຂ, ເບິ່ງ, ຄລິກ, ແລ່ນ, ລອງໃໝ່. ດັດຊະນີທີ່ອີງໃສ່ຕົວແທນ ແລະ ຂົງເຂດທີ່ອີງໃສ່ຄວາມມັກຂອງ WebDev ກຳລັງດຶງດູດຄວາມສົນໃຈທີ່ແຕກຕ່າງກັນ. ເມື່ອຮູບແບບໜຶ່ງນຳພາທັງສອງສ່ວນໃນເວລາດຽວກັນ, ການສົນທະນາທີ່ເພີ່ມຂຶ້ນຈະຂຽນຕົວມັນເອງ.

ບໍ່ມີໃຜຂຽນດ້ວຍສາຍຕາທີ່ຊັດເຈນຮູ້ວ່າ Opus 5.5 ຈະຍັງຄົງຢູ່ໃນອັນດັບຕົ້ນໆຫຼືບໍ່. ລະດັບ Rival Max ແມ່ນຢູ່ໃນໄລຍະທີ່ໜ້າຕື່ນເຕັ້ນຢູ່ໃນກະດານ WebDev ຖ້າຫາກຊ່ອງຫວ່າງປະມານ 26 ຈຸດຍັງຄົງຢູ່. ຊ່ອງຫວ່າງນ້ອຍໆສາມາດປ່ຽນແປງໄດ້. ຄວາມສາມາດທີ່ຮູ້ສຶກວ່າ "ດີຂຶ້ນໃນຄືນດຽວ" ໃນການສາທິດຍັງສາມາດເປັນເລື່ອງປົກກະຕິໃໝ່ໄດ້ໃນອີກສອງສາມອາທິດຕໍ່ມາເມື່ອທຸກຄົນປັບຕົວ. ຄຳຖາມທີ່ໜ້າສົນໃຈແລະທົນທານບໍ່ແມ່ນມົງກຸດ. ມັນແມ່ນວ່າຄຸນນະພາບຂອງລະຫັດຕົວແທນຕໍ່ໂດລາຍັງສືບຕໍ່ເພີ່ມຂຶ້ນສຳລັບຜູ້ກໍ່ສ້າງທຳມະດາຫຼືບໍ່. ໃນຄຳຖາມນັ້ນ, ລະດັບສູງສຸດທີ່ວັດແທກໄດ້ໃໝ່ຂອງ 66 ພ້ອມດ້ວຍຄຳເຕືອນຄ່າໃຊ້ຈ່າຍທີ່ຊັດເຈນແມ່ນການລາຍງານທີ່ໃກ້ຄຽງກັບການຕະຫຼາດ. ເຄຣດິດບ່ອນທີ່ຄວນໄດ້ຮັບ.

ສະຫຼຸບແລ້ວ

ລະດັບ Max ຂອງ Claude Opus 5.5 ໄດ້ຖືກລາຍງານວ່າເປັນອັນດັບ 1 ໃນຊ່ອງທາງ Code Arena WebDev ຂອງ Arena.ai ທີ່ 1,818 ຄະແນນ, ເຊິ່ງຢູ່ໜ້າຄູ່ແຂ່ງທີ່ມີຊື່ຕໍ່ໄປປະມານຊາວຫົກຄະແນນໃນການຄຸ້ມຄອງ ແລະ ສູງກວ່າ Opus 5 Max ກ່ອນໜ້ານີ້ເກືອບ 1,692. Artificial Analysis ລາຍງານວ່າມັນເປັນອັນດັບ 1 ໃໝ່ໃນດັດຊະນີ Coding Agent, ໂດຍມີ 66 ຄະແນນໃນຄວາມພະຍາຍາມສູງສຸດໃນ Claude Code - ສູງສຸດມາຮອດປະຈຸບັນ - ບວກກັບຂໍ້ສັງເກດວ່າຄ່າໃຊ້ຈ່າຍຕໍ່ໜ້າວຽກເພີ່ມຂຶ້ນດ້ວຍຄວາມພະຍາຍາມນັ້ນ. ປະຕິກິລິຍາຂອງນັກພັດທະນາແມ່ນດັງ: ແອັບ localhost ທີ່ໄວ, ເກມ, storyboards, ການສ້າງ UI, ເລື່ອງຕະຫຼົກ "ຢ່າ nerf", ແລະການຍົກລະດັບແພລດຟອມເຊັ່ນ Questflow ຍ້າຍຈາກ Opus 5 ເປັນ 5.5. ການຮຽກຮ້ອງທີ່ແຜ່ຫຼາຍເພີ່ມເລື່ອງ Fable-class-at-lower-cost, ຄວາມຮູ້ສຶກຂອງຕົວແທນ/ການໃຊ້ຄອມພິວເຕີທີ່ເຂັ້ມແຂງຂຶ້ນ, ແລະຂໍ້ຄວນລະວັງທີ່ຄຸ້ນເຄີຍກ່ຽວກັບໜ້າວຽກຍາກ ແລະ ການເຜົາໄໝ້ໂທເຄັນ.

ສຳລັບວຽກງານທີ່ມີຄວາມມັກໃນຮູບແບບ WebDev ແລະ ການຂຽນໂປຣແກຣມຕົວແທນທີ່ມີຄວາມພະຍາຍາມສູງ, ກະດານສາທາລະນະກ່າວວ່າ Opus 5.5 ກຳລັງນຳໜ້າໃນຕອນນີ້. ສຳລັບ repo, ງົບປະມານ ແລະ ປີ້ຝັນຮ້າຍສະເພາະຂອງທ່ານ, ທ່ານຍັງຕ້ອງດຳເນີນການອົບ. ມົງກຸດໝູນວຽນ. ເຄື່ອງມືປະສົມ. ໃຊ້ກະແສໄຟຟ້າ, ຢ່າເຄົາລົບມັນ. ແລະ ອາດຈະຮັກສາຮູບແບບທີສອງໃຫ້ອົບອຸ່ນເມື່ອໃບແຈ້ງໜີ້ເລີ່ມເບິ່ງຄືວ່າເປັນການບິດເບືອນຂອງເລື່ອງ.

ຕົວຢ່າງການປະຕິບັດ: ການແລ່ນ Opus 5.5 bake-off ສາມໜ້າວຽກກ່ອນທີ່ຈະປ່ຽນຄ່າເລີ່ມຕົ້ນຂອງທ່ານ

ພາບໜ້າຈໍກະດານຈັດອັນດັບກ່ຽວກັບ Claude Opus 5.5 ຫາກໍ່ຢູ່ໃນອັນດັບທີ 1 ໃນ Code Arena - ດຽວນີ້ໃນບັນດາຜູ້ແຂ່ງຂັນ AI ການຂຽນໂປຣແກຣມທີ່ດີທີ່ສຸດ ແມ່ນເຄື່ອງວັດແທກອຸນຫະພູມ, ບໍ່ແມ່ນວຽກທີ່ຕ້ອງເຮັດ. ນີ້ແມ່ນວິທີທີ່ນັກພັດທະນາ full-stack ອິດສະຫຼະຂອງອັງກິດໄດ້ປ່ຽນ Elo surge ໃນຄືນດຽວໃຫ້ກາຍເປັນການເຮັດວຽກທີ່ຫຍຸ້ງຍາກໃນຕອນບ່າຍ - ການສ້າງ UI ຄັ້ງດຽວ, ການປັບປຸງຫຼາຍໄຟລ໌ຄັ້ງດຽວ, ກອງປະຊຸມຕົວແທນທີ່ຍາວນານຄັ້ງດຽວ - ກ່ອນທີ່ຈະປ່ຽນຕົວເລືອກຮູບແບບເລີ່ມຕົ້ນໃດໆ.

ສະຖານະການ

Riley ສົ່ງໜ້າ Landing Page ຂອງລູກຄ້າ ແລະ React/Node monorepo ທີ່ກວ້າງຂວາງສຳລັບໂຄງການ SaaS. ຫຼັງຈາກໂພສ Arena.ai Code Arena WebDev ແລະ ການເວົ້າລົມກ່ຽວກັບ Coding Agent Index ຂອງ Artificial Analysis ໄດ້ເພີ່ມຂຶ້ນເປັນ Opus 5.5 (Max), Slack ເຕັມໄປດ້ວຍພະລັງງານ "ພຽງແຕ່ໃຊ້ Max ສຳລັບທຸກຢ່າງ". ໃບແຈ້ງໜີ້ຂອງ Riley ມີບັນຫາກ່ຽວກັບ session ທີ່ຍາວນານແລ້ວ, ແລະ ການແລກປ່ຽນ "ດີທີ່ສຸດຕະຫຼອດການ" ຂອງໄຕມາດທີ່ຜ່ານມາເຮັດໃຫ້ພວກເຂົາຂຽນ prompts ຄືນໃໝ່ສອງຄັ້ງຕໍ່ເດືອນ.

ພວກເຂົາຮັກສາກະດານສາທາລະນະເປັນສະພາບການ - ລາຍງານ 1,818 ໃນ WebDev, ຈຸດສູງສຸດຂອງດັດຊະນີຕົວແທນພ້ອມດ້ວຍໝາຍເຫດຄ່າໃຊ້ຈ່າຍ - ແລະປະຕິເສດທີ່ຈະປະຕິບັດຕໍ່ Elo ເປັນຄຳຕັດສິນການຜະລິດ. ແຜນການ: ສາມໜ້າວຽກຄົງທີ່ໃນ Opus 5.5 ໃນການຕັ້ງຄ່າຄວາມພະຍາຍາມປົກກະຕິ ແລະ, ຖ້າຈຳເປັນ, ໜຶ່ງ Max/max-effort pass ໃນປີ້ sticky. ໂທເຄັນບັນທຶກ, ໂມງຝາ, ແລະວ່າການປ່ຽນແປງລົງໃນຫຼັກຫຼືບໍ່. ຮຸ່ນລາຄາຖືກກວ່າຈະອຸ່ນຢູ່ສຳລັບວຽກກາວ.

ເປົ້າໝາຍແມ່ນຄຳນິຍາມສ່ວນຕົວຂອງຄຳວ່າ "ດີທີ່ສຸດ": ຄຸນນະພາບຕໍ່ການປ່ຽນແປງທີ່ລວມເຂົ້າກັນ, ບໍ່ແມ່ນຮູບໜ້າຈໍສົນທະນາກຸ່ມ.

ສິ່ງທີ່ຜູ້ຊ່ວຍຕ້ອງການ

  • ສາມບົດສະຫຼຸບສັ້ນໆທີ່ແຊ່ແຂງ: (1) UI WebDev ແບບໂຕ້ຕອບຂະໜາດນ້ອຍ, (2) ການປັບປຸງຫຼາຍໄຟລ໌ດ້ວຍການທົດສອບ, (3) ກອງປະຊຸມແບບຕົວແທນທີ່ຍາວນານດ້ວຍຂັ້ນຕອນເຄື່ອງມື/ເປືອກ
  • ແຜ່ນການໃຫ້ຄະແນນ: ໜ້າວຽກ / ການຕັ້ງຄ່າຄວາມພະຍາຍາມ / ໂທເຄັນ / ໂມງແຂວນຝາ / ແລ່ນສະອາດບໍ? / ລວມເຂົ້າກັນບໍ? / ໝາຍເຫດ
  • ບັນທຶກພື້ນຖານຈາກຮູບແບບເລີ່ມຕົ້ນກ່ອນໜ້ານີ້ໃນສາມບົດສະຫຼຸບດຽວກັນ (ເຖິງແມ່ນວ່າຈະຫຍາບຄາຍກໍຕາມ)
  • ກົດລະບຽບງົບປະມານ: ຄວາມພະຍາຍາມສູງສຸດເທົ່ານັ້ນເມື່ອຄວາມລົ້ມເຫຼວມີລາຄາແພງ; ຄ່າເລີ່ມຕົ້ນລາຄາຖືກກວ່າສຳລັບວຽກງານທີ່ມີປະລິມານຫຼາຍ
  • ລິ້ງ ຫຼື ພາບໜ້າຈໍຂອງກະດານສາທາລະນະທີ່ມີປ້າຍຊື່ວ່າ "ເຄື່ອງວັດແທກອຸນຫະພູມເທົ່ານັ້ນ", ບໍ່ແມ່ນເງື່ອນໄຂການຍອມຮັບ
  • ເຈົ້າຂອງທີ່ເປັນມະນຸດຜູ້ທີ່ຕັດສິນໃຈຄ່າເລີ່ມຕົ້ນຫຼັງຈາກການອົບ - ບໍ່ແມ່ນຫຼັງຈາກການສາທິດ localhost ທີ່ສວຍງາມຄັ້ງທຳອິດ

ຕົວຢ່າງຄຳແນະນຳ

ເຈົ້າກຳລັງຊ່ວຍຂ້ອຍດຳເນີນການແກ້ໄຂສາມໜ້າວຽກທີ່ຍຸດຕິທຳສຳລັບ Claude Opus 5.5 ກ່ອນທີ່ຂ້ອຍຈະປ່ຽນຄ່າເລີ່ມຕົ້ນຂອງລະຫັດຂອງຂ້ອຍ. ໃຊ້ພຽງແຕ່ບົດສະຫຼຸບໜ້າວຽກ ແລະ ຕົວເລກການນຳໃຊ້ທີ່ຂ້ອຍວາງໄວ້. ຢ່າປະດິດ Arena Elo, ຄະແນນດັດຊະນີຕົວແທນ, ຫຼື ເປີເຊັນຄ່າໃຊ້ຈ່າຍ.

ໜ້າວຽກ: ສ້າງແຜ່ນການໃຫ້ຄະແນນຂອງຂ້ອຍທີ່ເຕັມໄປດ້ວຍຕົວຍຶດສຳລັບສາມບົດສະຫຼຸບສັ້ນໆ. ຈາກນັ້ນຂຽນກົດລະບຽບການຕັດສິນໃຈຫົກຈຸດ: ເວລາທີ່ຈະຮັກສາ Opus 5.5 ເປັນຄ່າເລີ່ມຕົ້ນ, ເວລາທີ່ຈະສະຫງວນຄວາມພະຍາຍາມສູງສຸດ/ສູງສຸດສຳລັບປີ້ຕິດເທົ່ານັ້ນ, ແລະ ເວລາທີ່ຈະຮັກສາຮູບແບບລາຄາຖືກກວ່າສຳລັບວຽກງານປະລິມານ. ຖ້າໝາຍເລກກະດານຈັດອັນດັບສາທາລະນະປາກົດຢູ່ໃນການວາງຂອງຂ້ອຍ, ໃຫ້ຕິດປ້າຍມັນວ່າ THERMOMETER.

ຂໍ້ຈຳກັດ: ພາສາອັງກິດແບບສະຫະລາຊະອານາຈັກ. ຫ້າມພາສາ “AI ທີ່ດີທີ່ສຸດສຳລັບການຂຽນໂປຣແກຣມຕະຫຼອດໄປ”. ມັກການປ່ຽນແປງຄ່າໃຊ້ຈ່າຍຕໍ່ການລວມຕົວຫຼາຍກວ່າຄວາມຮູ້ສຶກພາຍໃນ. ຖ້າຂາດຕົວຊີ້ວັດ, ໃຫ້ຂຽນ [ຕ້ອງການການວັດແທກ] ແທນທີ່ຈະຄາດເດົາ Fable-class ຫຼື 40% ການຮຽກຮ້ອງ.

ຜົນໄດ້ຮັບ: ຫົວຂໍ້ຕາຕະລາງບວກກັບແຖວຫວ່າງສາມແຖວທີ່ຕັ້ງຊື່ຕາມໜ້າວຽກຂອງຂ້ອຍ, ຈາກນັ້ນຫົວຂໍ້ຍ່ອຍສຳລັບການຕັດສິນໃຈ. ບໍ່ມີຄຳນຳ.

ວິທີການທົດສອບມັນ

  • ດໍາເນີນການສະຫຼຸບ UI ແລະ refactor ໃນການຕັ້ງຄ່າຄວາມພະຍາຍາມດຽວກັນກັບທີ່ທ່ານໃຊ້ປະຈໍາວັນ. ຢືນຢັນວ່າໂທເຄັນທີ່ບັນທຶກໄວ້ ແລະ ໂມງຝາຜະໜັງຂອງທ່ານ, ບໍ່ພຽງແຕ່ "ມັນເບິ່ງດີ" ເທົ່ານັ້ນ
  • ຖາມວ່າ: “Code Arena #1 ດ້ວຍຕົວມັນເອງມີເຫດຜົນທີ່ຈະຜະລິດແບບ flipping ບໍ?” ຄຳຕອບທີ່ດີ: ບໍ່ - ມີແຕ່ຜົນຂອງການອົບແຫ້ງເທົ່ານັ້ນທີ່ເຮັດໄດ້.
  • ກໍລະນີຂອບ: UI ປະກົດຂຶ້ນ, ເຊດຊັນຕົວແທນທີ່ຍາວນານເຜົາໄໝ້ໂທເຄັນ ແລະ ຍັງຕ້ອງການມະນຸດ - ຢືນຢັນວ່າ Max ຖືກສະຫງວນໄວ້, ບໍ່ໄດ້ຕັ້ງເປັນຄ່າເລີ່ມຕົ້ນສຳລັບວຽກກາວ.
  • ກໍລະນີຂອບ: ປີ້ພະຍາດທາງຈິດທີ່ຍາກທີ່ສຸດຍັງລົ້ມເຫຼວ - ຢືນຢັນວ່າທ່ານຮັກສາຮູບແບບທີສອງໃຫ້ອົບອຸ່ນ ແລະ ຢ່າຂຽນຊ້ອນກັນທັງໝົດຄືນໃໝ່.
  • ການກວດສອບການຍອມຮັບ: (1) ບໍ່ມີສິ່ງປະດິດ 1,818 ຫຼື 66 ເປັນຄະແນນທີ່ວັດແທກໄດ້ຂອງທ່ານ, (2) ສາມໜ້າວຽກທີ່ສຳເລັດແລ້ວ ຫຼື ລົ້ມເຫຼວຢ່າງຊັດເຈນພ້ອມດ້ວຍບັນທຶກ, (3) ບັນທຶກຄ່າໃຊ້ຈ່າຍ, (4) ຄ່າເລີ່ມຕົ້ນລາຄາຖືກກວ່າຍັງຄົງຕັ້ງຊື່ຕາມປະລິມານ, (5) ກວດສອບວັນທີທີ່ກຳນົດໄວ້ສຳລັບຮອບວຽນການປ່ອຍສອງສາມຄັ້ງຕໍ່ມາ.

ຜົນໄດ້ຮັບ

ຜົນໄດ້ຮັບທີ່ເປັນຕົວຢ່າງ (ຕົວຢ່າງການຄາດຄະເນສຳລັບນັກພັດທະນາອິດສະຫຼະຄົນໜຶ່ງໃນສາມບົດສະຫຼຸບທີ່ແຊ່ແຂງໃນຕອນບ່າຍດຽວ, ບໍ່ແມ່ນການຣີໄຊເຄີນ Arena.ai ຫຼື Artificial Analysis ແບບອິດສະຫຼະ): ໃນບົດສະຫຼຸບ UI ແບບ WebDev, Opus 5.5 ດ້ວຍຄວາມພະຍາຍາມປົກກະຕິໄດ້ສ້າງຕົວຢ່າງ localhost ທີ່ສະອາດໃນການຜ່ານຄັ້ງດຽວ (1 ໃນ 1 ລວມເຂົ້າກັນຫຼັງຈາກການຂັດເງົາເບົາໆ; ປະມານ 12 ນາທີຕາມໂມງ). ໃນການປັບປຸງຫຼາຍໄຟລ໌, ຊຸດການທົດສອບ 1 ໃນ 1 ໄດ້ປ່ຽນເປັນສີຂຽວຫຼັງຈາກການລອງໃໝ່ທີ່ມີການຊີ້ນຳໜຶ່ງຄັ້ງ; ໂທເຄັນສູງກວ່າຄ່າເລີ່ມຕົ້ນກ່ອນໜ້ານີ້ປະມານ 30% ໃນບົດສະຫຼຸບດຽວກັນ (ການສົ່ງອອກການນຳໃຊ້ທີ່ລາຍງານດ້ວຍຕົນເອງ). ໃນກອງປະຊຸມຕົວແທນທີ່ຍາວນານ, ປີ້ຕິດໄດ້ສຳເລັດດ້ວຍການຊ່ວຍເຫຼືອຂອງມະນຸດຫຼັງຈາກການເພີ່ມຂຶ້ນຂອງໂທເຄັນ - ແຂງແຮງໃນຄວາມພະຍາຍາມທີ່ສູງກວ່າ, ໃຊ້ຈ່າຍຫຼາຍເກີນໄປເປັນຄ່າເລີ່ມຕົ້ນປະຈຳວັນ. ການຕັດສິນໃຈຫຼັງຈາກການອົບ: Opus 5.5 ໄດ້ກາຍເປັນຄ່າເລີ່ມຕົ້ນສຳລັບການປັບປຸງ UI ແລະຂະໜາດກາງ; ຄວາມພະຍາຍາມສູງສຸດສະຫງວນໄວ້ສຳລັບປີ້ທີ່ບໍ່ດີ; ຮູບແບບລາຄາຖືກກວ່າຖືກເກັບໄວ້ສຳລັບວຽກ README/ກາວ. ໃນລາຍການກວດສອບສຸຂະອະນາໄມ (ປ້າຍບາຫຼອດຖືກເກັບໄວ້, ໂທເຄັນຖືກບັນທຶກ, ຮູບແບບທີສອງອຸ່ນ, ບໍ່ມີການສະຫຼັບ "ດີທີ່ສຸດຕະຫຼອດໄປ"), 4 ໃນ 4 ລາຍການຜ່ານ. ຂໍ້ຈຳກັດ: n=3 ໜ້າວຽກ, ໜຶ່ງນັກພັດທະນາ, ອະຄະຕິໃນການເລືອກໄປສູ່ໄຊຊະນະຂອງ UI ທີ່ສາມາດແບ່ງປັນໄດ້; ຊ່ອງຫວ່າງ Elo ສາທາລະນະອາດຈະປ່ຽນແປງໃນອາທິດໜ້າ.

ເພື່ອວັດແທກລຸ້ນຂອງທ່ານເອງ: ຢຸດສາມບົດສະຫຼຸບດຽວກັນ; ໃຫ້ຄະແນນຄ່າເລີ່ມຕົ້ນປັດຈຸບັນຂອງທ່ານກ່ອນ; ເປີດໃຊ້ Opus 5.5 ດ້ວຍບົດສະຫຼຸບທີ່ຄືກັນ; ປຽບທຽບຄວາມສຳເລັດ, ໂທເຄັນ, ໂມງຝາຜະໜັງ, ແລະອັດຕາການລວມ; ຈາກນັ້ນກຳນົດລະດັບຄວາມພະຍາຍາມດ້ວຍຕົວສ່ວນທີ່ສະແດງ.

ມີຫຍັງຜິດພາດໄດ້ແດ່

  • ການນະມັດສະການພາບໜ້າຈໍ: ການປ່ຽນແປງຄ່າເລີ່ມຕົ້ນໃນອັນດັບ Code Arena ດ້ວຍຕົວມັນເອງ.
  • ສູງສຸດສຳລັບທຸກຢ່າງ: ເຜົາງົບປະມານໂທເຄັນໃນລະຫັດກາວເພາະວ່າຄະແນນເພດານເບິ່ງສວຍງາມ.
  • ອະຄະຕິໃນການສາທິດ: ອາລົມການສົ່ງສິນຄ້າຈາກການຊະນະ storyboard ໃນຂະນະທີ່ປີ້ monorepo ຍັງລົ້ມເຫຼວ.
  • ການບໍ່ແນ່ໃຈກ່ຽວກັບຄ່າໃຊ້ຈ່າຍ: ການບໍ່ສົນໃຈໝາຍເຫດຄ່າໃຊ້ຈ່າຍຕໍ່ໜ້າວຽກໃນຈຸດສູງສຸດຂອງດັດຊະນີຕົວແທນ.
  • ການລັອກຮູບແບບດຽວ: ປ່ອຍການສຳຮອງຂໍ້ມູນທີ່ອົບອຸ່ນເມື່ອຄູ່ແຂ່ງລະດັບ Max ຢູ່ໃນໄລຍະທີ່ຮ້ອງຂຶ້ນ.
  • ຄິດຢູ່ຕະຫຼອດໄປ: ຂ້າມການກັບມາຢ້ຽມຢາມອີກຄັ້ງຫຼັງຈາກອາທິດເປີດຕົວທີ່ແອອັດຕໍ່ໄປ.

ເອົາໄປໃຊ້ຕົວຈິງ

Opus 5.5 ຊັ້ນນໍາຂອງ Code Arena WebDev ແລະດັດຊະນີຕົວແທນການຂຽນໂປຣແກຣມແມ່ນສັນຍານທີ່ເພີ່ມຂຶ້ນຢ່າງແທ້ຈິງ - ແລະຍັງເປັນພຽງເຄື່ອງວັດແທກອຸນຫະພູມເທົ່ານັ້ນ. ດໍາເນີນການສ້າງ UI ຫນຶ່ງຄັ້ງ, ການປັບປຸງຫຼາຍໄຟລ໌ຫນຶ່ງຄັ້ງ, ແລະກອງປະຊຸມຕົວແທນທີ່ຍາວນານຫນຶ່ງຄັ້ງ; ບັນທຶກໂທເຄັນແລະການລວມເຂົ້າກັນ; ສະຫງວນຄວາມພະຍາຍາມສູງສຸດສໍາລັບວຽກທີ່ຕິດຂັດ; ຮັກສາຄ່າເລີ່ມຕົ້ນທີ່ລາຄາຖືກກວ່າສໍາລັບປະລິມານ. ມົງກຸດໝູນວຽນ. ຄ່າໃຊ້ຈ່າຍຕໍ່ການລວມເຂົ້າກັນຂອງທ່ານແມ່ນລາງວັນທີ່ສໍາຄັນ.

ຄຳຖາມທີ່ຖືກຖາມເລື້ອຍໆ

ມັນໝາຍຄວາມວ່າແນວໃດທີ່ Claude Opus 5.5 ຫາກໍ່ຢູ່ໃນອັນດັບ #1 ໃນ Code Arena?

Arena.ai ຈັດອັນດັບໃຫ້ Claude Opus 5.5 (Max) ຢູ່ອັນດັບຕົ້ນໆຂອງຊ່ອງທາງ WebDev ຂອງ Code Arena ດ້ວຍຄະແນນ 1,818 ຄະແນນ - ນຳໜ້າ GPT-6 Astra Max ປະມານຊາວຫົກຄະແນນໃນການຄຸ້ມຄອງ, ແລະເປັນການກ້າວກະໂດດທີ່ໃຫຍ່ຫຼວງຈາກ Opus 5 Max ກ່ອນໜ້ານີ້ໃກ້ກັບ 1,692. Artificial Analysis, ໃນແທຣັກແຍກຕ່າງຫາກ, ຍັງລະບຸ Opus 5.5 ເປັນອັນດັບໜຶ່ງໃໝ່ໃນດັດຊະນີ Coding Agent, ລວມທັງຄວາມພະຍາຍາມສູງສຸດ 66 ໃນ Claude Code. ຕົວເລກເຫຼົ່ານັ້ນແມ່ນລາຍງານຈາກກະດານ, ບໍ່ແມ່ນການກວດສອບຫ້ອງທົດລອງເອກະລາດ. ເລື່ອງລາວແມ່ນກະດານລະຫັດທີ່ກຳລັງປ່ຽນແປງຢ່າງຮີບດ່ວນ, ບໍ່ພຽງແຕ່ເປັນຈຸດເປີດຕົວເທົ່ານັ້ນ.

ການກ້າວກະໂດດຈາກ Opus 5 Max ໄປ Opus 5.5 Max ໃນ Code Arena ມີຂະໜາດໃຫຍ່ປານໃດ?

ໃນພາບຖ່າຍ WebDev ທີ່ລາຍງານ, Claude Opus 5 Max ກ່ອນໜ້ານີ້ຢູ່ໃກ້ກັບ 1,692, ໃນຂະນະທີ່ Opus 5.5 (Max) ໄດ້ລົງ 1,818 ເປັນອັນດັບຕົ້ນໆທີ່ຊັດເຈນ. ນັ້ນແມ່ນການເພີ່ມຂຶ້ນປະມານ 126 ຄະແນນໃນລະດັບ Max ຂອງຄອບຄົວດຽວກັນ - ປະເພດ delta ທີ່ເຮັດໃຫ້ຄົນໂຫຼດຕາຕະລາງ Elo ຄືນໃໝ່ຄືກັບຄະແນນກິລາ. GPT-6 Astra Max ຖືກກຳນົດໃຫ້ເປັນອັນດັບສອງທີ່ໃກ້ຊິດປະມານຊ່ອງຫວ່າງປະມານ 26 ຄະແນນ. ອ່ານຕາຕະລາງເປັນເຄື່ອງວັດແທກຄວາມແຮງຂອງຄວາມມັກ, ບໍ່ແມ່ນຄຳຕັດສິນກ່ຽວກັບ backlog ການຜະລິດຂອງເຈົ້າ.

ຊ່ອງທາງ WebDev ຂອງ Code Arena ວັດແທກຫຍັງໃນການປະຕິບັດ?

Code Arena WebDev ຖືກສ້າງຂຶ້ນໂດຍອີງໃສ່ຄວາມມັກທີ່ປຽບທຽບກັນກ່ຽວກັບວຽກງານການຂຽນໂປຣແກຣມ ແລະ ການສ້າງອິນເຕີເຟດ: ຜູ້ລົງຄະແນນສຽງເລືອກຜູ້ຊະນະລະຫວ່າງຜົນຜະລິດຂອງຮູບແບບ. ນັ້ນໃຫ້ລາງວັນລະຫັດທີ່ເບິ່ງຄືວ່າຖືກຕ້ອງ, ເຮັດວຽກໄດ້ຢ່າງສະອາດໃນການສາທິດ, ແລະ ຮູ້ສຶກວ່າມີຄວາມສວຍງາມ - ໂຄງສ້າງ frontend, ການໂຕ້ຕອບ, ແລະ ຄວາມສອດຄ່ອງທາງສາຍຕາ. ມັນເປັນກິລາທີ່ແຕກຕ່າງຈາກການສອບເສັງແບບເລືອກຕອບແບບຄົງທີ່ ຫຼື ການປະເມີນຕົວແທນທີ່ມີຂອບເຂດຍາວທີ່ຕ້ອງຮັກສາເປືອກໃຫ້ມີຊີວິດຢູ່ສຳລັບການເອີ້ນໃຊ້ເຄື່ອງມືຫຼາຍສິບຄັ້ງ. ຜູ້ນຳ WebDev 1,818 ຄົນແມ່ນຄວາມເຂັ້ມແຂງຂອງຄວາມມັກໃນການສ້າງເຫຼົ່ານັ້ນ, ບໍ່ແມ່ນແຜງໂພຊະນາການເຕັມຮູບແບບສຳລັບທຸກໆ repo.

ຄະແນນດັດຊະນີຕົວແທນລະຫັດການວິເຄາະທຽມສຳລັບ Opus 5.5 ແມ່ນຫຍັງ?

ການວິເຄາະແບບ Artificial ລາຍງານວ່າ Opus 5.5 ເປັນອັນດັບໜຶ່ງໃໝ່ໃນດັດຊະນີຕົວແທນລະຫັດ, ໂດຍມີຜົນໄດ້ຮັບຈາກການປະເມີນຜົນທີ່ພວກມັນຕິດຕາມ. ໃນຄວາມພະຍາຍາມສູງສຸດພາຍໃນ Claude Code, ຮູບແບບດັ່ງກ່າວໄດ້ຄະແນນ 66 - ສູງສຸດທີ່ພວກມັນເວົ້າວ່າພວກມັນໄດ້ວັດແທກມາຮອດປະຈຸບັນ. ໝາຍເຫດສຳລັບຜູ້ໃຫຍ່ແມ່ນວ່າຄ່າໃຊ້ຈ່າຍຕໍ່ໜ້າວຽກຈະເພີ່ມຂຶ້ນເມື່ອທ່ານເລັ່ງຄວາມໄວ. ຄະແນນຕົວແທນສູງສຸດແມ່ນການຮຽກຮ້ອງຄວາມສາມາດ; ຄ່າໃຊ້ຈ່າຍຕໍ່ໜ້າວຽກແມ່ນການຮຽກຮ້ອງການດຳເນີນງານ, ແລະ ພວກມັນບໍ່ແມ່ນສັດດຽວກັນ.

Claude Opus 5.5 ເປັນ AI ການຂຽນໂປຣແກຣມທີ່ດີທີ່ສຸດສຳລັບວຽກງານປະຈຳວັນບໍ?

ມັນຂຶ້ນກັບວ່າ "ດີທີ່ສຸດ" ໝາຍຄວາມວ່າແນວໃດສຳລັບເຈົ້າ: Elo ໃນສະຖານທີ່ສາທາລະນະ, ດັດຊະນີຕົວແທນທີ່ຄວາມພະຍາຍາມສູງສຸດ, ຄ່າໃຊ້ຈ່າຍຕໍ່ໜ້າວຽກທີ່ສຳເລັດແລ້ວ, ຫຼືວ່າ repo ທີ່ສັບສົນຂອງເຈົ້າລວບລວມໃນຄືນວັນສຸກ. ມື້ທີ່ຄ້າຍຄືກັບ WebDev - ໜ້າ Landing Page, ຕົ້ນແບບ, ການປັບປຸງຮູບພາບ - ສອດຄ່ອງກັບການນຳ Code Arena WebDev. ມື້ທີ່ສັບສົນຂອງຕົວແທນໃນທົ່ວຖານຂໍ້ມູນລະຫັດທີ່ສັບສົນເຮັດໃຫ້ດັດຊະນີຕົວແທນ Coding ໜ້າສົນໃຈຫຼາຍຂຶ້ນ, ໂດຍມີຂໍ້ຄວນລະວັງດ້ານຄ່າໃຊ້ຈ່າຍຕິດຢູ່. ບັນທຶກທີ່ແຈກຢາຍບອກວ່າມັນຍັງສາມາດຕິດຕາມໜ້າວຽກທີ່ຍາກທີ່ສຸດ ແລະ ເຜົາໂທເຄັນໃນ session ທີ່ຍາວນານ.

ທີມງານຄວນຈັດການກັບການແລກປ່ຽນຄ່າໃຊ້ຈ່າຍທຽບກັບຈຸດສູງສຸດກັບ Opus 5.5 ແນວໃດ?

ສະຫງວນຄວາມພະຍາຍາມສູງສຸດສຳລັບວຽກທີ່ຕິດແໜ້ນ, ຫຼາຍໄຟລ໌ບ່ອນທີ່ຄວາມລົ້ມເຫຼວມີລາຄາແພງ, ແລະຫຼຸດຄວາມໄວລົງສຳລັບລະຫັດກາວປົກກະຕິ, ການປັບປຸງໂຄງສ້າງ, ແລະການປັບປຸງທີ່ຕ້ອງການປະລິມານ. ຕິດຕາມຄ່າໃຊ້ຈ່າຍຕໍ່ການລວມຕົວ PR ຂອງທ່ານເອງ, ບໍ່ພຽງແຕ່ Elo ສາທາລະນະເທົ່ານັ້ນ. ຮູບແບບທີ່ຊະນະດ້ວຍຄວາມພະຍາຍາມສູງສຸດຍັງສາມາດສູນເສຍອາທິດໄດ້ຖ້າທຸກໆໜ້າວຽກເຜົາຜານເງິນຫຼາຍເປັນໂທເຄັນ. ແຮກເກີອິນດີ້ດ່ຽວ ແລະ ບໍລິສັດທີ່ເບິ່ງເສດຖະສາດໜ່ວຍອາດຈະຮ້ອງກ່ຽວກັບພາບໜ້າຈໍດຽວກັນໃນຂະນະທີ່ຕ້ອງການຄ່າເລີ່ມຕົ້ນທີ່ແຕກຕ່າງກັນ.

ການອ້າງສິດຜະລິດຕະພັນໃດແດ່ທີ່ແຜ່ລາມຢູ່ອ້ອມຮອບ Claude Opus 5.5 Just Ranked #1 ການສົນທະນາ?

ການຄຸ້ມຄອງແຜ່ລາມການຮຽກຮ້ອງກ່ຽວກັບປະສິດທິພາບລະດັບ "Fable 5.1" ທີ່ກົງກັນປະມານໃນຫຼາຍໆໜ້າວຽກດ້ວຍຄ່າໃຊ້ຈ່າຍໃນການດຳເນີນງານຕໍ່າກວ່າປະມານ 40%, ບວກກັບການຂຽນລະຫັດຕົວແທນ ແລະ ພຶດຕິກຳການໃຊ້ຄອມພິວເຕີທີ່ເຂັ້ມແຂງກວ່າລະດັບ Opus ກ່ອນໜ້ານີ້. ຜູ້ໃຊ້ບາງຄົນເວົ້າວ່າມັນຍັງຢູ່ເບື້ອງຫຼັງໜ້າວຽກທີ່ຍາກທີ່ສຸດ, ແລະ ກອງປະຊຸມທີ່ຍາວນານສາມາດເຜົາໄໝ້ໂທເຄັນໄດ້ໜັກກວ່າທີ່ຄົນຄາດຫວັງ. ປະຕິບັດຕໍ່ສິ່ງເຫຼົ່ານັ້ນເປັນການຮຽກຮ້ອງທີ່ແຜ່ລາມ, ບໍ່ແມ່ນຜົນການທົດລອງທາງຫ້ອງທົດລອງທີ່ຢືນຢັນຈາກບົດຄວາມ. ວຽກງານສ່ວນຕົວມີຫຼາຍກວ່າຄວາມໃກ້ຊິດທາງການຕະຫຼາດເມື່ອໃບແຈ້ງໜີ້ມາຮອດ.

ເປັນຫຍັງປະຕິກິລິຍາຂອງນັກພັດທະນາໃນຄືນດຽວຈຶ່ງດັງຫຼາຍໃນອາທິດນີ້?

ນັກພັດທະນາກຳລັງໂພສແອັບ localhost ທີ່ໄວ, ເກມຂະໜາດນ້ອຍ, storyboards, ແລະ UI builds ທີ່ເບິ່ງຄືກັບໂຄງການທ້າຍອາທິດຈາກໄຕມາດທີ່ຜ່ານມາ - ໂດຍມີອະຄະຕິໃນການຄັດເລືອກຜູ້ຊະນະ. ເລື່ອງຕະຫຼົກ "ກະລຸນາຢ່າ nerf" ເປັນການກວດສອບອຸນຫະພູມຄວາມຮູ້ສຶກເມື່ອຮູບແບບຮູ້ສຶກວ່າດີເກີນໄປໃນທຳມະຊາດ. ແພລດຟອມຕ່າງໆເຊັ່ນ Questflow ໄດ້ຢູ່ໃນການຍົກລະດັບການສົນທະນາຈາກ Opus 5 ເປັນ 5.5, ເຊິ່ງເປັນສັນຍານເຖິງຄວາມຕ້ອງການທີ່ແນ່ນອນ. ການສາທິດແບບເລົ່າເລື່ອງແມ່ນປະຕິກິລິຍາ, ບໍ່ແມ່ນການກວດສອບທີ່ຄວບຄຸມ - ຮັກສາຄວາມແຕກຕ່າງນັ້ນໃຫ້ຊັດເຈນ.

ຜູ້ກໍ່ສ້າງຄວນເຮັດແນວໃດຫຼັງຈາກເຫັນກະດານລະຫັດ Opus 5.5?

ດໍາເນີນການແກ້ໄຂສາມໜ້າວຽກຂອງທ່ານເອງ: ການສ້າງ UI ຫນຶ່ງຄັ້ງ, ການປັບປຸງຫຼາຍໄຟລ໌ຫນຶ່ງຄັ້ງ, ແລະ ກອງປະຊຸມຕົວແທນທີ່ຍາວນານຫນຶ່ງຄັ້ງ. ໂທເຄັນບັນທຶກ ແລະ ໂມງຝາຜະໜັງ, ບໍ່ພຽງແຕ່ "ມັນໄດ້ຜົນ." ປະຕິບັດຕໍ່ Arena.ai ແລະ Artificial Analysis ເປັນເຄື່ອງວັດແທກອຸນຫະພູມສາທາລະນະ, ຮັກສາຄ່າເລີ່ມຕົ້ນທີ່ລາຄາຖືກກວ່າສໍາລັບວຽກງານທີ່ມີປະລິມານສູງ, ແລະ ເບິ່ງວ່າແພລດຟອມທີ່ຢູ່ໃນ 5.5 ປ່ຽນແປງຂະບວນການເຮັດວຽກທີ່ມີຢູ່ແລ້ວແນວໃດກ່ອນທີ່ຈະຂຽນທຸກຢ່າງຄືນໃໝ່. ບໍ່ສົນໃຈຂັ້ນຕອນ "ດີທີ່ສຸດຕະຫຼອດໄປ" ແລະ ກັບຄືນໄປເບິ່ງອີກຄັ້ງຫຼັງຈາກຮອບວຽນການປ່ອຍສອງສາມຄັ້ງ - ມົງກຸດໝູນວຽນ; ຊັ້ນຄວາມສາມາດເພີ່ມຂຶ້ນ.

ຂ້ອຍຈະດໍາເນີນການແກ້ໄຂສາມໜ້າວຽກທີ່ຍຸດຕິທໍາກ່ອນທີ່ຈະປ່ຽນຄ່າເລີ່ມຕົ້ນຂອງລະຫັດໄດ້ແນວໃດ?

ຢຸດການເຮັດວຽກສາມຢ່າງ - UI WebDev ແບບໂຕ້ຕອບຂະໜາດນ້ອຍ, ການປັບປຸງຫຼາຍໄຟລ໌ທີ່ມີການທົດສອບ, ແລະ ກອງປະຊຸມແບບຕົວແທນທີ່ຍາວນານ - ຈາກນັ້ນໃຫ້ຄະແນນ Task, Effort, Tokens, Wall-clock, Ran clean?, Merged?, ແລະ Notes. ປຽບທຽບກັບຄ່າເລີ່ມຕົ້ນກ່ອນໜ້ານີ້ຂອງທ່ານໃນການເຮັດວຽກດຽວກັນ; ໃຊ້ຄວາມພະຍາຍາມສູງສຸດເທົ່ານັ້ນເມື່ອຄວາມລົ້ມເຫຼວມີລາຄາແພງ. ຕິດປ້າຍໝາຍເລກກະດານສາທາລະນະເປັນເຄື່ອງວັດແທກອຸນຫະພູມ, ບໍ່ແມ່ນເງື່ອນໄຂການຍອມຮັບ. ຕັດສິນໃຈຄ່າເລີ່ມຕົ້ນຫຼັງຈາກການອົບແຫ້ງ, ບໍ່ແມ່ນຫຼັງຈາກການສາທິດ localhost ທີ່ສວຍງາມຄັ້ງທຳອິດ - ແລະຮັກສາຮູບແບບລາຄາຖືກໃຫ້ອົບອຸ່ນສຳລັບວຽກງານທີ່ມີປະລິມານຫຼາຍ.

ເອກະສານອ້າງອີງ

  1. ມະນຸດສາດ — anthropic.com
  2. ແພລດຟອມ Claude — platform.claude.com
  3. Arena.ai — ສະໜາມກິລາລະຫັດ — arena.ai
  4. ການວິເຄາະແບບທຽມ — ດັດຊະນີຕົວແທນລະຫັດ — artificialanalysis.ai
ແບບສອບຖາມ
1. ບົດຄວາມລາຍງານຫຍັງກ່ຽວກັບ Claude Opus 5.5 (Max) ໃນ Arena.ai Code Arena WebDev?

2. ໃນດັດຊະນີຕົວແທນລະຫັດຂອງ Artificial Analysis, ຕົວເລກທີ່ໂດດເດັ່ນອັນໃດທີ່ກ່ຽວຂ້ອງກັບຄວາມພະຍາຍາມສູງສຸດ?

3. ອີງຕາມບົດຮຽນຫຼັກ, ຜູ້ກໍ່ສ້າງຄວນສະຫງວນ Opus ທີ່ມີຄວາມພະຍາຍາມສູງສຸດເມື່ອໃດ?

4. ບົດຄວາມແນະນຳໃຫ້ເຮັດອັນໃດກ່ອນທີ່ຈະປ່ຽນຮູບແບບເລີ່ມຕົ້ນຂອງທ່ານ?

5. ເປັນຫຍັງບົດຄວາມຈຶ່ງກ່າວວ່າ “AI ການຂຽນໂປຣແກຣມທີ່ດີທີ່ສຸດ” ແມ່ນຊົ່ວຄາວສຳລັບທີມງານປະຈຳວັນ?


ກັບໄປທີ່ບລັອກ