Навіны штучнага інтэлекту, 29 мая 2026 г

Агляд навін пра штучны інтэлект: 29 мая 2026 г

Скот Ву з Cognition кажа, што агенты кадавання са штучным інтэлектам не павінны замяняць людзей

Скот Ву з Cognition аспрэчыў ідэю, што Devin створаны для таго, каб цалкам замяніць праграмістаў. Трохі няёмкая пазіцыя, улічваючы, што кампанія таксама сцвярджае, што Devin піша вялікую долю ўласнага кода.

Яго фармулёўка хутчэй нагадвае «сябар-праграміст па штучным інтэлекце», чым «тваю працу з'еў гоблін-ноўтбук». Тым не менш, напружанне цяжка не заўважыць — лепшыя агенты, менш апраўданняў для раздутых інжынерных каманд... ці, прынамсі, так сцвярджаецца.

Гэты стартап са штучным інтэлектам будзе бясплатна прыбіраць ваш дом, каб навучыць будучых робатаў

Shift прапануе бясплатную ўборку дома, але з адной зручнай і трохі трывожнай загвоздкай: прыбіральшчыкі апранаюць «чароўны капялюш» з камерай, каб кампанія магла збіраць дадзеныя аб навучанні робатаў.

Ідэя простая: вы атрымліваеце чыстую кватэру, яны — відэа з хатнімі справамі. Магчыма, выгадная здзелка.

Shift сцвярджае, што гэта размывае канфідэнцыйныя дэталі і ананімізуе відэазапісы, але больш шырокае пытанне ўсё яшчэ ляжыць пад канапай: наколькі хатняй прыватнасцю людзі гатовыя памяняць дзеля зручнасці?

Anthropic выпускае Claude Opus 4.8

Anthropic выпусціла Claude Opus 4.8 з абнаўленнямі кадавання, агентычных працоўных працэсаў, разважанняў і прафесійнай працы. Галоўная перавага — надзейнасць: менш неабгрунтаваных сцвярджэнняў, лепшае выкарыстанне інструментаў і больш самакантролю.

Клод Код таксама рэалізуе дынамічныя працоўныя працэсы, дазваляючы мадэлі планаваць, запускаць паралельныя субагенты, правяраць вынікі і даваць справаздачы. Гэта гучыць сумна, пакуль вы не зразумееце, што гэта, па сутнасці, кіраванне праектамі ў плашчы.

Цэны застаюцца падзеленымі паміж стандартным і хуткім рэжымамі, прычым Anthropic больш схіляецца да кантролю намаганняў, каб карыстальнікі маглі кампрамісаваць паміж хуткасцю, якасцю і спальваннем токенаў.

Старшыня Foxconn вельмі ўпэўнены ў імпульсе росту дзякуючы штучнаму інтэлекту

Старшыня Foxconn заявіў, што попыт на штучны інтэлект змяняе звычайны сезонны рытм кампаніі. Стары спад пастаўшчыкоў у сярэдзіне года? Відавочна, што ён ужо не паводзіць сябе нармальна.

Прычына — гіганцкія выдаткі воблачных гігантаў на штучны інтэлект, якія Foxconn бачыць як сваю ўласную рынкавую магчымасць. Гэта апаратны бок буму штучнага інтэлекту, менш бліскучы, чым чат-боты, але менавіта там, дзе бразгаюць грошы.

Foxconn ужо з'яўляецца буйным вытворцам сервераў Nvidia, таму яго аптымізм — гэта, па сутнасці, тэмпературны кантроль у гонцы за інфраструктуру штучнага інтэлекту.

Агульны дапаможнік для надзейных ацэнак трэціх бакоў

OpenAI апублікаваў рэкамендацыі па ацэнцы штучнага інтэлекту трэцімі асобамі, сцвярджаючы, што тэсты павінны ўтрымліваць больш падрабязную інфармацыю аб тым, што ацэньвалася, як гэта тэставалася і што могуць даказаць вынікі.

Асноўны момант нечакана практычны: ацэнкі штучнага інтэлекту на мяжы магчымасцей не могуць быць проста здагадкамі ў форме табліцы лідэраў. Ацэншчыкам неабходна растлумачыць правераную сістэму, падказкі, меры бяспекі, праверкі слушнасці і месца, дзе сканчваюцца сцвярджэнні.

Гэта важна, бо па меры таго, як мадэлі становяцца больш агентнымі, павярхоўныя тэсты могуць зрабіць сістэмы больш бяспечнымі або мацнейшымі, чым яны ёсць на самой справе. Невялікая колькасць папяровай працы, вялікія наступствы.

Часта задаваныя пытанні

Ці прызначаны агенты па праграмаванні штучнага інтэлекту, такія як Дэвін, замяніць праграмістаў?

Скот Ву разглядае агентаў па распрацоўцы праграм штучнага інтэлекту як партнёраў па распрацоўцы праграм, а не як паўнавартасную замену праграмістам-людзям. Аднак у артыкуле згадваецца супярэчнасць: Дэвін таксама ўносіць значную частку ўласнага кода Cognition. На практыцы вынік такі: гэтыя інструменты могуць скараціць частку руціннай інжынернай працы, пры гэтым усё яшчэ залежачы ад людзей у пытаннях меркаванняў, кіраўніцтва і адказнасці.

Чаму Shift прапануе бясплатную ўборку дома для атрымання дадзеных для навучання штучнаму інтэлекту?

Shift прапануе бясплатную ўборку дома, бо ім патрэбныя відэададзеныя аб хатніх справах у рэальным свеце для навучання будучых робатаў. Прыбіральшчыкі падчас працы носяць «чароўны капялюш» з камерай, ствараючы відэазапісы, якія могуць дапамагчы сістэмам штучнага інтэлекту зразумець хатнія справы. Абмен відавочны: кліенты атрымліваюць чысты дом, а кампанія атрымлівае дадзеныя з прыватных жылых памяшканняў.

Як Shift абараняе прыватнасць пры зборы відэазапісаў з уборкі дома?

У артыкуле гаворыцца, што Shift сцвярджае, што ён размывае канфідэнцыйныя дэталі і ананімізуе відэазапіс. Гэта можа знізіць некаторыя рызыкі для прыватнасці, але не здымае больш шырокай праблемы з запісам у дамах людзей. Для карыстальнікаў галоўнае пытанне — ці варта зручнасць бясплатнай уборкі такога ўзроўню збору дадзеных.

Што новага ў Claude Opus 4.8?

Абнаўленне Claude Opus 4.8 апісваецца як паляпшэнне кадавання, агентных працоўных працэсаў, разважанняў і прафесійнай працы. У цэнтры ўвагі — надзейнасць, у тым ліку меншая колькасць неабгрунтаваных сцвярджэнняў, больш эфектыўнае выкарыстанне інструментаў і большая самакантроль. Claude Code таксама атрымлівае дынамічныя працоўныя працэсы, дзе мадэль можа планаваць, запускаць паралельныя субагенты, правяраць вынікі і паведамляць аб іх выніках.

Чаму аптымізм Foxconn адносна буму штучнага інтэлекту мае значэнне?

Упэўненасць Foxconn мае значэнне, бо яна адлюстроўвае апаратны бок буму штучнага інтэлекту. Старшыня кампаніі заявіў, што попыт на штучны інтэлект змяняе сваю звычайную сезонную тэндэнцыю, прычым выдаткі хмарных гігантаў на інфраструктуру ствараюць значную рынкавую магчымасць. Паколькі Foxconn ужо з'яўляецца буйным вытворцам сервераў Nvidia, яе каментарыі служаць моцным сігналам аб попыце на інфраструктуру штучнага інтэлекту.

Што, паводле слоў OpenAI, робіць ацэнкі штучнага інтэлекту трэціх бакоў надзейнымі?

OpenAI сцвярджае, што для ацэнкі штучнага інтэлекту патрэбныя больш выразныя тлумачэнні таго, якая сістэма была пратэставана, як яна была пратэставана і што сапраўды дэманструюць вынікі. Гэта ўключае ў сябе падрабязную інфармацыю аб падказках, мерах бяспекі, праверках валіднасці і абмежаваннях любых заяў. Гэты момант асабліва важны для больш агентычных мадэляў, дзе павярхоўныя тэсты могуць зрабіць сістэмы больш бяспечнымі або больш магутнымі, чым яны ёсць на самой справе.

Учорашнія навіны пра штучны інтэлект: 28 мая 2026 г

Знайдзіце найноўшы штучны інтэлект у афіцыйнай краме памочнікаў штучнага інтэлекту

Пра нас

Назад да блога