
Baidu стартира DuMateBench, класация за оценка, предназначена да измерва дали AI агентите могат да изпълняват задачи от реалния свят и да предоставят използваеми резултати, вместо само да генерират отговори. Бенчмаркът включва повече от 200 офис задачи в шест категории и тества ефективността на агента в сложни операционни среди.
DuMateBench оценява разбирането на задачата, използването на инструмента, непрекъснатото изпълнение и предоставянето на крайния резултат. Той използва обща рамка за оценка и отворени интерфейси, така че различни модели и агенти да могат да бъдат тествани по едни и същи критерии, измествайки фокуса от това, което един AI модел може да отговори, към това, което може да завърши и достави. [TechNode reporting]